cmp-170hx-vllm
Known-good vLLM recipe: Qwen3.8-27B-Int8 + MTP speculative decoding on NVIDIA CMP 170HX 64GB (Hynix) — 84 tok/s, 262k ctx
File Explorer
- gdn-prefix-caching-2026-08-23.md
- scope-longctx-ttft-2026-08-23.md
- sm80-int8-repack-cpu-fallback.patch
- vllm-pr50021-full-pr.diff
- vllm-pr50021-gdn-spec-bounds.patch
- bench-comprehensive.py
- booster-ab-test.py
- booster-proxy.py
- prod-cache-cliff.py
- prod-decode-speed.py
- prod-grown-prefix.py
- bench-comprehensive.py
- booster-proxy.py
- booster-watchdog.sh
- boot-recovery.sh
- LICENSE
- README.md
- serve-g3-int8df2.sh
- serve-qwen38-mtp.sh
- serve-qwen38-nightly.sh
# Use via CDN
jsDelivrjsDelivr serves any public GitHub repository as a CDN with zero setup. Pick a version and a file to get a ready-to-paste link and snippet.
Link
Example
// repository documentation
Was this content helpful?
(0 ratings)
