BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//Allsikt//Article Deadline//EN
CALSCALE:GREGORIAN
METHOD:PUBLISH
BEGIN:VEVENT
UID:57a3b9c96673b86dc968e11225f42880a8b88956@allsikt.tech
DTSTAMP:20260722T142207Z
DTSTART;VALUE=DATE:20260722
DTEND;VALUE=DATE:20260723
SUMMARY:Qwen3.6‑27B NVFP4 on RTX 5090 Achieves ~70 tok/s at 200k Context with vLLM
DESCRIPTION:Configure vLLM with --speculative-config '{"method":"mtp"\,"num_speculative_tokens":3}' and --kv-cache-dtype fp8_e4m3 on RTX 5090 to reach ~70 tok/s at 200k context with 3 speculative tokens.\n\nSource: Reddit r/LocalLLaMA\nOpen: https://allsikt.se/article/qwen3-6-27b-nvfp4-on-rtx-5090-achieves-70-tok-s-at-200k-context-with-vllm-c8998f63
URL:https://allsikt.se/article/qwen3-6-27b-nvfp4-on-rtx-5090-achieves-70-tok-s-at-200k-context-with-vllm-c8998f63
STATUS:CONFIRMED
TRANSP:TRANSPARENT
END:VEVENT
END:VCALENDAR
