BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//Allsikt//Article Deadline//EN
CALSCALE:GREGORIAN
METHOD:PUBLISH
BEGIN:VEVENT
UID:68b47094203b5e189d92666bdf24a17c2d4aeabd@allsikt.tech
DTSTAMP:20260722T131447Z
DTSTART;VALUE=DATE:20260722
DTEND;VALUE=DATE:20260723
SUMMARY:DFlash Speculative Decoding Benchmark on vLLM 0.19.2rc1 with Gemma 4‑26B
DESCRIPTION:Configure vLLM with num_speculative_tokens=13 and max_num_batched_tokens=8192 to achieve ~2.56× speedup on RTX 5090 for Gemma 4‑26B.\n\nSource: Reddit r/LocalLLaMA\nOpen: https://allsikt.se/article/dflash-speculative-decoding-benchmark-on-vllm-0-19-2rc1-with-gemma-4-26b-797eadc9
URL:https://allsikt.se/article/dflash-speculative-decoding-benchmark-on-vllm-0-19-2rc1-with-gemma-4-26b-797eadc9
STATUS:CONFIRMED
TRANSP:TRANSPARENT
END:VEVENT
END:VCALENDAR
