BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//Allsikt//Article Deadline//EN
CALSCALE:GREGORIAN
METHOD:PUBLISH
BEGIN:VEVENT
UID:978f4a0e1e3cdba4b6faa0c03e364c593ee73c14@allsikt.tech
DTSTAMP:20260722T104621Z
DTSTART;VALUE=DATE:20260722
DTEND;VALUE=DATE:20260723
SUMMARY:DeepSeek-V4-Flash MTP Self-Speculation Boosts Decode Speed on RTX 6000 Max-Q
DESCRIPTION:Patch vLLM to restore MTP head in DeepSeek-V4-Flash quant\; run on 2x RTX 6000 Max-Q with --disable-custom-all-reduce and NCCL tuning for optimal speed.\n\nSource: Reddit r/LocalLLaMA\nOpen: https://allsikt.se/article/deepseek-v4-flash-mtp-self-speculation-boosts-decode-speed-on-rtx-6000-max-q-bfb662e2
URL:https://allsikt.se/article/deepseek-v4-flash-mtp-self-speculation-boosts-decode-speed-on-rtx-6000-max-q-bfb662e2
STATUS:CONFIRMED
TRANSP:TRANSPARENT
END:VEVENT
END:VCALENDAR
