BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//Allsikt//Article Deadline//EN
CALSCALE:GREGORIAN
METHOD:PUBLISH
BEGIN:VEVENT
UID:b6b60d041c21a33e41d03c9610520b96d2c3eba5@allsikt.tech
DTSTAMP:20260722T104531Z
DTSTART;VALUE=DATE:20260722
DTEND;VALUE=DATE:20260723
SUMMARY:Increasing Micro‑Batch Size in llama.cpp Boosts Prompt Processing for gpt‑oss‑120b‑F16.gguf on RTX 3090
DESCRIPTION:Increase llama.cpp micro‑batch size (-ub) up to 8192 and set --n‑cpu‑moe to 28 on RTX 3090 to boost prompt processing from ~380 to ~2091 tok/s\, accepting a ~7 % drop in generation speed.\n\nSource: Reddit r/LocalLLaMA\nOpen: https://allsikt.se/article/increasing-micro-batch-size-in-llama-cpp-boosts-prompt-processing-for-gpt-oss-120b-f16-gguf-on-rtx-3090-813b00c5
URL:https://allsikt.se/article/increasing-micro-batch-size-in-llama-cpp-boosts-prompt-processing-for-gpt-oss-120b-f16-gguf-on-rtx-3090-813b00c5
STATUS:CONFIRMED
TRANSP:TRANSPARENT
END:VEVENT
END:VCALENDAR
