SEP 4, 2026 · PREPRINT
Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models
arXiv
A computational method paper presenting an algorithmic technique for reducing inference cost in large language models, demonstrated on two proprietary models without peer review, independent validation, or clinical/real-world outcome data.
Reported
MMLU drop (8→4 experts, standard…4.65 points
MMLU drop (8→4 experts, k₂=16)0.35 points
MMLU drop (10→5 experts, Qwen3.5-…0.55 points