SEP 6, 2026 · PREPRINT
One Step, One Lead: Mitigating Higher-Order Interference in Multi-Domain Reinforcement Learning via Cross-Step Control
arXiv
This is a methodological contribution from an unreviewed preprint proposing a novel algorithmic approach (OSOL) to a technical problem in multi-domain RL training, demonstrated on one model with controlled experiments but lacking peer review and clinical or real-world validation.
Reported
Domain-macro average performance0.4822
Improvement over strongest baseli…5.7%