This is a technical benchmark paper evaluating language models on a simulated task; it reports comparative performance metrics but lacks clinical outcomes, real-world deployment data, or evidence of impact on actual transit systems or user safety.
Hypothesis-GeneratingRemco Hendriks
Reported
Held-out test set size238
Training-data generation set size717
Total benchmark cases955