Mechanistic study of language model internals using interpretability techniques; demonstrates a phenomenon across architectures but lacks clinical endpoints, real-world deployment evidence, or peer review.
Reported
Architecture families tested4
Jailbreak success reductionreported qualitatively across four families