CSE Colloquium – Safety Alignment of LMs via Non-cooperative Games

Engineering 2 Engineering 2 1156 High Street, Santa Cruz

Presenter: Arman Zharmagambetov, Meta Abstract: Ensuring the safety of language models (LMs) while maintaining their usefulness remains a critical challenge in AI alignment. Current approaches rely on sequential adversarial training: […]

Free