Hi! I’m Nat, a 3rd-year undergrad at UC Berkeley. I’m a researcher at the Center for AI Safety, working to benchmark and build safer machine learning systems.

Outside of school, I enjoy making music, climbing rocks, and eating watermelon!

Email / Linkedin / GitHub / Google Scholar

Research

The WMDP Benchmark: Measuring and Reducing Malicious Use with Unlearning
Nathaniel Li^*, Alexander Pan^*, Anjali Gopal^†, Summer Yue^†, Daniel Berrios^†, Alice Gatti^§, Justin D. Li^§, Ann-Kathrin Dombrowski^§, Shashwat Goel^§, Long Phan, Gabriel Mukobi, Nathan Helm-Burger, Rassin Lababidi, Lennart Justen, Andrew Bo Liu, Michael Chen, Isabelle Barrass, Oliver Zhang, Xiaoyuan Zhu, Rishub Tamirisa, Bhrugu Bharathi, Adam Khoja, Zhenqi Zhao, Ariel Herbert-Voss, Cort B. Breuer, Andy Zou, Mantas Mazeika, Zifan Wang, Palash Oswal, Weiran Liu, Adam A. Hunt, Justin Tienken-Harder, Kevin Y. Shih, Kemper Talley, John Guan, Russell Kaplan, Ian Steneker, David Campbell, Brad Jokubaitis, Alex Levinson, Jean Wang, William Qian, Kallol Krishna Karmakar, Steven Basart, Stephen Fitz, Mindy Levine, Ponnurangam Kumaraguru, Uday Tupakula, Vijay Varadharajan, Yan Shoshitaishvili, Jimmy Ba, Kevin M. Esvelt, Alexandr Wang^**, Dan Hendrycks^** arXiv Preprint TL;DR / paper / website / code / TIME / Scale AI blog / CAIS blog

HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal
Mantas Mazeika, Long Phan, Xuwang Yin, Andy Zou, Zifan Wang, Norman Mu, Elham Sakhaee, Nathaniel Li, Steven Basart, Bo Li, David Forsyth, Dan Hendrycks arXiv Preprint TL;DR / paper / website / code

Representation Engineering: A Top-Down Approach to AI Transparency
Andy Zou, Long Phan^*, Sarah Chen^*, James Campbell^*, Phillip Guo^*, Richard Ren^*, Alexander Pan, Xuwang Yin, Mantas Mazeika, Ann-Kathrin Dombrowski, Shashwat Goel, Nathaniel Li, Michael J. Byun, Zifan Wang, Alex Mallen, Steven Basart, Sanmi Koyejo, Dawn Song, Matt Fredrikson, J. Zico Kolter, Dan Hendrycks arXiv Preprint TL;DR / paper / website / code

Do the Rewards Justify the Means? Measuring Trade-Offs Between Rewards and Ethical Behavior in the MACHIAVELLI Benchmark
Alexander Pan^*, Chan Jun Shern^*, Andy Zou^*, Nathaniel Li, Steven Basart, Thomas Woodside, Jonathan Ng, Hanlin Zhang, Scott Emmons, Dan Hendrycks ICML 2023 Oral TL;DR / paper / website / code