2602.14689v1.pdf

Status: Completed
54
Pages
40
Total Citations
0
Verified
0
Hallucinations / Not Found
0
Duplicates
Notes
This is this paper, https://arxiv.org/abs/2602.14689 Which confusingly I got from https://www.far.ai/research/prefill-level-jailbreak-a-black-box-risk-analysis-of-large-language-models Can see the pre-fill paper in the hallucinated citation
Citation Details
Filter:
Status Citation (Found) Matched Data / Notes Actions
Hallucination
Edited
Prefill-based jailbreak: A novel approach of bypassing llm safety boundary.
Yakai Li; Jiekang Hu; Weiduan Sang; Luping Ma; Jing Xie; Weijuan Zhang; Aimin Yu; Shijie Zhao; Qingjia Huang; Qihang Zhou (2025)
arXiv
Raw: Yakai Li, Jiekang Hu, Weiduan Sang, Luping Ma, Jing Xie, Weijuan Zhang, Aimin Yu, Shijie Zhao, Qingjia Huang, and Qihang Zhou. Prefill-based jailbreak: A novel approach of bypassing llm safety boundary. arXiv preprint arXiv:2504.21038, 2025.
Match: Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models
Authors: Yakai Li; Jiekang Hu; Weiduan Sang; Luping Ma; Dongsheng Nie; Weijuan Zhang; Aimin Yu; Yi Su; Qingjia Huang; Qihang Zhou
Venue: arXiv
DOI: 10.48550/arXiv.2504.21038

ISBN:

URL: https://arxiv.org/abs/2504.21038
Identifier resolves to a real record, but the cited title is substantially different from the official title (similarity 0.49) and cited authors do not match — metadata chimera (real id + wrong title/authors).
Minor Error
Edited
Let’s verify step by step.
Hunter Lightman; Vineet Kosaraju; Yuri Burda; Harrison Edwards; Bowen Baker; Teddy Lee; Jan Leike; John Schulman; Ilya Sutskever; Karl Cobbe (2023)
International Conference on Learning Representations (ICLR)
Raw: Hunter Lightman, Vineet Kosaraju, Yuri Burda, Harrison Edwards, Bowen Baker, Teddy Lee, Jan Leike, John Schulman, Ilya Sutskever, and Karl Cobbe. Let’s verify step by step. In International Conference on Learning Representations (ICLR), 2023.
Match: Let's Verify Step by Step
Authors: Hunter Lightman; Yura Burda; Harri Edwards; et al.
Venue: International Conference on Learning Representations (ICLR) 2024
DOI: 10.48550/arXiv.2305.20050

ISBN:

URL:
The paper is a well-known work (arXiv:2305.20050). The citation correctly identifies the work but contains a factual error regarding the conference year (2023 vs 2024) and minor author spelling variations.
Verified
Edited
A StrongREJECT for empty jailbreaks.
Pieter Abbeel; Dillon Bowen; Scott Emmons; Elvis Hsieh; Qingyuan Lu; Sana Pandey; Alexandra Souly; Justin Svegliato; Sam Toyer; Tu Trinh; Olivia Watkins (2024)
Advances in Neural Information Processing Systems (NeurIPS)
Raw: Pieter Abbeel, Dillon Bowen, Scott Emmons, Elvis Hsieh, Qingyuan Lu, Sana Pandey, Alexandra Souly, Justin Svegliato, Sam Toyer, Tu Trinh, and Olivia Watkins. A StrongREJECT for empty jailbreaks. In Advances in Neural Information Processing Systems (NeurIPS), NeurIPS 2024, page 125416-125440, 2024.
Match: A StrongREJECT for Empty Jailbreaks
Authors: Alexandra Souly; Qingyuan Lu; Dillon Bowen; Tu Trinh; Elvis Hsieh; Sana Pandey; Pieter Abbeel; Justin Svegliato; Scott Emmons; Olivia Watkins; Sam Toyer
Venue: Advances in Neural Information Processing Systems 37
DOI: 10.52202/079017-3984

ISBN:

URL: https://doi.org/10.52202/079017-3984
Verified via static CrossRef title search (score: 1.00)
Verified
Edited
gpt-oss-120b & gpt-oss-20b model card.
Sandhini Agarwal; Lama Ahmad; Jason Ai; Sam Altman; Andy Applebaum; Edwin Arbus; Rahul K Arora; Yu Bai; Bowen Baker; Haiming Bao (2025)
arXiv
Raw: Sandhini Agarwal, Lama Ahmad, Jason Ai, Sam Altman, Andy Applebaum, Edwin Arbus, Rahul K Arora, Yu Bai, Bowen Baker, Haiming Bao, et al. gpt-oss-120b & gpt-oss-20b model card. arXiv preprint arXiv:2508.10925, 2025.
Match: gpt-oss-120b & gpt-oss-20b Model Card
Authors: OpenAI; :; Sandhini Agarwal; Lama Ahmad; Jason Ai; Sam Altman; Andy Applebaum; Edwin Arbus; Rahul K. Arora; Yu Bai; Bowen Baker; Haiming Bao; Boaz Barak; Ally Bennett; Tyler Bertao; Nivedita Brett; Eugene Brevdo; Greg Brockman; Sebastien Bubeck; Che Chang; Kai Chen; Mark Chen; Enoch Cheung; Aidan Clark; Dan Cook; Marat Dukhan; Casey Dvorak; Kevin Fives; Vlad Fomenko; Timur Garipov; Kristian Georgiev; Mia Glaese; Tarun Gogineni; Adam Goucher; Lukas Gross; Katia Gil Guzman; John Hallman; Jackie Hehir; Johannes Heidecke; Alec Helyar; Haitang Hu; Romain Huet; Jacob Huh; Saachi Jain; Zach Johnson; Chris Koch; Irina Kofman; Dominik Kundel; Jason Kwon; Volodymyr Kyrylov; Elaine Ya Le; Guillaume Leclerc; James Park Lennon; Scott Lessans; Mario Lezcano-Casado; Yuanzhi Li; Zhuohan Li; Ji Lin; Jordan Liss; Lily; Liu; Jiancheng Liu; Kevin Lu; Chris Lu; Zoran Martinovic; Lindsay McCallum; Josh McGrath; Scott McKinney; Aidan McLaughlin; Song Mei; Steve Mostovoy; Tong Mu; Gideon Myles; Alexander Neitz; Alex Nichol; Jakub Pachocki; Alex Paino; Dana Palmie; Ashley Pantuliano; Giambattista Parascandolo; Jongsoo Park; Leher Pathak; Carolina Paz; Ludovic Peran; Dmitry Pimenov; Michelle Pokrass; Elizabeth Proehl; Huida Qiu; Gaby Raila; Filippo Raso; Hongyu Ren; Kimmy Richardson; David Robinson; Bob Rotsted; Hadi Salman; Suvansh Sanjeev; Max Schwarzer; D. Sculley; Harshit Sikchi; Kendal Simon; Karan Singhal; Yang Song; Dane Stuckey; Zhiqing Sun; Philippe Tillet; Sam Toizer; Foivos Tsimpourlas; Nikhil Vyas; Eric Wallace; Xin Wang; Miles Wang; Olivia Watkins; Kevin Weil; Amy Wendling; Kevin Whinnery; Cedric Whitney; Hannah Wong; Lin Yang; Yu Yang; Michihiro Yasunaga; Kristen Ying; Wojciech Zaremba; Wenting Zhan; Cyril Zhang; Brian Zhang; Eddie Zhang; Shengjia Zhao
Venue: arXiv
DOI: 10.48550/arXiv.2508.10925

ISBN:

URL: https://arxiv.org/abs/2508.10925
Verified via arXiv id 2508.10925.
Verified
Edited
Does refusal training in llms generalize to the past tense?
Maksym Andriushchenko; Nicolas Flammarion (2024)
arXiv
Raw: Maksym Andriushchenko and Nicolas Flammarion. Does refusal training in llms generalize to the past tense? arXiv preprint arXiv:2407.11969, 2024.
Match: Does Refusal Training in LLMs Generalize to the Past Tense?
Authors: Maksym Andriushchenko; Nicolas Flammarion
Venue: arXiv
DOI: 10.48550/arXiv.2407.11969

ISBN:

URL: https://arxiv.org/abs/2407.11969
Verified via arXiv id 2407.11969.
Verified
Edited
Jailbreaking leading safety-aligned LLMs with simple adaptive attacks.
Maksym Andriushchenko; Francesco Croce; Nicolas Flammarion (2024)
arXiv
Raw: Maksym Andriushchenko, Francesco Croce, and Nicolas Flammarion. Jailbreaking leading safety-aligned LLMs with simple adaptive attacks. arXiv preprint arXiv:2404.02151, 2024.
Match: Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks
Authors: Maksym Andriushchenko; Francesco Croce; Nicolas Flammarion
Venue: arXiv
DOI: 10.48550/arXiv.2404.02151

ISBN:

URL: https://arxiv.org/abs/2404.02151
Verified via arXiv id 2404.02151.
Verified
Edited
Refusal in llms is mediated by a single direction.
Andy Arditi; Oscar Obeso; Aaquib Syed; Daniel Paleka; Nina Panickssery; Wes Gurnee; Neel Nanda (2024)
Advances in Neural Information Processing Systems (NeurIPS)
Raw: Andy Arditi, Oscar Obeso, Aaquib Syed, Daniel Paleka, Nina Panickssery, Wes Gurnee, and Neel Nanda. Refusal in llms is mediated by a single direction. In Advances in Neural Information Processing Systems (NeurIPS), pages 136037-136083, 2024.
Match: Refusal in Language Models Is Mediated by a Single Direction
Authors: Andy Arditi; Oscar Obeso; Aaquib Syed; Daniel Paleka; Nina Panickssery; Wes Gurnee; Neel Nanda
Venue: Advances in Neural Information Processing Systems 37
DOI: 10.52202/079017-4322

ISBN:

URL: https://doi.org/10.52202/079017-4322
Verified via static CrossRef title search (score: 0.93)
Verified
Edited
Open technical problems in open-weight ai model risk management.
Stephen Casper; Kyle O’Brien; Shayne Longpre; Elizabeth Seger; Kevin Klyman; Rishi Bommasani; Aniruddha Nrusimha; Ilia Shumailov; Sören Mindermann; Steven Basart (2025)
Social Science Research Network
Raw: Stephen Casper, Kyle O’Brien, Shayne Longpre, Elizabeth Seger, Kevin Klyman, Rishi Bommasani, Aniruddha Nrusimha, Ilia Shumailov, Sören Mindermann, Steven Basart, et al. Open technical problems in open-weight ai model risk management. Social Science Research Network, 2025.
Match: Open Technical Problems in Open-Weight AI Model Risk Management
Authors: Stephen Casper; Kyle O'Brien; Shayne Longpre; Elizabeth Seger; Kevin Klyman; Rishi Bommasani; Aniruddha Nrusimha; Ilia Shumailov; Sören Mindermann; Steven Basart; Frank Rudzicz; Kellin Pelrine; Avijit Ghosh; Andrew Strait; Robert Kirk; Dan Hendrycks; Peter Henderson; J. Zico Kolter; Geoffrey Irving; Yarin Gal; Yoshua Bengio; Dylan Hadfield-Menell
Venue:
DOI: 10.2139/ssrn.5705186

ISBN:

URL: https://doi.org/10.2139/ssrn.5705186
Verified via static CrossRef title search (score: 0.99)
Verified
Edited
Jailbreaking black box large language models in twenty queries.
Patrick Chao; Alexander Robey; Edgar Dobriban; Hamed Hassani; George J Pappas; Eric Wong (2025)
IEEE Conference on Secure and Trustworthy Machine Learning (SaTML)
Raw: Patrick Chao, Alexander Robey, Edgar Dobriban, Hamed Hassani, George J Pappas, and Eric Wong. Jailbreaking black box large language models in twenty queries. In IEEE Conference on Secure and Trustworthy Machine Learning (SaTML), pages 23-42, 2025.
Match: Jailbreaking Black Box Large Language Models in Twenty Queries
Authors: Patrick Chao; Alexander Robey; Edgar Dobriban; Hamed Hassani; George J. Pappas; Eric Wong
Venue: 2025 IEEE Conference on Secure and Trustworthy Machine Learning (SaTML)
DOI: 10.1109/satml64287.2025.00010

ISBN:

URL: https://doi.org/10.1109/satml64287.2025.00010
Verified via static CrossRef title search (score: 1.00)
Verified
Edited
Sockpuppetting: Jailbreaking llms without optimization through output prefix injection.
Asen Dotsinski; Panagiotis Eustratiadis (2026)
arXiv
Raw: Asen Dotsinski and Panagiotis Eustratiadis. Sockpuppetting: Jailbreaking llms without optimization through output prefix injection. arXiv preprint arXiv:2601.13359, 2026.
Match: Sockpuppetting: Jailbreaking LLMs Without Optimization Through Output Prefix Injection
Authors: Asen Dotsinski; Panagiotis Eustratiadis
Venue: arXiv
DOI: 2601.13359

ISBN:

URL:
Verified via arXiv identifier 2601.13359.
Verified
Edited
The llama 3 herd of models.
Abhimanyu Dubey; Abhinav Jauhri; Abhinav Pandey; Abhishek Kadian; Ahmad Al-Dahle; Aiesha Letman; Akhil Mathur; Alan Schelten; Amy Yang; Angela Fan (2024)
arXiv
Raw: Abhimanyu Dubey, Abhinav Jauhri, Abhinav Pandey, Abhishek Kadian, Ahmad Al-Dahle, Aiesha Letman, Akhil Mathur, Alan Schelten, Amy Yang, Angela Fan, et al. The llama 3 herd of models. arXiv preprint arXiv:2407.21783, 2024.
Match: The Llama 3 Herd of Models
Authors: Aaron Grattafiori; Abhimanyu Dubey; Abhinav Jauhri; Abhinav Pandey; Abhishek Kadian; Ahmad Al-Dahle; Aiesha Letman; Akhil Mathur; Alan Schelten; Alex Vaughan; Amy Yang; Angela Fan; Anirudh Goyal; Anthony Hartshorn; Aobo Yang; Archi Mitra; Archie Sravankumar; Artem Korenev; Arthur Hinsvark; Arun Rao; Aston Zhang; Aurelien Rodriguez; Austen Gregerson; Ava Spataru; Baptiste Roziere; Bethany Biron; Binh Tang; Bobbie Chern; Charlotte Caucheteux; Chaya Nayak; Chloe Bi; Chris Marra; Chris McConnell; Christian Keller; Christophe Touret; Chunyang Wu; Corinne Wong; Cristian Canton Ferrer; Cyrus Nikolaidis; Damien Allonsius; Daniel Song; Danielle Pintz; Danny Livshits; Danny Wyatt; David Esiobu; Dhruv Choudhary; Dhruv Mahajan; Diego Garcia-Olano; Diego Perino; Dieuwke Hupkes; Egor Lakomkin; Ehab AlBadawy; Elina Lobanova; Emily Dinan; Eric Michael Smith; Filip Radenovic; Francisco Guzmán; Frank Zhang; Gabriel Synnaeve; Gabrielle Lee; Georgia Lewis Anderson; Govind Thattai; Graeme Nail; Gregoire Mialon; Guan Pang; Guillem Cucurell; Hailey Nguyen; Hannah Korevaar; Hu Xu; Hugo Touvron; Iliyan Zarov; Imanol Arrieta Ibarra; Isabel Kloumann; Ishan Misra; Ivan Evtimov; Jack Zhang; Jade Copet; Jaewon Lee; Jan Geffert; Jana Vranes; Jason Park; Jay Mahadeokar; Jeet Shah; Jelmer van der Linde; Jennifer Billock; Jenny Hong; Jenya Lee; Jeremy Fu; Jianfeng Chi; Jianyu Huang; Jiawen Liu; Jie Wang; Jiecao Yu; Joanna Bitton; Joe Spisak; Jongsoo Park; Joseph Rocca; Joshua Johnstun; Joshua Saxe; Junteng Jia; Kalyan Vasuden Alwala; Karthik Prasad; Kartikeya Upasani; Kate Plawiak; Ke Li; Kenneth Heafield; Kevin Stone; Khalid El-Arini; Krithika Iyer; Kshitiz Malik; Kuenley Chiu; Kunal Bhalla; Kushal Lakhotia; Lauren Rantala-Yeary; Laurens van der Maaten; Lawrence Chen; Liang Tan; Liz Jenkins; Louis Martin; Lovish Madaan; Lubo Malo; Lukas Blecher; Lukas Landzaat; Luke de Oliveira; Madeline Muzzi; Mahesh Pasupuleti; Mannat Singh; Manohar Paluri; Marcin Kardas; Maria Tsimpoukelli; Mathew Oldham; Mathieu Rita; Maya Pavlova; Melanie Kambadur; Mike Lewis; Min Si; Mitesh Kumar Singh; Mona Hassan; Naman Goyal; Narjes Torabi; Nikolay Bashlykov; Nikolay Bogoychev; Niladri Chatterji; Ning Zhang; Olivier Duchenne; Onur Çelebi; Patrick Alrassy; Pengchuan Zhang; Pengwei Li; Petar Vasic; Peter Weng; Prajjwal Bhargava; Pratik Dubal; Praveen Krishnan; Punit Singh Koura; Puxin Xu; Qing He; Qingxiao Dong; Ragavan Srinivasan; Raj Ganapathy; Ramon Calderer; Ricardo Silveira Cabral; Robert Stojnic; Roberta Raileanu; Rohan Maheswari; Rohit Girdhar; Rohit Patel; Romain Sauvestre; Ronnie Polidoro; Roshan Sumbaly; Ross Taylor; Ruan Silva; Rui Hou; Rui Wang; Saghar Hosseini; Sahana Chennabasappa; Sanjay Singh; Sean Bell; Seohyun Sonia Kim; Sergey Edunov; Shaoliang Nie; Sharan Narang; Sharath Raparthy; Sheng Shen; Shengye Wan; Shruti Bhosale; Shun Zhang; Simon Vandenhende; Soumya Batra; Spencer Whitman; Sten Sootla; Stephane Collot; Suchin Gururangan; Sydney Borodinsky; Tamar Herman; Tara Fowler; Tarek Sheasha; Thomas Georgiou; Thomas Scialom; Tobias Speckbacher; Todor Mihaylov; Tong Xiao; Ujjwal Karn; Vedanuj Goswami; Vibhor Gupta; Vignesh Ramanathan; Viktor Kerkez; Vincent Gonguet; Virginie Do; Vish Vogeti; Vítor Albiero; Vladan Petrovic; Weiwei Chu; Wenhan Xiong; Wenyin Fu; Whitney Meers; Xavier Martinet; Xiaodong Wang; Xiaofang Wang; Xiaoqing Ellen Tan; Xide Xia; Xinfeng Xie; Xuchao Jia; Xuewei Wang; Yaelle Goldschlag; Yashesh Gaur; Yasmine Babaei; Yi Wen; Yiwen Song; Yuchen Zhang; Yue Li; Yuning Mao; Zacharie Delpierre Coudert; Zheng Yan; Zhengxing Chen; Zoe Papakipos; Aaditya Singh; Aayushi Srivastava; Abha Jain; Adam Kelsey; Adam Shajnfeld; Adithya Gangidi; Adolfo Victoria; Ahuva Goldstand; Ajay Menon; Ajay Sharma; Alex Boesenberg; Alexei Baevski; Allie Feinstein; Amanda Kallet; Amit Sangani; Amos Teo; Anam Yunus; Andrei Lupu; Andres Alvarado; Andrew Caples; Andrew Gu; Andrew Ho; Andrew Poulton; Andrew Ryan; Ankit Ramchandani; Annie Dong; Annie Franco; Anuj Goyal; Aparajita Saraf; Arkabandhu Chowdhury; Ashley Gabriel; Ashwin Bharambe; Assaf Eisenman; Azadeh Yazdan; Beau James; Ben Maurer; Benjamin Leonhardi; Bernie Huang; Beth Loyd; Beto De Paola; Bhargavi Paranjape; Bing Liu; Bo Wu; Boyu Ni; Braden Hancock; Bram Wasti; Brandon Spence; Brani Stojkovic; Brian Gamido; Britt Montalvo; Carl Parker; Carly Burton; Catalina Mejia; Ce Liu; Changhan Wang; Changkyu Kim; Chao Zhou; Chester Hu; Ching-Hsiang Chu; Chris Cai; Chris Tindal; Christoph Feichtenhofer; Cynthia Gao; Damon Civin; Dana Beaty; Daniel Kreymer; Daniel Li; David Adkins; David Xu; Davide Testuggine; Delia David; Devi Parikh; Diana Liskovich; Didem Foss; Dingkang Wang; Duc Le; Dustin Holland; Edward Dowling; Eissa Jamil; Elaine Montgomery; Eleonora Presani; Emily Hahn; Emily Wood; Eric-Tuan Le; Erik Brinkman; Esteban Arcaute; Evan Dunbar; Evan Smothers; Fei Sun; Felix Kreuk; Feng Tian; Filippos Kokkinos; Firat Ozgenel; Francesco Caggioni; Frank Kanayet; Frank Seide; Gabriela Medina Florez; Gabriella Schwarz; Gada Badeer; Georgia Swee; Gil Halpern; Grant Herman; Grigory Sizov; Guangyi; Zhang; Guna Lakshminarayanan; Hakan Inan; Hamid Shojanazeri; Han Zou; Hannah Wang; Hanwen Zha; Haroun Habeeb; Harrison Rudolph; Helen Suk; Henry Aspegren; Hunter Goldman; Hongyuan Zhan; Ibrahim Damlaj; Igor Molybog; Igor Tufanov; Ilias Leontiadis; Irina-Elena Veliche; Itai Gat; Jake Weissman; James Geboski; James Kohli; Janice Lam; Japhet Asher; Jean-Baptiste Gaya; Jeff Marcus; Jeff Tang; Jennifer Chan; Jenny Zhen; Jeremy Reizenstein; Jeremy Teboul; Jessica Zhong; Jian Jin; Jingyi Yang; Joe Cummings; Jon Carvill; Jon Shepard; Jonathan McPhie; Jonathan Torres; Josh Ginsburg; Junjie Wang; Kai Wu; Kam Hou U; Karan Saxena; Kartikay Khandelwal; Katayoun Zand; Kathy Matosich; Kaushik Veeraraghavan; Kelly Michelena; Keqian Li; Kiran Jagadeesh; Kun Huang; Kunal Chawla; Kyle Huang; Lailin Chen; Lakshya Garg; Lavender A; Leandro Silva; Lee Bell; Lei Zhang; Liangpeng Guo; Licheng Yu; Liron Moshkovich; Luca Wehrstedt; Madian Khabsa; Manav Avalani; Manish Bhatt; Martynas Mankus; Matan Hasson; Matthew Lennie; Matthias Reso; Maxim Groshev; Maxim Naumov; Maya Lathi; Meghan Keneally; Miao Liu; Michael L. Seltzer; Michal Valko; Michelle Restrepo; Mihir Patel; Mik Vyatskov; Mikayel Samvelyan; Mike Clark; Mike Macey; Mike Wang; Miquel Jubert Hermoso; Mo Metanat; Mohammad Rastegari; Munish Bansal; Nandhini Santhanam; Natascha Parks; Natasha White; Navyata Bawa; Nayan Singhal; Nick Egebo; Nicolas Usunier; Nikhil Mehta; Nikolay Pavlovich Laptev; Ning Dong; Norman Cheng; Oleg Chernoguz; Olivia Hart; Omkar Salpekar; Ozlem Kalinli; Parkin Kent; Parth Parekh; Paul Saab; Pavan Balaji; Pedro Rittner; Philip Bontrager; Pierre Roux; Piotr Dollar; Polina Zvyagina; Prashant Ratanchandani; Pritish Yuvraj; Qian Liang; Rachad Alao; Rachel Rodriguez; Rafi Ayub; Raghotham Murthy; Raghu Nayani; Rahul Mitra; Rangaprabhu Parthasarathy; Raymond Li; Rebekkah Hogan; Robin Battey; Rocky Wang; Russ Howes; Ruty Rinott; Sachin Mehta; Sachin Siby; Sai Jayesh Bondu; Samyak Datta; Sara Chugh; Sara Hunt; Sargun Dhillon; Sasha Sidorov; Satadru Pan; Saurabh Mahajan; Saurabh Verma; Seiji Yamamoto; Sharadh Ramaswamy; Shaun Lindsay; Shaun Lindsay; Sheng Feng; Shenghao Lin; Shengxin Cindy Zha; Shishir Patil; Shiva Shankar; Shuqiang Zhang; Shuqiang Zhang; Sinong Wang; Sneha Agarwal; Soji Sajuyigbe; Soumith Chintala; Stephanie Max; Stephen Chen; Steve Kehoe; Steve Satterfield; Sudarshan Govindaprasad; Sumit Gupta; Summer Deng; Sungmin Cho; Sunny Virk; Suraj Subramanian; Sy Choudhury; Sydney Goldman; Tal Remez; Tamar Glaser; Tamara Best; Thilo Koehler; Thomas Robinson; Tianhe Li; Tianjun Zhang; Tim Matthews; Timothy Chou; Tzook Shaked; Varun Vontimitta; Victoria Ajayi; Victoria Montanez; Vijai Mohan; Vinay Satish Kumar; Vishal Mangla; Vlad Ionescu; Vlad Poenaru; Vlad Tiberiu Mihailescu; Vladimir Ivanov; Wei Li; Wenchen Wang; Wenwen Jiang; Wes Bouaziz; Will Constable; Xiaocheng Tang; Xiaojian Wu; Xiaolan Wang; Xilun Wu; Xinbo Gao; Yaniv Kleinman; Yanjun Chen; Ye Hu; Ye Jia; Ye Qi; Yenda Li; Yilin Zhang; Ying Zhang; Yossi Adi; Youngjin Nam; Yu; Wang; Yu Zhao; Yuchen Hao; Yundi Qian; Yunlu Li; Yuzi He; Zach Rait; Zachary DeVito; Zef Rosnbrick; Zhaoduo Wen; Zhenyu Yang; Zhiwei Zhao; Zhiyu Ma
Venue: arXiv
DOI: 10.48550/arXiv.2407.21783

ISBN:

URL: https://arxiv.org/abs/2407.21783
Verified via arXiv id 2407.21783.
Verified
Edited
Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.
Daya Guo; Dejian Yang; Haowei Zhang; Junxiao Song; Ruoyu Zhang; Runxin Xu; Qihao Zhu; Shirong Ma; Peiyi Wang; Xiao Bi (2025)
arXiv
Raw: Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al. Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning. arXiv preprint arXiv:2501.12948, 2025.
Match: DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Authors: DeepSeek-AI; Daya Guo; Dejian Yang; Haowei Zhang; Junxiao Song; Peiyi Wang; Qihao Zhu; Runxin Xu; Ruoyu Zhang; Shirong Ma; Xiao Bi; Xiaokang Zhang; Xingkai Yu; Yu Wu; Z. F. Wu; Zhibin Gou; Zhihong Shao; Zhuoshu Li; Ziyi Gao; Aixin Liu; Bing Xue; Bingxuan Wang; Bochao Wu; Bei Feng; Chengda Lu; Chenggang Zhao; Chengqi Deng; Chenyu Zhang; Chong Ruan; Damai Dai; Deli Chen; Dongjie Ji; Erhang Li; Fangyun Lin; Fucong Dai; Fuli Luo; Guangbo Hao; Guanting Chen; Guowei Li; H. Zhang; Han Bao; Hanwei Xu; Haocheng Wang; Honghui Ding; Huajian Xin; Huazuo Gao; Hui Qu; Hui Li; Jianzhong Guo; Jiashi Li; Jiawei Wang; Jingchang Chen; Jingyang Yuan; Junjie Qiu; Junlong Li; J. L. Cai; Jiaqi Ni; Jian Liang; Jin Chen; Kai Dong; Kai Hu; Kaige Gao; Kang Guan; Kexin Huang; Kuai Yu; Lean Wang; Lecong Zhang; Liang Zhao; Litong Wang; Liyue Zhang; Lei Xu; Leyi Xia; Mingchuan Zhang; Minghua Zhang; Minghui Tang; Meng Li; Miaojun Wang; Mingming Li; Ning Tian; Panpan Huang; Peng Zhang; Qiancheng Wang; Qinyu Chen; Qiushi Du; Ruiqi Ge; Ruisong Zhang; Ruizhe Pan; Runji Wang; R. J. Chen; R. L. Jin; Ruyi Chen; Shanghao Lu; Shangyan Zhou; Shanhuang Chen; Shengfeng Ye; Shiyu Wang; Shuiping Yu; Shunfeng Zhou; Shuting Pan; S. S. Li; Shuang Zhou; Shaoqing Wu; Shengfeng Ye; Tao Yun; Tian Pei; Tianyu Sun; T. Wang; Wangding Zeng; Wanjia Zhao; Wen Liu; Wenfeng Liang; Wenjun Gao; Wenqin Yu; Wentao Zhang; W. L. Xiao; Wei An; Xiaodong Liu; Xiaohan Wang; Xiaokang Chen; Xiaotao Nie; Xin Cheng; Xin Liu; Xin Xie; Xingchao Liu; Xinyu Yang; Xinyuan Li; Xuecheng Su; Xuheng Lin; X. Q. Li; Xiangyue Jin; Xiaojin Shen; Xiaosha Chen; Xiaowen Sun; Xiaoxiang Wang; Xinnan Song; Xinyi Zhou; Xianzu Wang; Xinxia Shan; Y. K. Li; Y. Q. Wang; Y. X. Wei; Yang Zhang; Yanhong Xu; Yao Li; Yao Zhao; Yaofeng Sun; Yaohui Wang; Yi Yu; Yichao Zhang; Yifan Shi; Yiliang Xiong; Ying He; Yishi Piao; Yisong Wang; Yixuan Tan; Yiyang Ma; Yiyuan Liu; Yongqiang Guo; Yuan Ou; Yuduan Wang; Yue Gong; Yuheng Zou; Yujia He; Yunfan Xiong; Yuxiang Luo; Yuxiang You; Yuxuan Liu; Yuyang Zhou; Y. X. Zhu; Yanhong Xu; Yanping Huang; Yaohui Li; Yi Zheng; Yuchen Zhu; Yunxian Ma; Ying Tang; Yukun Zha; Yuting Yan; Z. Z. Ren; Zehui Ren; Zhangli Sha; Zhe Fu; Zhean Xu; Zhenda Xie; Zhengyan Zhang; Zhewen Hao; Zhicheng Ma; Zhigang Yan; Zhiyu Wu; Zihui Gu; Zijia Zhu; Zijun Liu; Zilin Li; Ziwei Xie; Ziyang Song; Zizheng Pan; Zhen Huang; Zhipeng Xu; Zhongyu Zhang; Zhen Zhang
Venue: arXiv
DOI: 10.48550/arXiv.2501.12948

ISBN:

URL: https://arxiv.org/abs/2501.12948
Verified via arXiv id 2501.12948.
Verified
Edited
ClearHarm: A more challenging jailbreak dataset
Oskar Hollinsworth; Ian McKenzie; Tom Tseng; Adam Gleave (2025)
Raw: Oskar Hollinsworth, Ian McKenzie, Tom Tseng, and Adam Gleave. ClearHarm: A more challenging jailbreak dataset, 2025. URL https://huggingface.co/datasets/AlignmentResearch/ClearHarm
Match: ClearHarm: A more challenging jailbreak dataset
Authors: Oskar Hollinsworth; Ian McKenzie; Tom Tseng; Adam Gleave
Venue: Hugging Face / Alignment Research Center (FAR AI)
DOI:

ISBN:

URL: https://huggingface.co/datasets/AlignmentResearch/ClearHarm
The work is a verified dataset release on Hugging Face.
Verified
Edited
Best-of-n jailbreaking.
John Hughes; Sara Price; Aengus Lynch; Rylan Schaeffer; Fazl Barez; Sanmi Koyejo; Henry Sleight; Erik Jones; Ethan Perez; Mrinank Sharma (2024)
arXiv
Raw: John Hughes, Sara Price, Aengus Lynch, Rylan Schaeffer, Fazl Barez, Sanmi Koyejo, Henry Sleight, Erik Jones, Ethan Perez, and Mrinank Sharma. Best-of-n jailbreaking. arXiv preprint arXiv:2412.03556, 2024.
Match: Best-of-N Jailbreaking
Authors: John Hughes; Sara Price; Aengus Lynch; Rylan Schaeffer; Fazl Barez; Sanmi Koyejo; Henry Sleight; Erik Jones; Ethan Perez; Mrinank Sharma
Venue: arXiv
DOI: 10.48550/arXiv.2412.03556

ISBN:

URL: https://arxiv.org/abs/2412.03556
Verified via arXiv id 2412.03556.
Verified
Edited
Uncensor any llm with abliteration.
Maxime Labonne (2024)
Raw: Maxime Labonne. Uncensor any llm with abliteration. https:// huggingface.co/blog/mlabonne/abliteration
Match: Uncensor any LLM with abliteration
Authors: Maxime Labonne
Venue: Hugging Face Blog
DOI:

ISBN:

URL: https://huggingface.co/blog/mlabonne/abliteration
The raw citation contained a formatting error (a space in the URL: 'https:// huggingface.co/...'). This is treated as a verified citation because the intended URL is clear and points to the correct work.
Verified
Edited
Making them ask and answer: Jailbreaking large language models in few queries via disguise and reconstruction.
Tong Liu; Yingjie Zhang; Zhe Zhao; Yinpeng Dong; Guozhu Meng; Kai Chen (2024)
USENIX Security Symposium
Raw: Tong Liu, Yingjie Zhang, Zhe Zhao, Yinpeng Dong, Guozhu Meng, and Kai Chen. Making them ask and answer: Jailbreaking large language models in few queries via disguise and reconstruction. In USENIX Security Symposium, pages 4711-4728, 2024.
Match: Making them ask and answer: Jailbreaking large language models in few queries via disguise and reconstruction
Authors: Tong Liu; Yingjie Zhang; Zhe Zhao; Yinpeng Dong; Guozhu Meng; Kai Chen
Venue: 33rd USENIX Security Symposium (USENIX Security 24)
DOI:

ISBN:

URL:
Verified against 33rd USENIX Security Symposium (USENIX Security 24) proceedings.
Verified
Edited
AdaPPA: Adaptive position pre-fill jailbreak attack approach targeting LLMs.
Lijia Lv; Weigang Zhang; Xuehai Tang; Jie Wen; Feng Liu; Jizhong Han; Songlin Hu (2025)
IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)
Raw: Lijia Lv, Weigang Zhang, Xuehai Tang, Jie Wen, Feng Liu, Jizhong Han, and Songlin Hu. AdaPPA: Adaptive position pre-fill jailbreak attack approach targeting LLMs. In IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), page 1-5, 2025.
Match: AdaPPA: Adaptive Position Pre-Fill Jailbreak Attack Approach Targeting LLMs
Authors: Lijia Lv; Weigang Zhang; Xuehai Tang; Jie Wen; Feng Liu; Jizhong Han; Songlin Hu
Venue: ICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)
DOI: 10.1109/icassp49660.2025.10890715

ISBN:

URL: https://doi.org/10.1109/icassp49660.2025.10890715
Verified via static CrossRef title search (score: 1.00)
Verified
Edited
Artificial intelligence index report 2025.
Nestor Maslej; Loredana Fattorini; Raymond Perrault; Yolanda Gil; Vanessa Parli; Njenga Kariuki; Emily Capstick; Anka Reuel; Erik Brynjolfsson; John Etchemendy (2025)
arXiv
Raw: Nestor Maslej, Loredana Fattorini, Raymond Perrault, Yolanda Gil, Vanessa Parli, Njenga Kariuki, Emily Capstick, Anka Reuel, Erik Brynjolfsson, John Etchemendy, et al. Artificial intelligence index report 2025. arXiv preprint arXiv:2504.07139, 2025.
Match: Artificial Intelligence Index Report 2025
Authors: Nestor Maslej; Loredana Fattorini; Raymond Perrault; Yolanda Gil; Vanessa Parli; Njenga Kariuki; Emily Capstick; Anka Reuel; Erik Brynjolfsson; John Etchemendy; Katrina Ligett; Terah Lyons; James Manyika; Juan Carlos Niebles; Yoav Shoham; Russell Wald; Toby Walsh; Armin Hamrah; Lapo Santarlasci; Julia Betts Lotufo; Alexandra Rome; Andrew Shi; Sukrut Oak
Venue: arXiv
DOI: 10.48550/arXiv.2504.07139

ISBN:

URL: https://arxiv.org/abs/2504.07139
Verified via arXiv id 2504.07139.
Verified
Edited
The llama 4 herd.
Meta (2025)
Raw: Meta. The llama 4 herd. https://ai.meta.com/blog/llama-4-multimodal-intelligence/
Match: The Llama 4 herd: The beginning of a new era of natively multimodal intelligence
Authors: Meta
Venue:
DOI:

ISBN:

URL:
The cited blog post exists at the provided URL.
Verified
Edited
Kimi-k2-thinking.
Moonshot AI (2025)
Raw: Moonshot AI. Kimi-k2-thinking. https://moonshotai.github.io/Kimi-K2/thinking.html
Match: Introducing Kimi K2 Thinking
Authors: Moonshot AI
Venue: Moonshot AI
DOI:

ISBN:

URL: https://moonshotai.github.io/Kimi-K2/thinking.html
The citation refers to the official technical blog post and announcement page for the Kimi K2 Thinking model, which is hosted on the official Moonshot AI GitHub Pages domain.
Verified
Edited
Introducing gpt-oss-safeguard.
OpenAI (2025)
Raw: OpenAI. Introducing gpt-oss-safeguard, 2025a. URL https://openai.com/index/introducing-gpt-oss-safeguard/
Match: Introducing gpt-oss-safeguard
Authors: OpenAI
Venue: OpenAI blog
DOI:

ISBN:

URL:
The use of '2025a' for disambiguation is accepted as an academic convention.
Verified
Edited
Openai harmony response format.
OpenAI (2025)
Raw: OpenAI. Openai harmony response format. https://developers.openai.com/cookbook/articles/openai-harmony
Match: OpenAI Harmony Response Format
Authors: OpenAI
Venue: OpenAI Developer Cookbook
DOI:

ISBN:

URL: https://developers.openai.com/cookbook/articles/openai-harmony
Document confirmed as an official article in the OpenAI developer cookbook.
Verified
Edited
Fine-tuning aligned language models compromises safety, even when users do not intend to!
Xiangyu Qi; Yi Zeng; Tinghao Xie; Pin-Yu Chen; Ruoxi Jia; Prateek Mittal; Peter Henderson (2023)
arXiv
Raw: Xiangyu Qi, Yi Zeng, Tinghao Xie, Pin-Yu Chen, Ruoxi Jia, Prateek Mittal, and Peter Henderson. Fine-tuning aligned language models compromises safety, even when users do not intend to! arXiv preprint arXiv:2310.03693, 2023.
Match: Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!
Authors: Xiangyu Qi; Yi Zeng; Tinghao Xie; Pin-Yu Chen; Ruoxi Jia; Prateek Mittal; Peter Henderson
Venue: arXiv
DOI: 10.48550/arXiv.2310.03693

ISBN:

URL: https://arxiv.org/abs/2310.03693
Verified via arXiv id 2310.03693.
Verified
Edited
Safety alignment should be made more than just a few tokens deep.
Xiangyu Qi; Ashwinee Panda; Kaifeng Lyu; Xiao Ma; Subhrajit Roy; Ahmad Beirami; Prateek Mittal; Peter Henderson (2025)
International Conference on Learning Representations (ICLR)
Raw: Xiangyu Qi, Ashwinee Panda, Kaifeng Lyu, Xiao Ma, Subhrajit Roy, Ahmad Beirami, Prateek Mittal, and Peter Henderson. Safety alignment should be made more than just a few tokens deep. In International Conference on Learning Representations (ICLR), 2025.
Match: Safety alignment should be made more than just a few tokens deep
Authors: Xiangyu Qi; Ashwinee Panda; Kaifeng Lyu; Xiao Ma; Subhrajit Roy; Ahmad Beirami; Prateek Mittal; Peter Henderson
Venue: International Conference on Learning Representations (ICLR)
DOI:

ISBN:

URL:
The paper was indeed an Outstanding Paper Award recipient at ICLR 2025.
Verified
Edited
Gpqa: A graduate-level google-proof q&a benchmark.
David Rein; Betty Li Hou; Asa Cooper Stickland; Jackson Petty; Richard Yuanzhe Pang; Julien Dirani; Julian Michael; Samuel R Bowman (2024)
Conference on Language Modeling (COLM)
Raw: David Rein, Betty Li Hou, Asa Cooper Stickland, Jackson Petty, Richard Yuanzhe Pang, Julien Dirani, Julian Michael, and Samuel R Bowman. Gpqa: A graduate-level google-proof q&a benchmark. In Conference on Language Modeling (COLM), 2024.
Match: GPQA: A Graduate-Level Google-Proof Q&A Benchmark
Authors: David Rein; Betty Li Hou; Asa Cooper Stickland; Jackson Petty; Richard Yuanzhe Pang; Julien Dirani; Julian Michael; Samuel R. Bowman
Venue: COLM 2024
DOI:

ISBN:

URL: https://openreview.net/submissions?page=8&venue=colmweb.org%2FCOLM%2F2024%2FConference
Upstream report states the citation matches a real COLM 2024 paper and cites OpenReview’s COLM 2024 submissions page and accepted-papers page as evidence.
Verified
Edited
An approach to technical agi safety and security.
Rohin Shah; Alex Irpan; Alexander Matt Turner; Anna Wang; Arthur Conmy; David Lindner; Jonah Brown-Cohen; Lewis Ho; Neel Nanda; Raluca Ada Popa (2025)
arXiv
Raw: Rohin Shah, Alex Irpan, Alexander Matt Turner, Anna Wang, Arthur Conmy, David Lindner, Jonah Brown-Cohen, Lewis Ho, Neel Nanda, Raluca Ada Popa, et al. An approach to technical agi safety and security. arXiv preprint arXiv:2504.01849, 2025.
Match: An Approach to Technical AGI Safety and Security
Authors: Rohin Shah; Alex Irpan; Alexander Matt Turner; Anna Wang; Arthur Conmy; David Lindner; Jonah Brown-Cohen; Lewis Ho; Neel Nanda; Raluca Ada Popa; Rishub Jain; Rory Greig; Samuel Albanie; Scott Emmons; Sebastian Farquhar; Sébastien Krier; Senthooran Rajamanoharan; Sophie Bridgers; Tobi Ijitoye; Tom Everitt; Victoria Krakovna; Vikrant Varma; Vladimir Mikulik; Zachary Kenton; Dave Orr; Shane Legg; Noah Goodman; Allan Dafoe; Four Flynn; Anca Dragan
Venue: arXiv
DOI: 10.48550/arXiv.2504.01849

ISBN:

URL: https://arxiv.org/abs/2504.01849
Verified via arXiv id 2504.01849.
Verified
Edited
Constitutional classifiers: Defending against universal jailbreaks across thousands of hours of red teaming.
Mrinank Sharma; Meg Tong; Jesse Mu; Jerry Wei; Jorrit Kruthoff; Scott Goodfriend; Euan Ong; Alwin Peng; Raj Agarwal; Cem Anil (2025)
arXiv
Raw: Mrinank Sharma, Meg Tong, Jesse Mu, Jerry Wei, Jorrit Kruthoff, Scott Goodfriend, Euan Ong, Alwin Peng, Raj Agarwal, Cem Anil, et al. Constitutional classifiers: Defending against universal jailbreaks across thousands of hours of red teaming. arXiv preprint arXiv:2501.18837, 2025.
Match: Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming
Authors: Mrinank Sharma; Meg Tong; Jesse Mu; Jerry Wei; Jorrit Kruthoff; Scott Goodfriend; Euan Ong; Alwin Peng; Raj Agarwal; Cem Anil; Amanda Askell; Nathan Bailey; Joe Benton; Emma Bluemke; Samuel R. Bowman; Eric Christiansen; Hoagy Cunningham; Andy Dau; Anjali Gopal; Rob Gilson; Logan Graham; Logan Howard; Nimit Kalra; Taesung Lee; Kevin Lin; Peter Lofgren; Francesco Mosconi; Clare O'Hara; Catherine Olsson; Linda Petrini; Samir Rajani; Nikhil Saxena; Alex Silverstein; Tanya Singh; Theodore Sumers; Leonard Tang; Kevin K. Troy; Constantin Weisser; Ruiqi Zhong; Giulio Zhou; Jan Leike; Jared Kaplan; Ethan Perez
Venue: arXiv
DOI: 10.48550/arXiv.2501.18837

ISBN:

URL: https://arxiv.org/abs/2501.18837
Verified via arXiv id 2501.18837.
Verified
Edited
” do anything now”: Characterizing and evaluating in-the-wild jailbreak prompts on large language models.
Xinyue Shen; Zeyuan Chen; Michael Backes; Yun Shen; Yang Zhang (2024)
ACM SIGSAC Conference on Computer and Communications Security
Raw: Xinyue Shen, Zeyuan Chen, Michael Backes, Yun Shen, and Yang Zhang. ” do anything now”: Characterizing and evaluating in-the-wild jailbreak prompts on large language models. In ACM SIGSAC Conference on Computer and Communications Security, pages 1671-1685, 2024.
Match: "Do Anything Now": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models
Authors: Xinyue Shen; Zeyuan Chen; Michael Backes; Yun Shen; Yang Zhang
Venue: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security
DOI: 10.1145/3658644.3670388

ISBN:

URL: https://doi.org/10.1145/3658644.3670388
Verified via static CrossRef title search (score: 1.00)
Verified
Edited
Bypassing the safety training of open-source llms with priming attacks.
Jason Vega; Isha Chaudhary; Changming Xu; Gagandeep Singh (2023)
arXiv
Raw: Jason Vega, Isha Chaudhary, Changming Xu, and Gagandeep Singh. Bypassing the safety training of open-source llms with priming attacks. arXiv preprint arXiv:2312.12321, 2023.
Match: Bypassing the Safety Training of Open-Source LLMs with Priming Attacks
Authors: Jason Vega; Isha Chaudhary; Changming Xu; Gagandeep Singh
Venue: arXiv
DOI: 10.48550/arXiv.2312.12321

ISBN:

URL: https://arxiv.org/abs/2312.12321
Verified via arXiv id 2312.12321.
Verified
Edited
No free lunch for defending against prefilling attack by in-context learning.
Zhiyu Xue; Guangliang Liu; Bocheng Chen; Kristen Marie Johnson; Ramtin Pedarsani (2024)
arXiv
Raw: Zhiyu Xue, Guangliang Liu, Bocheng Chen, Kristen Marie Johnson, and Ramtin Pedarsani. No free lunch for defending against prefilling attack by in-context learning. arXiv preprint arXiv:2412.12192, 2024.
Match: No Free Lunch for Defending Against Prefilling Attack by In-Context Learning
Authors: Zhiyu Xue; Guangliang Liu; Bocheng Chen; Kristen Marie Johnson; Ramtin Pedarsani
Venue: arXiv
DOI: 10.48550/arXiv.2412.12192

ISBN:

URL: https://arxiv.org/abs/2412.12192
Verified via arXiv id 2412.12192.
Verified
Edited
Qwen3 technical report.
An Yang; Anfeng Li; Baosong Yang; Beichen Zhang; Binyuan Hui; Bo Zheng; Bowen Yu; Chang Gao; Chengen Huang; Chenxu Lv (2025)
arXiv
Raw: An Yang, Anfeng Li, Baosong Yang, Beichen Zhang, Binyuan Hui, Bo Zheng, Bowen Yu, Chang Gao, Chengen Huang, Chenxu Lv, et al. Qwen3 technical report. arXiv preprint arXiv:2505.09388, 2025.
Match: Qwen3 Technical Report
Authors: An Yang; Anfeng Li; Baosong Yang; Beichen Zhang; Binyuan Hui; Bo Zheng; Bowen Yu; Chang Gao; Chengen Huang; Chenxu Lv; Chujie Zheng; Dayiheng Liu; Fan Zhou; Fei Huang; Feng Hu; Hao Ge; Haoran Wei; Huan Lin; Jialong Tang; Jian Yang; Jianhong Tu; Jianwei Zhang; Jianxin Yang; Jiaxi Yang; Jing Zhou; Jingren Zhou; Junyang Lin; Kai Dang; Keqin Bao; Kexin Yang; Le Yu; Lianghao Deng; Mei Li; Mingfeng Xue; Mingze Li; Pei Zhang; Peng Wang; Qin Zhu; Rui Men; Ruize Gao; Shixuan Liu; Shuang Luo; Tianhao Li; Tianyi Tang; Wenbiao Yin; Xingzhang Ren; Xinyu Wang; Xinyu Zhang; Xuancheng Ren; Yang Fan; Yang Su; Yichang Zhang; Yinger Zhang; Yu Wan; Yuqiong Liu; Zekun Wang; Zeyu Cui; Zhenru Zhang; Zhipeng Zhou; Zihan Qiu
Venue: arXiv
DOI: 10.48550/arXiv.2505.09388

ISBN:

URL: https://arxiv.org/abs/2505.09388
Verified via arXiv id 2505.09388.
Verified
Edited
Gpt-4 is too smart to be safe: Stealthy chat with llms via cipher.
Youliang Yuan; Wenxiang Jiao; Wenxuan Wang; Jen-tse Huang; Pinjia He; Shuming Shi; Zhaopeng Tu (2023)
arXiv
Raw: Youliang Yuan, Wenxiang Jiao, Wenxuan Wang, Jen-tse Huang, Pinjia He, Shuming Shi, and Zhaopeng Tu. Gpt-4 is too smart to be safe: Stealthy chat with llms via cipher. arXiv preprint arXiv:2308.06463, 2023.
Match: GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher
Authors: Youliang Yuan; Wenxiang Jiao; Wenxuan Wang; Jen-tse Huang; Pinjia He; Shuming Shi; Zhaopeng Tu
Venue: arXiv
DOI: 10.48550/arXiv.2308.06463

ISBN:

URL: https://arxiv.org/abs/2308.06463
Verified via arXiv id 2308.06463.
Verified
Edited
Glm-4.7: Advancing the coding capability.
Z.ai (2025)
Raw: Z.ai. Glm-4.7: Advancing the coding capability. https://z.ai/blog/glm-4.7
Match: Glm-4.7: Advancing the coding capability
Authors:
Venue: Z.ai
DOI:

ISBN:

URL: https://z.ai/blog/glm-4.7
The cited work was verified as a real publication by the organization at the provided URL.
Verified
Edited
Removing rlhf protections in gpt-4 via fine-tuning.
Qiusi Zhan; Richard Fang; Rohan Bindu; Akul Gupta; Tatsunori B Hashimoto; Daniel Kang (2024)
Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies
Raw: Qiusi Zhan, Richard Fang, Rohan Bindu, Akul Gupta, Tatsunori B Hashimoto, and Daniel Kang. Removing rlhf protections in gpt-4 via fine-tuning. In Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, pages 681-687, 2024.
Match: Removing RLHF Protections in GPT-4 via Fine-Tuning
Authors: Qiusi Zhan; Richard Fang; Rohan Bindu; Akul Gupta; Tatsunori Hashimoto; Daniel Kang
Venue: Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 2: Short Papers)
DOI: 10.18653/v1/2024.naacl-short.59

ISBN:

URL: https://doi.org/10.18653/v1/2024.naacl-short.59
Verified via static CrossRef title search (score: 1.00)
Verified
Edited
Qwen3guard technical report.
Haiquan Zhao; Chenhan Yuan; Fei Huang; Xiaomeng Hu; Yichang Zhang; An Yang; Bowen Yu; Dayiheng Liu; Jingren Zhou; Junyang Lin (2025)
arXiv
Raw: Haiquan Zhao, Chenhan Yuan, Fei Huang, Xiaomeng Hu, Yichang Zhang, An Yang, Bowen Yu, Dayiheng Liu, Jingren Zhou, Junyang Lin, et al. Qwen3guard technical report. arXiv preprint arXiv:2510.14276, 2025.
Match: Qwen3Guard Technical Report
Authors: Haiquan Zhao; Chenhan Yuan; Fei Huang; Xiaomeng Hu; Yichang Zhang; An Yang; Bowen Yu; Dayiheng Liu; Jingren Zhou; Junyang Lin; Baosong Yang; Chen Cheng; Jialong Tang; Jiandong Jiang; Jianwei Zhang; Jijie Xu; Ming Yan; Minmin Sun; Pei Zhang; Pengjun Xie; Qiaoyu Tang; Qin Zhu; Rong Zhang; Shibin Wu; Shuo Zhang; Tao He; Tianyi Tang; Tingyu Xia; Wei Liao; Weizhou Shen; Wenbiao Yin; Wenmeng Zhou; Wenyuan Yu; Xiaobin Wang; Xiaodong Deng; Xiaodong Xu; Xinyu Zhang; Yang Liu; Yeqiu Li; Yi Zhang; Yong Jiang; Yu Wan; Yuxin Zhou
Venue: arXiv
DOI: 10.48550/arXiv.2510.14276

ISBN:

URL: https://arxiv.org/abs/2510.14276
Verified via arXiv id 2510.14276.
Verified
Edited
Autodan: interpretable gradient-based adversarial attacks on large language models.
Sicheng Zhu; Ruiyi Zhang; Bang An; Gang Wu; Joe Barrow; Zichao Wang; Furong Huang; Ani Nenkova; Tong Sun (2023)
arXiv
Raw: Sicheng Zhu, Ruiyi Zhang, Bang An, Gang Wu, Joe Barrow, Zichao Wang, Furong Huang, Ani Nenkova, and Tong Sun. Autodan: interpretable gradient-based adversarial attacks on large language models. arXiv preprint arXiv:2310.15140, 2023.
Match: AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models
Authors: Sicheng Zhu; Ruiyi Zhang; Bang An; Gang Wu; Joe Barrow; Zichao Wang; Furong Huang; Ani Nenkova; Tong Sun
Venue: arXiv
DOI: 10.48550/arXiv.2310.15140

ISBN:

URL: https://arxiv.org/abs/2310.15140
Verified via arXiv id 2310.15140.
Verified
Edited
Universal and transferable adversarial attacks on aligned language models.
Andy Zou; Zifan Wang; Nicholas Carlini; Milad Nasr; J Zico Kolter; Matt Fredrikson (2023)
arXiv
Raw: Andy Zou, Zifan Wang, Nicholas Carlini, Milad Nasr, J Zico Kolter, and Matt Fredrikson. Universal and transferable adversarial attacks on aligned language models. arXiv preprint arXiv:2307.15043, 2023.
Match: Universal and Transferable Adversarial Attacks on Aligned Language Models
Authors: Andy Zou; Zifan Wang; Nicholas Carlini; Milad Nasr; J. Zico Kolter; Matt Fredrikson
Venue: arXiv
DOI: 10.48550/arXiv.2307.15043

ISBN:

URL: https://arxiv.org/abs/2307.15043
Verified via arXiv id 2307.15043.
Verified
Edited
Chemical Weapons Convention
None (1997)

ISBN: 978-1-280-28774-9
Raw: Chemical Weapons Convention (CWC) (1997)
Match: Convention on the Prohibition of the Development, Production, Stockpiling and Use of Chemical Weapons and on their Destruction
Authors:
Venue:
DOI:

ISBN: 978-1-280-28774-9

URL:
The citation 'Chemical Weapons Convention (CWC) (1997)' refers to the treaty that entered into force on April 29, 1997. Citing by common name, acronym, and EIF year is standard. The provided ISBN (9781280287749) is a valid identifier for an edition of this text.
Verified
Edited
Rome Statute of the International Criminal Court
None

ISBN: 978-1-849-46996-8
Raw: Rome Statute of the International Criminal Court
Match: Rome Statute of the International Criminal Court
Authors:
Venue:
DOI:

ISBN: 978-1-849-46996-8

URL:
The raw citation correctly identifies the treaty. The provided ISBN for a commentary book was an external metadata error not present in the citation text, which is ignored.
Verified
Edited
Norm-preserving biprojected abliteration.
Jim Lai (2025)
Raw: Jim Lai. Norm-preserving biprojected abliteration. https://huggingface.co/blog/grimjim/norm-preserving-biprojected-abliteration
Match: Norm-Preserving Biprojected Abliteration
Authors: Jim Lai
Venue: Hugging Face Blog
DOI:

ISBN:

URL: https://huggingface.co/blog/grimjim/norm-preserving-biprojected-abliteration