arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-18 至 2025-08-18 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 10 篇

2508.11414 2025-08-18 cs.CL 79%

Survey-to-Behavior: Downstream Alignment of Human Values in LLMs via Survey Questions

Shangrui Nie, Florian Mai, David Kaczér, Charles Welch, Zhixue Zhao, Lucie Flek

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

Comments 7 pages 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11364 2025-08-18 cs.CL 79%

Feedback Indicators: The Alignment between Llama and a Teacher in Language Learning

Sylvio Rüdian, Yassin Elsir, Marvin Kretschmer, Sabine Cayrou, Niels Pinkwart

机构 * Humboldt-Universität zu Berlin Department of Computer Science(柏林洪堡大学计算机科学系) Humboldt-Universität zu Berlin Language Centre(柏林洪堡大学语言中心) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

Comments 11 pages, one table

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11582 2025-08-18 cs.CL cs.AI 62%

Aware First, Think Less: Dynamic Boundary Self-Awareness Drives Extreme Reasoning Efficiency in Large Language Models

Qiguang Chen, Dengyun Peng, Jinhao Liu, HuiKang Su, Jiannan Guan, Libo Qin, Wanxiang Che

机构 * LARG, Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology(大型语言模型研究组,社会计算与交互机器人研究中心,哈尔滨工业大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10925 2025-08-18 cs.CL cs.AI 62%

gpt-oss-120b & gpt-oss-20b Model Card

OpenAI, :, Sandhini Agarwal, Lama Ahmad, Jason Ai, Sam Altman, Andy Applebaum, Edwin Arbus, Rahul K. Arora, Yu Bai, Bowen Baker, Haiming Bao, Boaz Barak, Ally Bennett, Tyler Bertao, Nivedita Brett, Eugene Brevdo, Greg Brockman, Sebastien Bubeck, Che Chang, Kai Chen, Mark Chen, Enoch Cheung, Aidan Clark, Dan Cook, Marat Dukhan, Casey Dvorak, Kevin Fives, Vlad Fomenko, Timur Garipov, Kristian Georgiev, Mia Glaese, Tarun Gogineni, Adam Goucher, Lukas Gross, Katia Gil Guzman, John Hallman, Jackie Hehir, Johannes Heidecke, Alec Helyar, Haitang Hu, Romain Huet, Jacob Huh, Saachi Jain, Zach Johnson, Chris Koch, Irina Kofman, Dominik Kundel, Jason Kwon, Volodymyr Kyrylov, Elaine Ya Le, Guillaume Leclerc, James Park Lennon, Scott Lessans, Mario Lezcano-Casado, Yuanzhi Li, Zhuohan Li, Ji Lin, Jordan Liss, Lily, Liu, Jiancheng Liu, Kevin Lu, Chris Lu, Zoran Martinovic, Lindsay McCallum, Josh McGrath, Scott McKinney, Aidan McLaughlin, Song Mei, Steve Mostovoy, Tong Mu, Gideon Myles, Alexander Neitz, Alex Nichol, Jakub Pachocki, Alex Paino, Dana Palmie, Ashley Pantuliano, Giambattista Parascandolo, Jongsoo Park, Leher Pathak, Carolina Paz, Ludovic Peran, Dmitry Pimenov, Michelle Pokrass, Elizabeth Proehl, Huida Qiu, Gaby Raila, Filippo Raso, Hongyu Ren, Kimmy Richardson, David Robinson, Bob Rotsted, Hadi Salman, Suvansh Sanjeev, Max Schwarzer, D. Sculley, Harshit Sikchi, Kendal Simon, Karan Singhal, Yang Song, Dane Stuckey, Zhiqing Sun, Philippe Tillet, Sam Toizer, Foivos Tsimpourlas, Nikhil Vyas, Eric Wallace, Xin Wang, Miles Wang, Olivia Watkins, Kevin Weil, Amy Wendling, Kevin Whinnery, Cedric Whitney, Hannah Wong, Lin Yang, Yu Yang, Michihiro Yasunaga, Kristen Ying, Wojciech Zaremba, Wenting Zhan, Cyril Zhang, Brian Zhang, Eddie Zhang, Shengjia Zhao

机构 * OpenAI

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10450 2025-08-18 cs.IR cs.AI cs.CL 62%

TokenRec: Learning to Tokenize ID for LLM-based Generative Recommendation

Haohao Qu, Wenqi Fan, Zihuai Zhao, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算机系,香港理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by IEEE TKDE. Codes and data are available at https://github.com/Quhaoh233/TokenRec

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11536 2025-08-18 cs.CL 57%

Language models align with brain regions that represent concepts across modalities

Maria Ryskina, Greta Tuckute, Alexander Fung, Ashley Malkin, Evelina Fedorenko

机构 * Vector Institute for AI(向量人工智能研究所) MIT(麻省理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

Comments Accepted to COLM 2025. Code and data can be found at https://github.com/ryskina/concepts-brain-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11404 2025-08-18 cs.RO cs.AI cs.HC 57%

An Exploratory Study on Crack Detection in Concrete through Human-Robot Collaboration

Junyeon Kim, Tianshu Ruan, Cesar Alan Contreras, Manolis Chiou

机构 * Extreme Robotics Lab (ERL) and National Center for Nuclear Robotics (NCNR)(极端机器人实验室(ERL)和核机器人国家中心(NCNR)) University of Birmingham(伯明翰大学) National Center for Nuclear Robotics (NCNR)(核机器人国家中心) Queen Mary University of London(伦敦女王大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10919 2025-08-18 cs.HC cs.AI 57%

Human-AI collaboration or obedient and often clueless AI in instruct, serve, repeat dynamics?

Mohammed Saqr, Kamila Misiejuk, Sonsoles López-Pernas

机构 * University of Eastern Finland(东方芬兰大学) FernUniversität in Hagen(哈根弗伦大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02269 2025-08-18 cs.AI 57%

AirTrafficGen: Configurable Air Traffic Scenario Generation with Large Language Models

Dewi Sid William Gould, George De Ath, Ben Carvell, Nick Pepper

机构 * The Alan Turing Institute(阿尔ัน图灵研究院) NATS University of Exeter(埃克塞特大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

Comments 9 pages and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11153 2025-08-18 cs.CV 50%

LEARN: A Story-Driven Layout-to-Image Generation Framework for STEM Instruction

Maoquan Zhang, Bisser Raytchev, Xiujuan Sun

机构 * Graduate School of Advanced Science and Engineering, Hiroshima University(Hiroshima大学研究生院) Department of Computer Science, Weifang University of Science and Technology(潍坊科技大学计算机科学系)

专题命中 其他安全 :alignment(abstract)

Comments The International Conference on Neural Information Processing (ICONIP) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏