arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-07-29 至 2025-07-29 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 16 篇

2507.20526 2025-07-29 cs.AI cs.CL cs.CY 67%

Security Challenges in AI Agent Deployment: Insights from a Large Scale Public Competition

Andy Zou, Maxwell Lin, Eliot Jones, Micha Nowak, Mateusz Dziemian, Nick Winter, Alexander Grattan, Valent Nathanael, Ayla Croft, Xander Davies, Jai Patel, Robert Kirk, Nate Burnikell, Yarin Gal, Dan Hendrycks, J. Zico Kolter, Matt Fredrikson

专题命中 安全评测 :red teaming(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19598 2025-07-29 cs.CL cs.AI cs.CR cs.LG 67%

MOCHA: Are Code Language Models Robust Against Multi-Turn Malicious Coding Prompts?

Muntasir Wahed, Xiaona Zhou, Kiet A. Nguyen, Tianjiao Yu, Nirav Diwan, Gang Wang, Dilek Hakkani-Tür, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Winner Defender Team at Amazon Nova AI Challenge 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20280 2025-07-29 cs.AI cs.CL 62%

SciToolAgent: A Knowledge Graph-Driven Scientific Agent for Multi-Tool Integration

Keyan Ding, Jing Yu, Junjie Huang, Yuchen Yang, Qiang Zhang, Huajun Chen

机构 * College of Computer Science and Technology(计算机科学与技术学院) Zhejiang University(浙江大学) Zhejiang Key Laboratory of Intelligent Manufacturing for Functional Chemicals(功能化学品智能制造重点实验室) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙大杭州国际科学技术创新中心) ZJU-UIUC Institute(浙大UIUC研究院) The Polytechnic Institute(技术学院) State Key Laboratory of Ocean Sensing(海洋感知国家重点实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16802 2025-07-29 cs.CL cs.LG 62%

Agentar-Fin-R1: Enhancing Financial Intelligence through Domain Expertise, Training Efficiency, and Advanced Reasoning

Yanjun Zheng, Xiyang Du, Longfei Liao, Xiaoke Zhao, Zhaowen Zhou, Jingze Song, Bo Zhang, Jiawei Liu, Xiang Qi, Zhe Li, Zhiqiang Zhang, Wei Wang, Peng Zhang

机构 * Ant Group(蚂蚁集团)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19803 2025-07-29 cs.LG cs.AI 62%

AI-Based Clinical Rule Discovery for NMIBC Recurrence through Tsetlin Machines

Saram Abbas, Naeem Soomro, Rishad Shafik, Rakesh Heer, Kabita Adhikari

机构 * Newcastle University, UK Freeman Hospital, UK Imperial College London \& Newcastle University Centre for Care School of Engineering Newcastle University, UK

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Submitted to ISTM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19556 2025-07-29 cs.CY cs.AI 62%

PEMUTA: Pedagogically-Enriched Multi-Granular Undergraduate Thesis Assessment

Jialu Zhang, Qingyang Sun, Qianyi Wang, Weiyi Zhang, Zunjie Xiao, Xiaoqing Zhang, Jianfeng Ren, Jiang Liu

机构 * Research Institute of Trustworthy Autonomous Systems and Department of Computer Science and Engineering(可信自主系统研究 institute 和计算机科学与工程系) Southern University of Science and Technology(南方科技大学) School of Computer Science, University of Nottingham Ningbo China(宁波大学计算机学院) School of Ophthalmology and Optometry, Wenzhou Medical University(温州医学院眼视光学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15956 2025-07-29 cs.CL cs.AI 62%

Do Large Language Models Have an English Accent? Evaluating and Improving the Naturalness of Multilingual LLMs

Yanzhu Guo, Simone Conia, Zelin Zhou, Min Li, Saloni Potdar, Henry Xiao

机构 * Apple(苹果公司) Inria Paris(巴黎国家信息与自动化研究所) École Polytechnique(巴黎高等理工学院) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20850 2025-07-29 cs.RO cs.AI 57%

Free Energy-Inspired Cognitive Risk Integration for AV Navigation in Pedestrian-Rich Environments

Meiting Dang, Yanping Wu, Yafei Wang, Dezong Zhao, David Flynn, Chongfeng Wei

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20774 2025-07-29 cs.AI 57%

evalSmarT: An LLM-Based Framework for Evaluating Smart Contract Generated Comments

Fatou Ndiaye Mbodji

机构 * SnT – University of Luxembourg(卢森堡大学SnT学院) Université Cheikh Anta Diop(谢赫·安塔·迪奥普大学) Huawei(华为)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments 4 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20451 2025-07-29 cs.AI 57%

STARN-GAT: A Multi-Modal Spatio-Temporal Graph Attention Network for Accident Severity Prediction

Pritom Ray Nobin, Imran Ahammad Rifat

专题命中 安全评测 :safety(abstract);分类 cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20046 2025-07-29 cs.CL 57%

Infogen: Generating Complex Statistical Infographics from Documents

Akash Ghosh, Aparna Garimella, Pritika Ramu, Sambaran Bandyopadhyay, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度帕纳大学理工学院) Adobe Research(Adobe研究)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

Comments ACL Main 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16674 2025-07-29 cs.LG q-bio.NC 57%

GASPnet: Global Agreement to Synchronize Phases

Andrea Alamia, Sabine Muzellec, Thomas Serre, Rufin VanRullen

机构 * CerCo, CNRS(CerCo与CNRS) Carney Institute for Brain Science, Brown University(脑科学研究所与布朗大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07317 2025-07-29 cs.CV 50%

ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation

Sherry X. Chen, Yi Wei, Luowei Zhou, Suren Kumar

机构 * Samsung AI Center(三星AI中心) Mountain View University of California, Santa Barbara(山景城加州大学圣巴巴拉分校)

专题命中 安全评测 :alignment(abstract)

Comments International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19965 2025-07-29 math.OC 50%

A Convex Optimization Approach to Model-Free Inverse Optimal Control with Provable Convergence

Meiling Yu, Lechen Feng, Lei Jiang, Yuan-Hua Ni

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14919 2025-07-29 cs.CV 50%

GenM$^3$: Generative Pretrained Multi-path Motion Model for Text Conditional Human Motion Generation

Junyu Shi, Lijiang Liu, Yong Sun, Zhiyuan Zhang, Jinni Zhou, Qiang Nie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11824 2025-07-29 cs.CV 50%

KITTEN: A Knowledge-Intensive Evaluation of Image Generation on Visual Entities

Hsin-Ping Huang, Xinyi Wang, Yonatan Bitton, Hagai Taitelbaum, Gaurav Singh Tomar, Ming-Wei Chang, Xuhui Jia, Kelvin C. K. Chan, Hexiang Hu, Yu-Chuan Su, Ming-Hsuan Yang

专题命中 安全评测 :alignment(abstract)

Comments Project page: https://kitten-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏