arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-16 至 2025-12-16 共收录 20 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 20 篇

2512.11979 2025-12-16 cs.HC cs.AI 83%

Designing The Internet of Agents: A Framework for Trustworthy, Transparent, and Collaborative Human-Agent Interaction (HAX)

设计智能体互联网:信任、透明和协作人机交互的框架

Marc Scibelli, Krystelle Gonzalez Papaux, Julia Valenti, Srishti Kush

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 HAX框架通过整合行为启发式、模式驱动SDK和行为代理概念,为信任、透明和协作的人机交互提供端到端解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13658 2025-12-16 cs.CY cs.AI 81%

Embedding-Based Rankings of Educational Resources based on Learning Outcome Alignment: Benchmarking, Expert Validation, and Learner Performance

基于学习成果对齐的教育资源排名:基准测试、专家验证与学习者表现

Mohammadreza Molavi, Mohammad Moein, Mohammadreza Tavakoli, Abdolali Faraji, Stefan T. Mol, Gábor Kismihók

机构 * Leibniz Information Centre for Science and Technology (TIB)(莱比锡科学与技术信息中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究提出基于嵌入的对齐框架,通过基准测试和专家验证,证明了教育资源与学习成果对齐度对学习表现的正向影响。

Comments Accepted for publication at the 16th International Conference on Learning Analytics & Knowledge (LAK 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11009 2025-12-16 cs.CL cs.AI 73%

SproutBench: A Benchmark for Safe and Ethical Large Language Models for Youth

SproutBench: 为青少年设计的安全和伦理大型语言模型基准

Wenpeng Xing, Lanyi Wei, Haixiao Hu, Jingyi Yu, Rongchang Li, Mohan Li, Changting Lin, Meng Han

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 SproutBench通过1283个发展性对抗提示评估47种LLMs,揭示儿童安全漏洞,为青少年AI设计提供指导。

Comments Accepted in AAAI 2026 Workshop on AI for Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13330 2025-12-16 cs.CL cs.AI 62%

FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models

FIN-bench-v2:一个用于评估芬兰大型语言模型的统一且稳健的基准测试集

Joona Kytöniemi, Jousia Piha, Akseli Reunamo, Fedor Vitiugin, Farrokh Mehryary, Sampo Pyysalo

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 FIN-bench-v2通过整合芬兰语言任务和评估方法,提供统一且稳健的基准测试集,用于评估芬兰大型语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10284 2025-12-16 cs.CV cs.AI cs.CL 62%

MotionEdit: Benchmarking and Learning Motion-Centric Image Editing

MotionEdit: 动作导向图像编辑的基准测试与学习

Yixin Wan, Lei Ke, Wenhao Yu, Kai-Wei Chang, Dong Yu

机构 * Tencent AI(腾讯AI) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 MotionEdit提出一个动作导向图像编辑数据集及评估基准,通过MotionNFT框架提升编辑质量和运动保真度。

Comments Technical Report. We propose MotionEdit, a dataset and benchmark for motion-centric image editing. We also introduce MotionNFT, a reward training framework to improve existing models with motion-aware guidance. Github: https://github.com/elainew728/motion-edit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11931 2025-12-16 cs.CY cs.AI 62%

Mapping AI Risk Mitigations: Evidence Scan and Preliminary AI Risk Mitigation Taxonomy

映射AI风险缓解:证据扫描与初步AI风险缓解分类

Alexander K. Saeri, Sophia Lloyd George, Jess Graham, Clelia D. Lacarriere, Peter Slattery, Michael Noetel, Neil Thompson

专题命中 安全评测 :red teaming(abstract);分类 cs.AI、cs.CY

AI总结 本文提出初步AI风险缓解分类法,通过证据扫描整合AI风险缓解措施,为不同利益相关者提供协调降低AI风险的结构化框架。

Comments Access AI Risk Mitigation Database and Taxonomy at https://airisk.mit.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11887 2025-12-16 cs.CY cs.AI 62%

Advancing Autonomous Driving System Testing: Demands, Challenges, and Future Directions

推进自动驾驶系统测试:需求、挑战与未来方向

Yihan Liao, Jingyu Zhang, Jacky Keung, Yan Xiao, Yurou Dai

机构 * City University of Hong Kong(香港城市大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Lehigh University(莱斯大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本研究探讨了自动驾驶系统测试的需求与挑战,指出现有测试技术在现实性能评估中的不足,并提出了未来研究方向,包括系统化测试标准、跨模型协作及可扩展验证框架。

Comments Accepted for publication in Information and Software Technology (IST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11830 2025-12-16 cs.LG cs.AI 62%

CR3G: Causal Reasoning for Patient-Centric Explanations in Radiology Report Generation

CR3G:用于放射学报告生成的患者导向因果推理

Satyam Kumar

机构 * IIT Bombay(博伊斯大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 CR3G通过因果推理提升放射学报告生成的解释能力,增强AI诊断的可信度和实用性。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12859 2025-12-16 cs.CY cs.AI 62%

Three Lenses on the AI Revolution: Risk, Transformation, Continuity

人工智能革命的三个视角:风险、变革与连续性

Masoud Makrehchi

机构 * Ontariotechu(安大略技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文从风险、变革与连续性三个视角探讨AI革命,指出其兼具进化与革命特性,需通过治理与责任机制确保安全与公平。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13337 2025-12-16 cs.LG 57%

FROC: A Unified Framework with Risk-Optimized Control for Machine Unlearning in LLMs

FROC:一种用于大语言模型机器去学习的统一框架,具有风险优化控制

Si Qi Goh, Yongsen Zheng, Ziyao Liu, Sami Hormi, Kwok-Yan Lam

机构 * Digital Trust Centre, Nanyang Technological University, Singapore(南洋理工大学数字信任中心) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 FROC提出了一种用于大语言模型机器去学习的统一框架,通过风险优化控制机制,实现对去学习过程的风险管理和效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18375 2025-12-16 cs.AI 57%

Progressive Localisation in Localist LLMs

局部化LLM中的渐进式局部化

Joachim Diederich

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种渐进式局部化方法,通过自适应语义块划分和陡峭多项式调度,在保持性能的同时提升LLM的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03888 2025-12-16 cs.CL 57%

False Sense of Security: Why Probing-based Malicious Input Detection Fails to Generalize

虚假的安全感:基于探测的恶意输入检测为何无法泛化

Cheng Wang, Zeming Wei, Qin Liu, Muhao Chen

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) University of California, Davis(加州大学戴维斯分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究指出基于探测的恶意输入检测方法因学习表面模式而非语义有害性,导致无法泛化,需重新设计模型和评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12443 2025-12-16 cs.AI cs.SE 57%

AI Transparency Atlas: Framework, Scoring, and Real-Time Model Card Evaluation Pipeline

AI透明度地图:框架、评分与实时模型卡片评估流程

Akhmadillo Mamirov, Faiaz Azmain, Hanyu Wang

机构 * Department of Computer Science, The College of Wooster, Wooster, OH, USA(计算机科学系,沃斯特学院,沃斯特,OH,USA) Robert F. Wagner Graduate School of Public Service, New York University, New York, NY, USA(罗伯特·F·瓦格纳公共事务研究生学院,纽约大学,纽约,NY,USA)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出AI透明度框架和实时评估流程,评估50个模型发现前沿实验室合规率约80%,而多数供应商低于60%,安全关键领域存在显著缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12923 2025-12-16 cs.AI cs.MA 57%

The Traitors: Deception and Trust in Multi-Agent Language Model Simulations

背叛者:多智能体语言模型模拟中的欺骗与信任

Pedro M. P. Curvo

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 The Traitors通过多智能体模拟研究LLM在社交互动中的欺骗与信任问题,揭示先进模型在欺骗能力与检测能力上的不对称性。

Comments 9 main pages, 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12128 2025-12-16 cs.CV cs.AI 57%

A Benchmark Dataset for Spatially Aligned Road Damage Assessment in Small Uncrewed Aerial Systems Disaster Imagery

用于小无人 aerial 系统灾害影像中空间对齐道路损坏评估的基准数据集

Thomas Manzini, Priyankari Perali, Raisa Karnik, Robin R. Murphy

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一个用于小无人 aerial 系统灾害影像中道路损坏评估的基准数据集,并通过空间对齐技术提升模型性能。

Comments 11 pages, 6 figures, 6 tables. To appear AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11984 2025-12-16 cs.SE cs.AI 57%

Evidence-Driven Decision Support for AI Model Selection in Research Software Engineering

基于证据的AI模型选择决策支持:研究软件工程中的AI模型选择

Alireza Joonbakhsh, Alireza Rostami, AmirMohammad Kamalinia, Ali Nazeri, Farshad Khunjush, Bedir Tekinerdogan, Siamak Farshidi

机构 * organization= Department of Computer Science Engineering, Shiraz University , city= Shiraz , country= Iran organization= Wageningen University \& Research , city= Wageningen , country= The Netherlands

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出ModelSelect框架,通过多准则决策方法支持AI模型选择,提升科研软件决策的透明性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11805 2025-12-16 cs.CY 57%

AI Integration In ERP Evaluation Across Trends and Architectures

人工智能在ERP评估中的整合:跨趋势与架构

Monu Sharma

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 本文提出了一种理论模型,将AI赋能的ERP性能评估指标与预测智能和自适应自动化相结合,以改进AI整合ERP的评估方法。

Comments 9 pages, 2 Figures. Journal of Information Systems Engineering and Management,2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13262 2025-12-16 cs.RO cs.CV 50%

Post-Training and Test-Time Scaling of Generative Agent Behavior Models for Interactive Autonomous Driving

生成代理行为模型在交互式自动驾驶中的训练和测试时间缩放

Hyunki Seong, Jeong-Kyun Lee, Heesoo Myeong, Yongho Shin, Hyun-Mook Cho, Duck Hoon Kim, Pranav Desai, Monu Surana

专题命中 安全评测 :safety(abstract)

AI总结 本文提出GRBO和Warm-K两种方法,用于提升交互式自动驾驶中生成代理行为模型的训练和测试时间性能,提高安全性和鲁棒性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19253 2025-12-16 cs.IR 50%

DeepResearchGym: A Free, Transparent, and Reproducible Evaluation Sandbox for Deep Research

DeepResearchGym: 一个免费、透明且可复现的深度研究评估沙盒

João Coelho, Jingjie Ning, Jingyuan He, Kangrui Mao, Abhijay Paladugu, Pranav Setlur, Jiahe Jin, Jamie Callan, João Magalhães, Bruno Martins, Chenyan Xiong

专题命中 安全评测 :alignment(abstract)

AI总结 DeepResearchGym提供了一个免费、透明且可复现的深度研究评估沙盒,结合可复现的搜索API和严谨的评估协议,用于评估深度研究系统性能,展示其在成本效益训练中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15497 2025-12-16 eess.SP 50%

A Review of Machine Learning for Cavitation Intensity Recognition in Complex Industrial Systems

机械系统中空化强度识别的机器学习综述

Yu Sha, Ningtao Liu, Haofeng Liu, Junqi Tao, Zhenxing Niu, Guojun Huang, Yao Yao, Jiaqi Liang, Moxian Qian, Horst Stoecker, Domagoj Vnucec, Andreas Widl, Kai Zhou

专题命中 安全评测 :safety(abstract)

AI总结 本文综述了机械系统中空化强度识别的机器学习发展,强调传统方法与深度学习的演变,并展望未来在多源数据处理和工业应用中的发展方向。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏