arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9419 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9419 篇

2602.03285 2026-02-04 cs.AI 57%

MeetBench-XL: Calibrated Multi-Dimensional Evaluation and Learned Dual-Policy Agents for Real-Time Meetings

MeetBench-XL: 一种经过校准的多维评估和学习双策略代理用于实时会议

Yuelin Hu, Jun Xu, Bingcong Lu, Zhengxue Cheng, Hongwei Hu, Ronghua Wu, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MeetBench-XL通过多维评估和学习双策略代理提升实时会议AI助手的性能与效率

Comments accepted by AAAI2026 ws

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01155 2026-02-04 cs.AI cs.SE 57%

Multi-Agent Causal Reasoning System for Error Pattern Rule Automation in Vehicles

多智能体因果推理系统用于车辆中错误模式规则自动化

Hugo Math, Julian Lorenz, Stefan Oelsner, Rainer Lienhart

机构 * BMW Group(宝马集团) Augsburg University(奥格斯堡大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 CAREP通过多智能体系统自动发现车辆错误模式规则,提供透明因果解释,提升故障诊断的自动化与可解释性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01858 2026-02-03 cs.AI 57%

SOPRAG: Multi-view Graph Experts Retrieval for Industrial Standard Operating Procedures

SOPRAG:面向工业标准操作规程的多视图图专家检索

Liangtao Lin, Zhaomeng Zhu, Tianwei Zhang, Yonggang Wen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 SOPRAG通过多视图图专家检索框架,解决工业SOP检索中的结构复杂性和条件依赖性问题,提升检索准确性和响应实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01640 2026-02-03 cs.CL 57%

A2Eval: Agentic and Automated Evaluation for Embodied Brain

A2Eval: 基于代理的自动评估用于具身脑

Shuai Zhang, Jiayu Hu, Zijie Chen, Zeyuan Ding, Yi Zhang, Yingji Zhang, Ziyi Zhou, Junwei Liao, Shengjie Zhou, Yong Dai, Zhenzhong Lan, Xiaozhu Ju

机构 * Zhejiang University, China(浙江大学) Westlake University, China(西湖大学) Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心) University of Manchester, UK(曼彻斯特大学) Southern University of Science(南方科技大学) Xiamen University Malaysia, Malaysia(厦门大学马来西亚分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 A2Eval提出首个基于代理的自动评估框架,通过两个协作代理自动化基准编纂和评估,显著提升评估效率并减少成本,同时保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15519 2026-02-03 cs.AI 57%

TransportAgents: a multi-agents LLM framework for traffic accident severity prediction

TransportAgents: 一种用于交通事故严重性预测的多智能体LLM框架

Zhichao Yang, Jiashu He, Jinxuan Fan, Cirillo Cinzia

机构 * Civil and Environmental Engineering, University of Maryland(大学环境工程系,马里兰州大学) Computer and Information Science, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学) Statistics, University of California, Berkeley(统计学系,加州大学伯克利分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 TransportAgents通过多智能体框架提升交通事故严重性预测的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21717 2026-02-03 cs.CL cs.CV 57%

CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution

CrossCheck-Bench:多模态冲突解决中的组成性故障诊断

Baoliang Tian, Yuxuan Si, Jilong Wang, Lingyao Li, Zhongyuan Bao, Zineng Zhou, Tao Wang, Sixu Li, Ziyao Xu, Mingze Wang, Zhouzhuo Zhang, Zhihao Wang, Yike Yun, Ke Tian, Ning Yang, Minghui Qiu

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 CrossCheck-Bench通过多阶段注释流程构建的基准测试,揭示了多模态模型在处理跨模态冲突时的瓶颈,并表明融合符号推理与视觉处理的方法能提升模型的稳健性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01452 2026-02-03 cs.CV cs.AI 57%

Cross-Paradigm Evaluation of Gaze-Based Semantic Object Identification for Intelligent Vehicles

跨范式评估基于注视的语义物体识别用于智能车辆

Penghao Deng, Jidong J. Yang, Jiachen Bian

机构 * Smart Mobility & Infrastructure Laboratory(智能移动与基础设施实验室) College of Engineering, University of Georgia(工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文通过三种方法评估基于注视的语义物体识别,发现大型VLM在识别小型安全关键物体上表现优异,但传统检测器在实时性上更高效。

Comments 21 pages, 15 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01346 2026-02-03 cs.AI 57%

Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance

为视觉语言模型选择而基于模型特定任务相似性的层导电性

Wei Yang, Hong Xie, Tao Tan, Xin Li, Defu Lian, Enhong Chen

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,科学技术大学) School of AI and Data Science, University of Science and Technology of China(人工智能与数据科学学院,科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种基于模型特定任务相似性的视觉语言模型选择方法,通过层导电性分析和方向导电性发散度度量,提升模型选择效果。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01240 2026-02-03 cs.CL 57%

Minimizing Mismatch Risk: A Prototype-Based Routing Framework for Zero-shot LLM-generated Text Detection

降低匹配风险:一种基于原型的路由框架用于零样本LLM生成文本检测

Ke Sun, Guangsheng Bao, Han Cui, Yue Zhang

机构 * School of Engineering, Westlake University, China(西交大学工程学院,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出DetectRouter框架,通过两阶段训练学习文本检测器的亲和力,以解决零样本LLM生成文本检测中的匹配风险问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01193 2026-02-03 cs.CL cs.CV 57%

Bridging Lexical Ambiguity and Vision: A Mini Review on Visual Word Sense Disambiguation

弥合词汇歧义与视觉:关于视觉词义消歧的简要综述

Shashini Nilukshi, Deshan Sumanathilaka

机构 * School of Computing Informatics(计算与信息学学院) Institute of Technology(技术研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文综述了视觉词义消歧的发展,探讨了对比模型和LLM在解决词汇歧义中的作用,并指出未来发展方向。

Comments 2 figures, 2 Tables, Accepted at IEEE TIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00982 2026-02-03 cs.CV cs.AI cs.NE cs.RO 57%

Navigating Simply, Aligning Deeply: Winning Solutions for Mouse vs. AI 2025

简洁导航,深度对齐:2025年Mouse vs. AI比赛的获胜方案

Phu-Hoa Pham, Chi-Nguyen Tran, Dao Sy Duy Minh, Nguyen Lam Phu Quy, Huynh Trung Kiet

机构 * University of Science, VNU-HCM Ho Chi Minh City(科学大学,河内-西贡大学,西贡市)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种简洁的架构和深度的ResNet-like架构,分别在视觉鲁棒性和神经对齐方面取得优异成绩,挑战了传统模型复杂性假设。

Comments 15 pages, 8 tables. Technical Report for winning solutions (Track 1 & Track 2) at the NeurIPS 2025 Mouse vs. AI Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00857 2026-02-03 cs.CL cs.IR 57%

Unifying Adversarial Robustness and Training Across Text Scoring Models

统一文本评分模型中的对抗鲁棒性与训练

Manveer Singh Tamber, Hosna Oyarhoseini, Jimmy Lin

机构 * uwaterloo(滑铁卢大学)

专题命中 安全评测 :RLHF(abstract);分类 cs.CL

AI总结 本文提出统一文本评分模型中对抗鲁棒性与训练的方法,通过引入多种对抗训练方法提升模型鲁棒性和任务效果,并展示其在RLHF中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00539 2026-02-03 cs.LG 57%

OpenDDI: A Comprehensive Benchmark for DDI Prediction

OpenDDI: 一种全面的DDI预测基准

Xinmo Jin, Bowen Fan, Xunkai Li, Henan Sun, YuXin Zeng, Zekai Chen, Yuxuan Sun, Jia Li, Qiangqiang Dai, Hongchao Qin, Rong-Hua Li, Guoren Wang

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 OpenDDI提出一个全面的DDI预测基准,统一了多种数据集和评估标准,揭示了当前DDI预测的局限性并提供了关键指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07450 2026-02-03 cs.CV cs.CL 57%

GLEAM: Learning to Match and Explain in Cross-View Geo-Localization

GLEAM: 在跨视图地理定位中学习匹配与解释

Xudong Lu, Zhi Zheng, Yi Wan, Yongxiang Yao, Annan Wang, Renrui Zhang, Panwang Xia, Qiong Wu, Qingyun Li, Weifeng Lin, Xiangyu Zhao, Peifeng Ma, Xue Yang, Hongsheng Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 GLEAM提出了一种结合多模态、多视角对齐与可解释对应分析的CVGL方法,通过双阶段训练策略提升精度并增强可解释性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00376 2026-02-03 cs.LG 57%

MATRIX: A Multimodal Benchmark and Post-Training Framework for Materials Science

MATRIX: 一种用于材料科学的多模态基准和后训练框架

Delia McGrath, Curtis Chong, Rohil Kulkarni, Gerbrand Ceder, Adeesh Kolluru

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 MATRIX通过多模态后训练提升材料科学推理,展示视觉引导对实验解释和文本任务的显著改进。

Comments 17 pages, 9 Figures, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00340 2026-02-03 cs.CV cs.AI 57%

Bridging the Semantic Chasm: Synergistic Conceptual Anchoring for Generalized Few-Shot and Zero-Shot OOD Perception

弥合语义鸿沟:协同概念锚定用于通用少样本和零样本OOD感知

Alexandros Christoforos, Sarah Jenkins, Michael Brown, Tuan Pham, David Chen

机构 * Boston University(波士顿大学) Suffolk University(苏富比大学) Kyung Hee University, South Korea(韩国庆熙大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 SynerNet通过协同神经代理网络框架,解决视觉语言模型在分布外概念感知中的跨模态对齐退化问题,提升少样本和零样本场景下的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00292 2026-02-03 cs.CV cs.AI 57%

LogicGaze: Benchmarking Causal Consistency in Visual Narratives via Counterfactual Verification

LogicGaze:通过反事实验证基准测试视觉叙事中的因果一致性

Rory Driscoll, Alexandros Christoforos, Chadbourne Davis

机构 * Boston University(波士顿大学) Suffolk University(索尔福德大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 LogicGaze通过反事实验证基准测试,评估视觉语言模型在视觉叙事中因果一致性验证的能力,揭示了现有模型在处理因果链和幻觉问题上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00219 2026-02-03 cs.CR cs.AI 57%

Tri-LLM Cooperative Federated Zero-Shot Intrusion Detection with Semantic Disagreement and Trust-Aware Aggregation

三LLM协作联邦零日入侵检测:基于语义分歧与信任感知的聚合

Saeid Jamshidi, Omar Abdul Wahab, Foutse Khomh, Kawser Wazed Nafi

机构 * SWAT Laboratory, Polytechnique Montréal(Polytechnique Montréal SWAT 实验室) Department of Computer and Software Engineering, Polytechnique Montréal(Polytechnique Montréal 计算机与软件工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于三LLM的联邦IDS框架,通过语义监督实现零日入侵检测,提升对未知攻击行为的识别能力,同时增强对异构和不可靠客户端的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00082 2026-02-03 q-fin.ST cs.AI q-fin.TR 57%

Design and Empirical Study of a Large Language Model-Based Multi-Agent Investment System for Chinese Public REITs

基于大语言模型的多智能体投资系统设计与实证研究:中国公共REITs市场

Zheng Li

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究设计并实证了一种基于大语言模型的多智能体投资系统,用于中国公共REITs市场,通过多智能体协作提升交易的风险调整收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06979 2026-02-03 cs.CL 57%

MedTutor: A Retrieval-Augmented LLM System for Case-Based Medical Education

MedTutor: 一种基于检索的LLM系统用于基于病例的医学教育

Dongsuk Jang, Ziyao Shangguan, Kyle Tegtmeyer, Anurag Gupta, Jan Czerminski, Sophie Chheang, Arman Cohan

机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) Department of Radiology and Biomedical Imaging, Yale School of Medicine(耶鲁医学院放射学与生物医学成像系) Interdisciplinary Program for Bioengineering, Seoul National University(首尔国立大学生物工程跨学科项目)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 MedTutor是一种基于检索的LLM系统,通过自动从临床病例报告生成教育内容和多项选择题,提升医学教育质量。

Comments Accepted to EMNLP 2025 (System Demonstrations)

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing: System Demonstrations, pages 319-353

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01017 2026-02-02 cs.AI 57%

ChartAnchor: Chart Grounding with Structural-Semantic Fidelity

ChartAnchor: 图表接地与结构-语义保真

Xinhang Li, Jingbo Zhou, Pengfei Luo, Yixiong Xiao, Tong Xu

机构 * Baidu Research(百度研究) USTC

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 ChartAnchor提出一个综合图表接地基准测试,通过图表到代码生成和受控表格重建任务,评估模型在结构和数值层面的保真度,揭示MLLMs在数值精度和代码合成方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22702 2026-02-02 cs.LG 57%

Metric Hub: A metric library and practical selection workflow for use-case-driven data quality assessment in medical AI

Metric Hub: 一个用于医疗AI中以用例为导向的数据质量评估的度量库和实用选择流程

Katinka Becker, Maximilian P. Oppelt, Tobias S. Zech, Martin Seyferth, Sandie Cabon, Vanja Miskovic, Ivan Cimrak, Michal Kozubek, Giuseppe D'Avenio, Ilaria Campioni, Jana Fehr, Kanjar De, Ismail Mahmoudi, Emilio Dolgener Cantu, Laurenz Ottmann, Andreas Klaß, Galaad Altares, Jackie Ma, Alireza Salehi M., Nadine R. Lang-Richter, Tobias Schaeffter, Daniel Schwabe

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 Metric Hub提出一个医疗AI中以用例为导向的数据质量评估度量库和选择流程,通过度量卡片和决策树提升数据质量评估的实用性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22699 2026-02-02 cs.CL 57%

Models Know Models Best: Evaluation via Model-Preferred Formats

模型最擅长模型评估:通过模型偏好的格式进行评估

Joonhak Lee, Sungmok Jung, Jongyeon Park, Jaejin Lee

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Dept. of Computer Science and Engineering, Seoul National University(计算机科学与工程系,首尔国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种动态格式对齐策略,通过模型生成的信号确定最佳评估格式,提升零样本准确率,揭示模型潜在能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21337 2026-02-02 cs.CL cs.SD eess.AS 57%

Qwen3-ASR Technical Report

Qwen3-ASR 技术报告

Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

机构 * Qwen Team(通义实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 Qwen3-ASR 提出两个端到端语音识别模型和非自回归强制对齐模型,实现多语言识别与高效转录,展示最佳准确率与效率平衡。

Comments https://github.com/QwenLM/Qwen3-ASR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21947 2026-01-30 cs.AI 57%

ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models

ToolWeaver: 为大语言模型中的可扩展工具使用编织协作语义

Bowen Fang, Wen Ye, Yunyue Su, Jinghao Zhang, Qiang Liu, Yesheng Liu, Xin Sun, Shu Wu, Jiabing Yang, Baole Wei, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR),自动化研究所,中国科学院(CASIA)) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 ToolWeaver通过编码工具为层次序列,解决大语言模型中工具使用中的语义和可扩展性问题,提升工具协作学习的效率与效果。

Comments 10pages, 12 figures, Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21802 2026-01-30 cs.AI 57%

A Unified XAI-LLM Approach for EndotrachealSuctioning Activity Recognition

面向气管吸引活动识别的统一XAI-LLM方法

Hoang Khang Phan, Quang Vinh Dang, Noriyo Colley, Christina Garcia, Nhat Tan Le

机构 * Dept. of Biomedical Engineering(生物医学工程系) Manning College of Information(信息与计算机科学学院) Faculty of Health Science(健康科学学院) Kyushu Institute of Technology(九州工业大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种统一的XAI-LLM框架,用于气管吸引活动识别,通过LLM实现时空活动识别和可解释反馈,提升培训效率和患者安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21786 2026-01-30 cs.CV cs.AI cs.GR 57%

Synthetic-to-Real Domain Bridging for Single-View 3D Reconstruction of Ships for Maritime Monitoring

单视图3D船舶重建用于海上监控的合成到现实领域桥梁

Borja Carrillo-Perez, Felix Sattler, Angel Bueno Rodriguez, Maurice Stephan, Sarah Barnes

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种基于合成数据的单视图3D船舶重建方法,通过高效网络和领域迁移技术,实现海上监控的实时3D可视化。

Journal ref Applications of Machine Learning 2025, Proc. of SPIE Vol. 13606, 136061G 2025 Published by SPIE 0277-786X

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19236 2026-01-30 cs.CL 57%

Evaluating Text Creativity across Diverse Domains: A Dataset and Large Language Model Evaluator

在不同领域评估文本创造力:一个数据集和大语言模型评估器

Qian Cao, Xiting Wang, Yuzhuo Yuan, Yahui Liu, Fang Luo, Ruihua Song

机构 * Renmin University of China(中国人民大学) Beijing Normal University(北京师范大学) Kuaishou Technology(快手科技)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种基于CreataSet数据集的CrEval评估器,通过结合人类和合成数据提升大语言模型的创造力评估效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21403 2026-01-30 cs.AI cs.MA 57%

DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis

DataCross: 一个统一的基准和代理框架,用于跨模态异构数据分析

Ruyi Qi, Zhou Liu, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 DataCross提出一个统一的基准和代理框架,用于跨模态异构数据分析,通过多步骤联合推理提升事实性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21189 2026-01-30 cs.CR cs.AI 57%

Adaptive and Robust Cost-Aware Proof of Quality for Decentralized LLM Inference Networks

自适应和稳健的成本感知质量证明用于去中心化大语言模型推理网络

Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

机构 * DGrid AI

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种自适应和稳健的成本感知质量证明机制,通过鲁棒聚合规则和动态信任权重提升共识一致性,减少对抗攻击影响。

详情

展开后加载摘要…

URL PDF HTML 收藏