arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-03 至 2026-02-03 共收录 48 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 48 篇

2602.00061 2026-02-03 cs.CY cs.AI 88%

Simple Role Assignment is Extraordinarily Effective for Safety Alignment

简单的角色分配在安全对齐中表现尤为有效

Zhou Ziheng, Jiakun Ding, Zhaowei Zhang, Ruosen Gao, Yingnian Wu, Demetri Terzopoulos, Yipeng Kang, Fangwei Zhong, Junqi Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Tianjin University(天津大学) Peking University(北京大学) Zhejiang University(浙江大学) Beijing Institute of General Artificial Intelligence(北京一般人工智能研究院)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究提出基于角色条件化的安全对齐方法,通过角色隐含编码价值观和认知模式,有效降低不安全输出,适用于多种AI对齐任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01600 2026-02-03 cs.CR cs.CL cs.CY cs.LG 85%

Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs

预期危害:重新思考对(误)对齐大语言模型的安全性评估

Yen-Shan Chen, Zhi Rui Tam, Cheng-Kuang Wu, Yun-Nung Chen

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 本文提出预期危害指标,通过分析发现模型对高成本低可能性威胁的拒绝行为与高可能性低成本威胁的易受攻击现象,揭示模型对执行成本的

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05980 2026-02-03 cs.CL cs.LG 84%

Lost in Localization: Building RabakBench with Human-in-the-Loop Validation to Measure Multilingual Safety Gaps

迷失于定位:通过人类在环验证构建RabakBench以衡量多语言安全差距

Gabriel Chua, Leanne Tan, Ziyu Ge, Roy Ka-Wei Lee

机构 * GovTech, Singapore(新加坡政府科技局) Singapore University of Technology and Design(新加坡科技与设计大学)

专题命中 安全评测 :safety(title,abstract);red teaming(abstract);分类 cs.CL、cs.LG

AI总结 RabakBench通过人类在环验证构建,用于衡量多语言安全差距,通过三阶段流程生成、标注和翻译数据,评估LLM在低资源语言中的安全性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01824 2026-02-03 cs.HC cs.CY 79%

Risk, Data, Alignment: Making Credit Scoring Work in Kenya

风险、数据、对齐:使肯尼亚的信用评分有效

Daniel Mwesigwa, Steven J. Jackson, Christopher Csikszentmihalyi

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

AI总结 本文探讨肯尼亚信用评分中风险、数据与对齐的动态关系,揭示算法信用评分通过持续的社会技术工作稳定风险的过程。

Comments Conditionally accepted to ACM CHI 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00641 2026-02-03 cs.AI 79%

AgentAuditor: Human-Level Safety and Security Evaluation for LLM Agents

AgentAuditor: 为LLM代理提供人类水平的安全性和安全性评估

Hanjun Luo, Shenyu Dai, Chiming Ni, Xinfeng Li, Guibin Zhang, Kun Wang, Tongliang Liu, Hanan Salam

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 AgentAuditor通过构建经验记忆和多阶段检索生成过程,提升LLM在代理安全性和安全性评估中的性能,达到人类水平的准确性。

Comments This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00078 2026-02-03 cs.CY cs.AI 76%

Standards for trustworthy AI in the European Union: technical rationale, structural challenges, and an implementation path

欧盟可信人工智能标准:技术依据、结构性挑战及实施路径

Piercosma Bisconti, Marcello Galisai

机构 * Department of Computer, Control and Management Engineering(计算机、控制与管理工程系) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.CY

AI总结 本文提出欧盟人工智能标准化的实施路径,强调通过分层方法和风险管理体系,实现技术标准与法律义务的对接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21900 2026-02-03 cs.CV cs.AI cs.CY cs.MM 76%

TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention

TraceRouter: 通过路径级干预实现大型基础模型的鲁棒安全性

Chuancheng Shi, Shangze Li, Wenjun Lu, Wenhua Wu, Cong Wang, Zifeng Cheng, Fei Shen, Tat-Seng Chua

机构 * The University of Sydney, Sydney, Australia(悉尼大学) Nanjing University of Science(南京理工大学) Nanjing University, Nanjing, China(南京大学) National University of Singapore, Singapore, Singapore(新加坡国立大学)

专题命中 安全评测 :safety(title);分类 cs.AI、cs.CY

AI总结 TraceRouter通过路径级干预有效切断有害语义的因果传播,提升大型基础模型的对抗鲁棒性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16584 2026-02-03 cs.CL cs.AI 73%

From Scores to Steps: Diagnosing and Improving LLM Performance in Evidence-Based Medical Calculations

从分数到步骤:诊断和改进证据医学计算中LLM的性能

Benlu Wang, Iris Xia, Yifan Zhang, Junda Wang, Feiyun Ouyang, Shuo Han, Arman Cohan, Hong Yu, Zonghai Yao

机构 * Department of Computer Science, Yale University, CT, USA(耶鲁大学计算机科学系) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA贝福德医疗中心健康组织与实施研究中心) Miner School of Computer and Information Sciences, UMass Lowell, MA, USA(UMass洛厄尔矿尔计算机与信息科学学院) Manning College of Information and Computer Sciences, UMass Amherst, MA, USA(UMass阿默斯特马宁信息与计算机科学学院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedRaC框架,通过分步评估和代码执行提升LLM在证据医学计算中的准确性,揭示现有评估方法的不足,并推动临床可信度的提升。

Comments Equal contribution for the first two authors. To appear as an Oral presentation in the proceedings of the Main Conference on Empirical Methods in Natural Language Processing (EMNLP) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02295 2026-02-03 cs.LG 70%

EvalQReason: A Framework for Step-Level Reasoning Evaluation in Large Language Models

EvalQReason: 一种用于大型语言模型中分步推理评估的框架

Shaima Ahmad Freja, Ferhat Ozgur Catak, Betul Yurdem, Chunming Rong

机构 * Department of Electrical Engineering and Computer Science, University of Stavanger(电子工程与计算机科学系,斯塔万格大学) Department of Electrical and Electronics Engineering, Izmir Bakircay University(电子与电气工程系,伊兹密尔巴克伊大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 EvalQReason通过分步概率分布分析评估大型语言模型的推理质量,展示了在数学和医学领域中对推理可靠性的有效评估方法。

Comments 15 pages (including appendix), 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18595 2026-02-03 cs.LG 70%

Benchmarking neural surrogates on realistic spatiotemporal multiphysics flows

在现实时空多物理场流中评估神经替代模型

Runze Mao, Rui Zhang, Xuan Bai, Tianhao Wu, Teng Zhang, Zhenyi Chen, Minqi Lin, Bocheng Zeng, Yangchen Xu, Yingxuan Xiang, Haoze Zhang, Shubham Goswami, Pierre A. Dawe, Yifan Xu, Zhenhua An, Mengtao Yan, Xiaoyi Lu, Yi Wang, Rongbo Bai, Haobu Gao, Xiaohang Fang, Han Li, Hao Sun, Zhi X. Chen

机构 * State Key Laboratory for Turbulence and Complex Systems, School of Mechanics and Engineering Science, Peking University(湍流与复杂系统国家重点实验室,力学与工程科学学院,北京大学) Gaoling School of Artificial Intelligence, Renmin University of China(Gallagher人工智能学院,中国人民大学) AI for Science Institute(人工智能科学研究院) University of Calgary(卡尔加里大学) Kyoto University(京都大学) FM Global(FM全球) LandSpace Technology Corporation Ltd.(陆地方向技术有限公司) Aero Engine Academy of China(中国航空发动机学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 REALM通过严谨的基准测试框架评估神经替代模型在现实多物理场流中的表现,揭示了模型在复杂环境中的局限性及改进方向。

Comments 52 pages, 20 figures. Code and data available at https://github.com/deepflame-ai/REALM. Companion website and leaderboard at https://realm-bench.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00070 2026-02-03 cs.CY cs.CL cs.LG 67%

FoundationalASSIST: An Educational Dataset for Foundational Knowledge Tracing and Pedagogical Grounding of LLMs

FoundationalASSIST: 一个用于基础知识追踪和LLM教学基础的教育数据集

Eamon Worden, Cristina Heffernan, Neil Heffernan, Shashank Sonkar

机构 * Worcester Polytechnic Institute(沃斯特理工大学) The ASSISTments Foundation(ASSISTments基金会) University of Central Florida(中央佛罗里达大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 FoundationalASSIST 是首个为研究LLM在教育中的应用而设计的英文教育数据集,提供完整问题文本、学生实际回答和对齐标准,用于评估LLM在知识追踪和教学基础方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02455 2026-02-03 cs.AI cs.CL cs.SE 62%

Drift-Bench: Diagnosing Cooperative Breakdowns in LLM Agents under Input Faults via Multi-Turn Interaction

Drift-Bench: 通过多轮交互诊断LLM代理在输入故障下的合作破裂

Han Bao, Zheyuan Zhang, Pengcheng Jing, Zhengqing Yuan, Kaiwen Shi, Yanfang Ye

机构 * University of Notre Dame(内布拉斯加大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 Drift-Bench通过多轮交互评估LLM代理在输入故障下的合作破裂,采用角色驱动的用户模拟器和Rise评估协议,揭示澄清效果随用户角色和故障类型的变化,推动代理安全评估。

Comments 65 pages, 40 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01937 2026-02-03 cs.LG cs.AI 62%

T-LLM: Teaching Large Language Models to Forecast Time Series via Temporal Distillation

T-LLM:通过时间蒸馏教大语言模型进行时间序列预测

Suhan Guo, Bingxu Wang, Shaodan Zhang, Furao Shen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 T-LLM通过时间蒸馏框架,使通用大语言模型具备时间序列预测能力,实验显示其在多种设置下均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01614 2026-02-03 cs.LG cs.AI 62%

AgroFlux: A Spatial-Temporal Benchmark for Carbon and Nitrogen Flux Prediction in Agricultural Ecosystems

AgroFlux:农业生态系统碳和氮通量预测的空间-时间基准

Qi Cheng, Licheng Liu, Yao Zhang, Mu Hong, Yiqun Xie, Xiaowei Jia

机构 * University of Pittsburgh(匹兹堡大学) University of Minnesota - Twin Cities(明尼苏达大学-双城分校) Colorado State University(科罗拉多州立大学) University of Maryland(马里兰大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 AgroFlux 提出一个空间-时间基准数据集,整合物理模型与现实观测,评估深度学习模型在农业生态系统碳氮通量预测中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00769 2026-02-03 cs.CL cs.AI 62%

Eliciting Trustworthiness Priors of Large Language Models via Economic Games

通过经济游戏 eliciting 大语言模型的信任度先验

Siyu Yan, Lusha Zhu, Jian-Qiao Zhu

机构 * University of Hong Kong(香港大学) The University of Hong Kong(香港大学) Peking University(北京大学) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康重点实验室) IDG/McGovern Institute for Brain Research, Peking University(北京大学脑科学研究院) Peking-Tsinghua Center for Life Sciences, Peking University(北京大学-清华大学生命科学中心) Key Laboratory of Machine Perception, Ministry of Education, China(教育部机器感知重点实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 通过经济游戏实验,研究如何通过行为博弈论中的信任游戏获取大语言模型的信任度先验,并揭示其与人类信任差异及刻板印象模型的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00547 2026-02-03 cs.LG cs.AI 62%

Contrastive Domain Generalization for Cross-Instrument Molecular Identification in Mass Spectrometry

对比域泛化用于质谱中跨仪器分子识别

Seunghyun Yoo, Sanghong Kim, Namkyung Yoon, Hwangnam Kim

机构 * School of Electrical Engineering, Korea University, Seoul 02841, Korea(韩国大学电气工程学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种跨模态对齐框架,通过将质谱直接映射到预训练化学语言模型的分子结构嵌入空间,提升跨仪器分子识别的泛化能力。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01661 2026-02-03 cs.CL cs.AI 62%

Learning the Boundary of Solvability: Aligning LLMs to Detect Unsolvable Problems

学习可解性的边界:对齐大语言模型以检测不可解的问题

Dengyun Peng, Qiguang Chen, Bofei Liu, Jiannan Guan, Libo Qin, Zheng Yan, Jinhao Liu, Jianshu Zhang, Wanxiang Che

机构 * LARG, Research Center for Social Computing and Interactive Robotics, HIT(LARG,社会计算与交互机器人研究中心,哈尔滨工业大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) iFLYTEK

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出UnsolvableQA数据集和UnsolvableRL框架,通过逆向构建引入逻辑矛盾,提升LLM对不可解问题的检测能力,并在Qwen3-4B-Instruct上提升可解推理准确率至69.4%。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13853 2026-02-03 cs.CL cs.AI cs.DB cs.HC 62%

BenchPress: A Human-in-the-Loop Annotation System for Rapid Text-to-SQL Benchmark Curation

BenchPress:一种用于快速文本到SQL基准定制的人机协作标注系统

Fabian Wenz, Omar Bouattour, Devin Yang, Justin Choi, Cecil Gregg, Nesime Tatbul, Çağatay Demiralp

机构 * TU Munich(慕尼黑技术大学) MIT(麻省理工学院) Intel Labs(英特尔实验室) AWS AI Labs(亚马逊AI实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 BenchPress通过人机协作系统加速特定领域文本到SQL基准的创建,结合LLM生成与人类验证提升标注准确性与基准可靠性。

Comments CIDR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15746 2026-02-03 cs.CL cs.AI cs.CV 62%

End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning

端到端代理RAG系统训练用于可追溯的诊断推理

Qiaoyu Zheng, Yuze Sun, Chaoyi Wu, Weike Zhao, Pengcheng Qiu, Yongguo Yu, Kun Sun, Jian Zhang, Yanfeng Wang, Ya Zhang, Weidi Xie

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 Deep-DxSearch通过端到端强化学习训练代理RAG系统,实现可追溯的诊断推理,显著提升诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03194 2026-02-03 cs.CV cs.AI cs.LG 62%

HueManity: Probing Fine-Grained Visual Perception in MLLMs

HueManity: 探索 MLLMs 中的细粒度视觉感知

Rynaa Grover, Jayant Sravan Tamarapalli, Sahiti Yerramilli, Nilay Pande

机构 * Google(谷歌) Waymo

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 HueManity 通过细粒度视觉感知基准测试揭示 MLLMs 在捕捉细粒度视觉细节方面的显著缺陷。

Journal ref ICML 2025 Workshop on Assessing World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00393 2026-02-03 cs.CV cs.CL cs.LG 62%

Brazilian Portuguese Image Captioning with Transformers: A Study on Cross-Native-Translated Dataset

巴西葡萄牙语图像描述生成:跨原生翻译数据集研究

Gabriel Bromonschenkel, Alessandro L. Koerich, Thiago M. Paixão, Hilário Tomaz Alves de Oliveira

机构 * Instituto Federal do Espírito Santo (IFES)(巴西联邦大学埃斯皮里图圣安东尼奥理工学院) École de Technologie Supérieure (ÉTS)(加拿大超技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过跨原生翻译数据集评估Transformer模型在巴西葡萄牙语图像描述生成中的表现,发现Swin-DistilBERTimbau表现优异,GPT-4在CLIP-Score上表现最佳,同时揭示了模型中的系统性偏见。

Comments Accepted to JBCS. 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00046 2026-02-03 cs.LG cs.CL 62%

Extending Beacon to Hindi: Cultural Adaptation Drives Cross-Lingual Sycophancy

将Beacon扩展到印地语:文化适应驱动跨语言趋炎附势

Sarthak Sattigeri

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究通过文化适应提示评估语言模型在印地语中的趋炎附势现象,发现文化因素对跨语言对齐行为有显著影响。

Comments First Hindi sycophancy benchmark using a three-condition design separating language and cultural effects, with empirical evaluation across four instruction-tuned models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00011 2026-02-03 cs.IR cs.AI cs.CL 62%

Chained Prompting for Better Systematic Review Search Strategies

链式提示法提升系统综述搜索策略

Fatima Nasser, Fouad Trad, Ammar Mohanna, Ghada El-Hajj Fuleihan, Ali Chehab

机构 * Electrical and Computer Engineering(电气与计算机工程系) American University of Beirut(贝鲁特美国大学) Department of Internal Medicine(内科系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的链式提示框架,用于自动化生成系统综述的高召回率搜索策略,通过分解目标、提取PICO要素等方法提升检索效果。

Comments Accepted in the 3rd International Conference on Foundation and Large Language Models (FLLM2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23719 2026-02-03 cs.CE cs.AI cs.LG 62%

A Survey of AI Methods for Geometry Preparation and Mesh Generation in Engineering Simulation

工程仿真中几何准备和网格生成的AI方法综述

Steven Owen, Nathan Brown, Nikos Chrisochoides, Rao Garimella, Xianfeng Gu, Franck Ledoux, Na Lei, Roshan Quadros, Navamita Ray, Nicolas Winovich, Yongjie Jessica Zhang

机构 * Sandia National Laboratories(桑迪亚国家实验室) Old Dominion University(旧 Dominion 大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室) New York University / Stony Brook University(纽约大学 / 斯通布鲁克大学) CEA(法国原子能委员会) Dalian University of Technology(大连理工大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了AI在工程仿真中用于几何准备和网格生成的方法,涵盖分类分割、质量预测、去特征化及自动化生成技术,强调AI与传统算法的互补作用。

Comments 47 pages, 0 figure, accepted by the International Meshing Roundtable conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01858 2026-02-03 cs.AI 57%

SOPRAG: Multi-view Graph Experts Retrieval for Industrial Standard Operating Procedures

SOPRAG:面向工业标准操作规程的多视图图专家检索

Liangtao Lin, Zhaomeng Zhu, Tianwei Zhang, Yonggang Wen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 SOPRAG通过多视图图专家检索框架,解决工业SOP检索中的结构复杂性和条件依赖性问题,提升检索准确性和响应实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01640 2026-02-03 cs.CL 57%

A2Eval: Agentic and Automated Evaluation for Embodied Brain

A2Eval: 基于代理的自动评估用于具身脑

Shuai Zhang, Jiayu Hu, Zijie Chen, Zeyuan Ding, Yi Zhang, Yingji Zhang, Ziyi Zhou, Junwei Liao, Shengjie Zhou, Yong Dai, Zhenzhong Lan, Xiaozhu Ju

机构 * Zhejiang University, China(浙江大学) Westlake University, China(西湖大学) Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心) University of Manchester, UK(曼彻斯特大学) Southern University of Science(南方科技大学) Xiamen University Malaysia, Malaysia(厦门大学马来西亚分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 A2Eval提出首个基于代理的自动评估框架,通过两个协作代理自动化基准编纂和评估,显著提升评估效率并减少成本,同时保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15519 2026-02-03 cs.AI 57%

TransportAgents: a multi-agents LLM framework for traffic accident severity prediction

TransportAgents: 一种用于交通事故严重性预测的多智能体LLM框架

Zhichao Yang, Jiashu He, Jinxuan Fan, Cirillo Cinzia

机构 * Civil and Environmental Engineering, University of Maryland(大学环境工程系,马里兰州大学) Computer and Information Science, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学) Statistics, University of California, Berkeley(统计学系,加州大学伯克利分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 TransportAgents通过多智能体框架提升交通事故严重性预测的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21717 2026-02-03 cs.CL cs.CV 57%

CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution

CrossCheck-Bench:多模态冲突解决中的组成性故障诊断

Baoliang Tian, Yuxuan Si, Jilong Wang, Lingyao Li, Zhongyuan Bao, Zineng Zhou, Tao Wang, Sixu Li, Ziyao Xu, Mingze Wang, Zhouzhuo Zhang, Zhihao Wang, Yike Yun, Ke Tian, Ning Yang, Minghui Qiu

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 CrossCheck-Bench通过多阶段注释流程构建的基准测试,揭示了多模态模型在处理跨模态冲突时的瓶颈,并表明融合符号推理与视觉处理的方法能提升模型的稳健性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01452 2026-02-03 cs.CV cs.AI 57%

Cross-Paradigm Evaluation of Gaze-Based Semantic Object Identification for Intelligent Vehicles

跨范式评估基于注视的语义物体识别用于智能车辆

Penghao Deng, Jidong J. Yang, Jiachen Bian

机构 * Smart Mobility & Infrastructure Laboratory(智能移动与基础设施实验室) College of Engineering, University of Georgia(工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文通过三种方法评估基于注视的语义物体识别,发现大型VLM在识别小型安全关键物体上表现优异,但传统检测器在实时性上更高效。

Comments 21 pages, 15 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01346 2026-02-03 cs.AI 57%

Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance

为视觉语言模型选择而基于模型特定任务相似性的层导电性

Wei Yang, Hong Xie, Tao Tan, Xin Li, Defu Lian, Enhong Chen

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,科学技术大学) School of AI and Data Science, University of Science and Technology of China(人工智能与数据科学学院,科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种基于模型特定任务相似性的视觉语言模型选择方法,通过层导电性分析和方向导电性发散度度量,提升模型选择效果。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏