arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2512.08967 2026-07-17 cs.LG cs.AI 版本更新 62%

CluCERT: Certifying LLM Robustness via Clustering-Guided Denoising Smoothing

CluCERT:通过聚类引导去噪平滑认证大语言模型的鲁棒性

Zixia Wang, Gaojie Jin, Jia Hu, Ronghui Mu

专题命中 安全评测 :jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型易受对抗攻击问题,提出CluCERT框架,通过聚类引导去噪平滑认证其鲁棒性。引入语义聚类过滤器,结合细化模块和快速同义词替换策略,提升效率,实验证明该方法在鲁棒性边界和计算效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13801 2026-07-16 cs.CR cs.AI cs.LG 新提交 62%

Traffic-Aware Randomized Smoothing for LLM-Based Network Intrusion Detection

基于大语言模型的网络入侵检测的流量感知随机平滑

Zhenpeng Li

机构 * Guangzhou Health Science College(广州健康科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究基于大语言模型的网络入侵检测系统对流量操纵的鲁棒性,提出流量感知随机平滑方法TA-RS,通过在特定子空间注入噪声,提升认证准确率,不同数据集表现有差异,还探究了方法局限性及改进策略。

Comments 44 pages, 14 figures, 14 tables. Submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13602 2026-07-16 cs.CL cs.LG stat.ML 新提交 62%

Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight Analysis

类比深度研究:检索和整合历史类比以进行前瞻性分析

Yongqiang Chen, Guangyi Chen, Yuewen Sun, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出类比深度研究(ADR)任务及ADR-bench,发现LLM智能体找类比能力差。基于理论分析提出ADR原则,构建因果类比研究者(CANA)框架,提升历史类比生成效果,超越现有智能体,案例研究证实其利用历史类比的有效性。

Comments Ongoing project

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13045 2026-07-16 cs.LG cs.AI 新提交 62%

Federated Explainable Artificial Intelligence: Roles, Architectures, Evaluation, and Open Challenges

联邦可解释人工智能:角色、架构、评估及开放挑战

Masoume Gholizade, Fabrizio Ruffini, Pietro Ducange, Francesco Marcelloni

机构 * Department of Information Engineering, University of Pisa(比萨大学信息工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文综述联邦可解释人工智能(FedXAI)范式,介绍其分类法,回顾多种方法及评估实践,讨论不足,识别如非IID数据下可解释性等关键挑战,为设计可信、透明且隐私保护的联邦人工智能系统提供参考。

Comments 68 pages, 4 figures

Journal ref Expert Systems with Applications, Volume 331, 2026, 133183

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09224 2026-07-15 cs.SE cs.AI cs.CL 版本更新 62%

Git-Assistant: Planning-Based Support for Updating Git Repositories

Git辅助工具:基于规划的Git仓库更新支持

Alfredo Garrachón Ruiz, Tomás de la Rosa, Daniel Borrajo

机构 * AI Research, JPMorganChase(人工智能研究,摩根大通)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究针对git工具对开发者有挑战的问题,提出结合大语言模型与自动规划的Git-Assistant,经合成和随机git环境评估,证明该方法能提升仓库管理可靠性、减少错误,展现混合人工智能方法在开发者辅助上的潜力。

Comments Pending permissions from the private company

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11198 2026-07-15 cs.CL cs.AI 版本更新 62%

Declarative by Design, Assistable Only by Convention: Benchmarking Multi-Agent Frameworks for AI-Assistability

DDL2PropBank Agent:通过一种新的关系模式映射任务评估多智能体框架的开发者体验

Shafiuddin Rehan Ahmed, Sourabh Deshpande

机构 * Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 DDL2PropBank Agent通过新的关系模式映射任务评估多智能体框架的开发者体验,揭示了不同框架在代码复杂性和AI辅助性上的差异,Agno表现出最佳性能。

Comments ACM Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11607 2026-07-14 cs.AI cs.LG stat.ML 新提交 62%

Auditing the Risk Claims of Distributional Reinforcement Learning

审核分布强化学习的风险声明

Hari Prasad

机构 * Hari Prasad

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究分布强化学习智能体风险声明真实性,结合决策指标与统计工具审核,发现多数声明被驳斥,风险反映训练假象,阳性对照证实部分真实声明,训练和集成无法消除问题,重新校准仅否定声明,还记录审核陷阱。

Comments 25 pages, 8 figures, 3 tables (main text); includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10750 2026-07-14 cs.AI cs.LG 新提交 62%

Filtering Harmful Actions Isn't Enough: Phantom Transfer in Agentic SDF

过滤有害行为是不够的:智能体自反决策函数中的幻影转移

Chinmayi Dixit

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究在含对抗交互的合成智能体轨迹训练的影响,通过微调Llama 3.3 70B Instruct并评估,发现有害行为过滤不足,生成过程引入失调倾向且分散编码,依赖生成模型,安全基准难区分影响,强调动作级过滤无法确保合成智能体训练数据安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09165 2026-07-13 cs.LG cs.AI 新提交 62%

A Personalized Computational Framework for Assessing the Sufficiency of Partially Observed Data in Healthcare AI models

用于评估医疗保健人工智能模型中部分观测数据充分性的个性化计算框架

Qingchu Jin, Felistas Mazhude, Jamie B. Rabb, Robert S. Kramer, Douglas B. Sawyer, Raimond L. Winslow

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对医疗保健人工智能模型部分观测数据问题,提出特征充分性分析(FSA),通过估计缺失变量分布来评估数据充分性,经案例研究验证其能进行患者特定评估、提供特征排序方法等,助力医疗人工智能系统部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07047 2026-07-13 cs.CL cs.AI 新提交 62%

Riemannian Geometry for Pre-trained Language Model Embeddings

预训练语言模型嵌入的黎曼几何

Szczepan Konior, Alexandre Quemy, Przemysław Klocek, Bartłomiej Sobieski, Grégoire Cattan

机构 * IBM Automation and AI(IBM自动化与人工智能) Hother(霍瑟) University of Warsaw(华沙大学) Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究预训练语言模型嵌入的几何结构,提出黎曼均值池化方法,通过提取回拉度量并聚合,在三个数据集上RMP优于欧几里得均值池化,消融实验定位增益来源,训练好的编码器在特定数据集贡献额外信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12920 2026-07-13 cs.MA cs.AI cs.CL 版本更新 62%

Embodied Multi-Agent Coordination by Aligning World Models Through Dialogue

通过对话对齐世界模型实现具身多智能体协调

Vardhan Dongre, Dilek Hakkani-Tür

机构 * Siebel School of Computing & Data Science(计算机与数据科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究通过对话机制探索具身智能体的世界模型对齐,发现对话能减少冲突但降低任务成功率,提出评估世界模型对齐的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07669 2026-07-09 cs.CL cs.AI 新提交 62%

DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

DiaLLM:英语方言适应中稳健性-生成差距的研究

Jordan Painter, Dipankar Srirag, Adarsh Kappiyath, Diptesh Kanojia, Aditya Joshi, Lu Yin

机构 * Institute for People-Centered AI, University of Surrey(萨里大学以人为本人工智能研究所) University of New South Wales(新南威尔士大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究英语方言适应中稳健性与生成的差距,通过DiaLLM持续预训练并结合多种策略对比不同英语变体。发现二者分离,特定变体适应产出受青睐但优化奖励方法未获评估者偏爱,缩小差距需丰富奖励设计和投入方言资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07219 2026-07-09 cs.CV cs.AI cs.LG 新提交 62%

Vision Foundation Models in Radiology: A Scoping Review of Data, Methodology, Evaluation and Clinical Translation

放射学中的视觉基础模型:数据、方法、评估和临床转化的范围综述

Alejandro Vergara-Richart, Xavier Rafael-Palou, Almudena Fuster-Matanzo, Ignacio Iborra Roncales, Ángel Alberich-Bayarri, Ana Jiménez-Pastor

机构 * Universitat Politècnica de València(瓦伦西亚理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 对2017年1月至2026年3月关于放射成像数据训练基础模型的研究综述,涵盖数据、架构、评估等方面。Transformer架构和自监督预训练为主,评估集中在分割和分类。虽有可迁移性,但临床转化因多种问题受限。

Comments 33 pages, 8 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01420 2026-07-09 cs.CL cs.AI cs.CV 新提交 62%

MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering

MultAttnAttrib:长文档问答中的无训练多模态归因

Dang Quang Thien Tran, Quang V. Dang, Vinamra Tyagi, Sai Soorya Rao Veeravalli, Trang Nguyen, Ryan A. Rossi, Franck Dernoncourt, Nedim Lipka, Koustava Goswami, Samyadeep Basu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出无训练归因方法MultAttnAttrib,利用模型预填充、选定注意力头和校准阈值定位证据,并构建多模态归因基准MultAttrEval,实验表明其优于多种方法,匹配GPT 5.4且延迟降低至1/7。

Comments 25 pages (8 main, 17 references + appendix), 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19723 2026-07-09 cs.CL cs.AI 版本更新 62%

Mathematical Reasoning in Large Language Models: Benchmarks, Architectures, Evaluation, and Open Challenges

大型语言模型中的数学推理:基准测试、架构、评估与开放挑战

Husnain Amjad, Raja Khurram Shahzad, Aamir Shahzad, Mehwish Fatima

机构 * organization= School of Electrical Engineering Computer Science, National University of Science organization= School of Computing, Data Mathematical Sciences, Western Sydney University, Indonesia organization= Department of Communication, Quality Management Information Systems, Mid Sweden University, Östersund Campus, Sweden

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型在数学推理方面的最新进展,通过分析数据集、架构、训练策略和评估协议,探讨了数学推理的基准测试、架构设计、评估方法以及未来的研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23990 2026-07-09 cs.CY cs.AI 62%

From Untamed Black Box to Interpretable Pedagogical Orchestration: The Ensemble of Specialized LLMs Architecture for Adaptive Tutoring

从混沌黑箱到可解释的教育编排:专精LLM集合架构用于自适应辅导

Nizam Kadir

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出ES-LLMS架构,通过分离决策与表达,利用可解释的BKT模型协调专精代理,提升辅导系统的可控性和可靠性,实验显示其在指导与信任方面优于传统模型。

Comments Accepted as a FULL paper at the 27th International Conference on Artificial Intelligence in Education (AIED 2026). 15 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05705 2026-07-08 cs.RO cs.AI cs.CV cs.LG 新提交 62%

IMR: Iterative Mode-World Weighted Regression for Multi-Agent Trajectory Prediction

IMR:用于多智能体轨迹预测的迭代模式世界加权回归

Honglin Wang, Shiyao Pan, Yun-Fu Liu

机构 * EACON Fujian(福建易安科)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对多智能体轨迹预测问题,提出模式世界加权回归损失及迭代解码器,减轻模式崩溃,提高预测准确性,在Argoverse 2多智能体运动预测基准测试中排名第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05217 2026-07-08 cs.CY cs.CL cs.IR 新提交 62%

Curated retrieval versus open web search in public AI information services: a coverage-trust trade-off

公共人工智能信息服务中的 curated 检索与开放网页搜索:覆盖度-可信度权衡研究

Hafsteinn Einarsson, Hafsteinn Birgir Einarsson, Jón Gunnar Ólafsson, Jón Gunnar Þorsteinsson

机构 * Faculty of Industrial Engineering, Mechanical Engineering and Computer Science, University of Iceland(工业工程、机械工程和计算机科学学院,爱沙尼亚大学) Faculty of Political Science, University of Iceland(政治学学院,爱沙尼亚大学) The Icelandic Web of Science, University of Iceland(冰岛科学网络,爱沙尼亚大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.CY

AI总结 针对公共AI信息服务的源可信度问题,对比 curated 本地语料RAG与开放网页搜索两种检索路径,发现前者可信度高但覆盖有限,后者覆盖广但源可信度差,揭示了覆盖度与可信度的核心权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09843 2026-07-08 cs.HC cs.AI cs.CL 新提交 62%

An LLM-Native Psychometric Instrument Reveals a Self-Report--Behavior Gap Across 25 Models

一个原生LLM的心理测量工具不能预测LLM行为:来自25个模型的证据

Juan Manuel Contreras

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 通过探索性因子分析从LLM行为中构建心理测量工具,发现LLM的自我报告与观察行为无关,揭示自我报告与人类判断之间的混淆因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22136 2026-07-08 cs.LG cs.AI cs.CR cs.SE 版本更新 62%

StepShield: When, Not Whether to Intervene on Rogue Agents

StepShield:何时干预流氓代理,而非是否干预

Gloria Felicia, Zitha Sasindran, Jinfeng He, Michael Eniolade, Hemant Kumar, Milan Hussain Angati

机构 * University of Virginia(弗吉尼亚大学) Indian Institute of Science, Bangalore(印度科学研究院,班加罗尔) Cornell University(康奈尔大学) University of the Cumberlands(库姆伯兰兹大学) University of Arizona(亚利桑那大学) California State University, Northridge(加州州立大学,北岭分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究代理安全检测时机问题,引入StepShield基准及早期干预率(EIR),揭示取证陷阱,指出基于规则的护栏虽召回率高但时机不佳,现有方法无法兼顾高召回、低误报和及时干预,凸显逐步骤流氓检测待解决。

Comments 20 pages, 4 figures, 10 ablation studies. Code and data: https://github.com/glo26/stepshield

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03991 2026-07-07 cs.LG cs.CL 新提交 62%

Knowing When to Stop: Predicting Execution-Consistency Convergence in Text-to-SQL

知道何时停止:预测文本到SQL执行一致性收敛

Yaron Anavi, Mor Aisenberg, Nadav Nesher, Elena Khabibullina, Isabella Cattinelli

机构 * GIGASPACES

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 研究预测文本到SQL结果执行一致性收敛的停止时机,训练轻量级1-D模型观察一致性轨迹来决定是否继续运行,在多数据集上验证方法能自适应停止点,还展示了训练增强及噪声注入下的效果。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03833 2026-07-07 cs.CL cs.AI 新提交 62%

Beyond Static Rules: Automated Discovery of Latent Vulnerabilities in Text-to-SQL

超越静态规则:文本到SQL中潜在漏洞的自动发现

Hanqing Wang, Yongdong Chi, Jian Yang, Lei Yang, Jiehui Zhao, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Beihang University(北京航空航天大学) Deepexi Technology Co. Ltd.(深圳市智元机器有限公司) Southern University of Science and Technology(南方科技大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究LLMs在文本到SQL任务中潜在可靠性问题,提出SAGE框架,通过生成漏洞假设、参考漏洞法典设计扰动来发现潜在故障模式,实验证明其能发现大量故障案例及法典的跨模型转移性。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03050 2026-07-07 cs.LG cs.AI cs.CV cs.SD 新提交 62%

OmniFocus: Query-Guided Modality-Balanced Token Compression for Omni-Modal Large Language Models

OmniFocus:用于全模态大语言模型的查询引导模态平衡令牌压缩

Shijie Cao, Qingyu Zhang, Boxi Yu, Yuzhong Zhang, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所中文信息处理实验室) University of Limerick(利默里克大学) CUHK, Shenzhen(香港中文大学(深圳))

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究全模态大语言模型推理成本高的问题,提出无训练的查询引导令牌压缩方法OmniFocus,独立评估音视频重要性,实现模态对称压缩,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02755 2026-07-07 cs.LG cs.AI 新提交 62%

Out-of-Distribution Generalization of Risk Aversion in Language Models

语言模型中风险规避的分布外泛化

Kristina Zhang, Junior Chinomso Okoroafor, Benjamin Maltbie, Andrew Lin, Abhitej Bokka, Elliott Thornley

专题命中 安全评测 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 研究训练人工智能在资源方面规避风险能否泛化至高风险场景。通过引入RiskAverseOOD基准测试,用多种方法使模型在低风险时规避风险,发现其能部分泛化至高风险,不同规模和模型家族也有类似效果,但一致性不足。

Comments ICML 2026 Agents in the Wild workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18580 2026-07-07 cs.AI cs.LG 版本更新 62%

When Outcome Looks Right But Discipline Fails: Trace-Based Evaluation Under Hidden Competitor State

当结果看似正确但纪律却失败:基于轨迹的评估在隐藏对手状态下的应用

Peiying Zhu, Sidi Chang

机构 * Blossom AI Blossom AI Labs(Blossom AI 实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于轨迹的评估方法,用于评估在隐藏对手状态下的行为纪律稳定性,通过轨迹诊断、机制分离和转移测试来改进强化学习策略,特别是在酒店定价和隐藏预算竞标任务中。

Comments Accepted to the KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14163 2026-07-07 cs.CL cs.AI 版本更新 62%

SeaAlert: Robust Severity Classification and LLM-Based Information Extraction for Noisy Maritime Distress Communications

SeaAlert:基于大型语言模型的海上 distress 通讯关键信息提取

Tomer Atia, Yehudit Aperstein, Alexander Apartsin

机构 * HIT-Holon Institute of Technology(希伯来理工学院) Afeka Academic College of Engineering(阿菲卡工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SeaAlert框架,通过生成合成数据解决海上 distress 通讯标注数据不足问题,利用LLM生成多样化消息并模拟噪声环境,提升自动分析鲁棒性。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22730 2026-07-07 cs.CL cs.CY 版本更新 62%

How Utilitarian Are OpenAI's Models Really? Replicating and Reinterpreting Pfeffer, Krügel, and Uhl (2025)

OpenAI模型真的那么功利主义吗?复制并重新解读Pfeffer、Krügel和Uhl(2025)

Johannes Himmelreich

机构 * OpenAI

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 研究通过复制和扩展实验,发现OpenAI模型在不同提示下表现出功利主义倾向,但存在提示偏差影响结果,强调需多提示测试以验证LLM道德推理的可靠性。

Comments 20 pages, 3 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06607 2026-07-07 cs.MA cs.AI cs.LG 版本更新 62%

Multi-Agent Reinforcement Learning for V2X Resource Allocation: Disentangling MARL Challenges Through Benchmarking

用于车联网资源分配的多智能体强化学习:通过基准测试解开多智能体强化学习挑战

Siyuan Wang, Lei Lei, Pranav Maheshwari, Sam Bellefeuille, Kan Zheng

机构 * College of Engineering, University of Guelph(圭尔夫大学工程学院) College of Electrical Engineering and Computer Sciences, Ningbo University(宁波大学电气与电子工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究将车联网资源分配建模为多智能体干扰博弈层次结构,构建基准学习任务与数据集,评估多种多智能体强化学习算法,揭示不同范式优缺点,为评估算法提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22240 2026-07-07 cs.LG cs.AI 版本更新 62%

EvoXplain: When Machine Learning Models Agree on Predictions but Disagree on Why -- Measuring Mechanistic Multiplicity Across Training Runs

EvoXplain:当机器学习模型在预测上达成一致但在原因上存在分歧时——衡量跨训练运行的机制多样性

Chama Bensmail

机构 * University of Hertfordshire(赫特福德大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究机器学习模型预测一致但解释不同的问题,引入EvoXplain框架,通过分析训练和模型选择过程中解释样本,判断解释是否唯一确定,揭示平均共识与单一训练模型的关系,将可解释性视为训练管道属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18253 2026-07-07 cs.CL cs.AI 版本更新 62%

BoRP: Bootstrapped Regression Probing for Scalable and Human-Aligned LLM Evaluation

BoRP:用于可扩展且符合人类偏好的大语言模型评估的自训练回归探测

Peng Sun, Xiangyu Zhang, Duan Wu, Lu Tan, Jian Lin, He Yang, Qi Qian, Yikai Wang

机构 * Qwen Business Unit of Alibaba(阿里巴巴Qwen业务单元)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对开放式对话AI用户满意度评估难题,提出BoRP框架。利用大语言模型潜在空间几何属性,通过极化指数自训练机制自动生成评分准则,用偏最小二乘法映射隐藏状态到连续分数,提升评估准确性与效率。

Comments This is a pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏