arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2606.08938 2026-06-09 cs.CL cs.AI 新提交 62%

PACT: Learning Diverse Diagnostic Strategies via Privileged Synthesis and Branch Consensus

PACT: 通过特权合成与分支共识学习多样化诊断策略

Gen Li, Yuanze Hu, Zhichao Yang, Qingchen Yu, Jianwei Lv, Yue Guo, Yujing Liu, Faguo Wu, Hongwei Zheng, Xiandong Li, Bo Yuan, Yifan Sun, Zhaoxin Fan

机构 * Beihang University(北京航空航天大学) Baidu(百度) ByteDance(字节跳动) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Renmin University of China(中国人民大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出PACT框架,通过特权合成对话数据和多分支共识训练,使LLM同时学习多种诊断推理范式,在中文医疗诊断基准上取得最优性能。

Comments 16 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08194 2026-06-09 cs.CL cs.AI 新提交 62%

GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models

GlobeAudio:用于大型音频-语言模型自然主义评估的多语言多文化基准

Ryner Tan, Wenxuan Zhang

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出GlobeAudio基准,包含5637道多语言多选题,评估大型音频-语言模型在自然音频条件下的听觉推理和文化理解能力,发现开源模型和低资源语言存在显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08063 2026-06-09 cs.CV cs.AI cs.CL 新提交 62%

Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?

Robust-U1: MLLMs能否自我恢复受损视觉内容以实现鲁棒理解?

Jiaqi Tang, Jianmin Chen, Youyang Zhai, Wei Wei, Runtao Liu, Mengjie Zhao, Xiangyu Wu, Qingfa Xiao, Qifeng Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出Robust-U1框架,通过监督微调、强化学习和多模态推理,使多模态大模型具备显式视觉自恢复能力,在真实和对抗性损坏下达到最先进鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08034 2026-06-09 cs.CV cs.AI cs.CL 新提交 62%

Sci-Rho: A Multilingual Visually-Grounded Symbolic Benchmark for STEM Problems

Sci-Rho:面向STEM问题的多语言视觉基础符号基准

Muhammad Falensi Azmi, Ikhlasul Akmal Hanif, Vallerie Alexandra Putra, Adi Yeltay, Abdullah Mubarak, Fajri Koto

机构 * Independent Researcher(独立研究员) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Binus University(比努斯大学) Bandung Institute of Technology(万隆理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出Sci-Rho,一个多语言、视觉基础的STEM问题动态基准,包含4242个模板和42420个实例,评估17个VLM发现最差精度与平均精度存在差距,且小模型跨语言性能下降。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08000 2026-06-09 cs.CL cs.AI 新提交 62%

Summarization is Not Dead Yet

摘要生成尚未消亡

Dongqi Liu, Chenxi Whitehouse, Zheng Zhao, Zhuchen Cao, Jian Li, Yabiao Wang

机构 * Saarland University(萨尔大学) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过多维度评估,发现人类参考摘要在信息量和忠实度上仍优于大语言模型,后者仅在表面连贯性和流畅性上占优,表明摘要生成研究仍有挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07853 2026-06-09 cs.CL cs.AI 新提交 62%

Beyond English benchmarks: clinical llm evaluation in Brazilian Portuguese

超越英语基准:巴西葡萄牙语临床大语言模型评估

Giordano de Pinho Souza, Glaucia Melo, Josefino Cabral Melo Lima, Daniel Schneider

机构 * Federal University of Rio de Janeiro(里约热内卢联邦大学) Toronto Metropolitan University(多伦多都会大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出首个双语临床基准ClinicalBr,基于巴西病例报告构建,评估四个模型发现葡萄牙语-英语性能差距具有任务依赖性,诊断检索英语优势明显,其他任务差距消失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07603 2026-06-09 cs.LG cs.AI 新提交 62%

MetaEvo: A Meta-Optimization Framework for Experience-Driven Agent Evolution

MetaEvo:一种基于经验驱动的智能体进化的元优化框架

Bowen Ren, Heyan Huang, Yinghao Li, Yang Gao

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Beijing Institute of Technology Southeast Academy of Information Technology(北京理工大学东南信息技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出MetaEvo两阶段框架,通过偏好优化增强模型从任务经验中抽象原则的能力,并在模块化架构中积累复用,持续提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07521 2026-06-09 cs.CL cs.AI 新提交 62%

Evaluating Hallucinations in Domain-Adapted Large Language Models

评估领域自适应大语言模型中的幻觉现象

Sanchita Porwal, Sai Prasath S, Xingjian Bi, Madelyn Scandlen

机构 * College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过微调Llama-2模型,测试其记忆、回忆和推理能力,发现领域自适应大语言模型在生成新领域特定信息时存在幻觉问题,表明仅靠微调难以有效缓解幻觉。

Comments 13 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19276 2026-06-09 cs.CL cs.LG 版本更新 62%

OpenCompass: A Universal Evaluation Platform for Large Language Models

OpenCompass:大型语言模型的通用评估平台

Maosong Cao, Kai Chen, Haodong Duan, Yixiao Fang, Zhiwei Fei, Tong Gao, Ge Jiaye, Mo Li, Hongwei Liu, Junnan Liu, Yuan Liu, Chengqi Lyu, Han Lyu, Ningsheng Ma, Zerun Ma, Yu Sun, Zhiyong Wu, Linchen Xiao, Zhuozhi Xiong, Jun Xu, Haochen Ye, Zhaohui Yu, Yike Yuan, Songyang Zhang, Yufeng Zhao, Fengzhe Zhou, Peiheng Zhou, Dongsheng Zhu, Lin Zhu, Jingming Zhuo

机构 * OpenCompass Team(OpenCompass团队) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出OpenCompass,一个模块化、高兼容性、灵活且高并发的通用LLM评估平台,支持多种任务场景和主流基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04177 2026-06-09 cs.SE cs.AI cs.LG 版本更新 62%

CodeTaste: Can LLMs Generate Human-Level Code Refactorings?

CodeTaste:LLM能否生成人类级别的代码重构?

Alex Thillen, Niels Mündler, Veselin Raychev, Martin Vechev

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM代理在代码重构中的能力,通过CodeTaste基准测试发现,代理在详细指定重构时表现良好,但难以自主发现人类选择的重构,提出“先提议后实现”分解可改善对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07317 2026-06-09 cs.CL cs.LG 版本更新 62%

RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments

RLVE: 利用自适应可验证环境扩展语言模型的强化学习

Zhiyuan Zeng, Hamish Ivison, Yiping Wang, Lifan Yuan, Shuyue Stella Li, Zhuorui Ye, Siting Li, Jacqueline He, Runlong Zhou, Tong Chen, Chenyang Zhao, Yulia Tsvetkov, Simon Shaolei Du, Natasha Jaques, Hao Peng, Pang Wei Koh, Hannaneh Hajishirzi

机构 * University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出RLVE方法,通过程序化生成问题并提供可验证奖励的可验证环境,自适应调整难度以扩展语言模型的强化学习,在400个环境中联合训练使六个推理基准平均提升3.37%。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06526 2026-06-08 cs.AI cs.LG 新提交 62%

CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions

CrowdMath: 众包数学研究讨论数据集

Sherin Muckatira, Jesse Geneson, Slava Gerovitch, Pavel Etingof, Mikhail Gronas, Anna Rumshisky

机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校) San Jose State University(圣何塞州立大学) Massachusetts Institute of Technology(麻省理工学院) Dartmouth College(达特茅斯学院) Amazon AGI(亚马逊人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出CrowdMath数据集,包含164条专家标注的进展链,用于评估大语言模型在协作开放问题求解中的能力,发现模型在局部预测上表现良好但在角色分类上存在不足。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05761 2026-06-08 cs.AI cs.CL 版本更新 62%

SubtleMemory: A Benchmark for Fine-Grained Relational Memory Discrimination in Long-Horizon AI Agents

SubtleMemory: 面向长时程AI智能体的细粒度关系记忆辨别基准

Wenxuan Wang, Haoyu Sun, Fukuan Hou, Mingyang Song, Weinan Zhang, Yu Cheng, Yang Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) Xiamen University(厦门大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SubtleMemory基准,通过构建关系控制的潜在语义伪影并嵌入用户-智能体交互历史,评估长时程AI智能体在后续查询中恢复分布式关系结构的能力。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09552 2026-06-08 cs.IR cs.AI cs.CL 版本更新 62%

MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval

MCERF:通过增强检索推进工程文档的多模态大语言模型评估

Kiarash Naghavi Khanghah, Hoang Anh Nguyen, Anna C. Doris, Amir Mohammad Vahedi, Daniele Grandi, Faez Ahmed, Hongyi Xu

机构 * School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut, Storrs, CT 06269(机械、航空航天与制造工程学院,康涅狄格大学,斯托尔斯,CT 06269) Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(机械工程系,麻省理工学院,剑桥,MA 02139,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出MCERF框架,结合多模态检索器ColPali与大语言模型推理,通过混合查找、视觉文本融合、高推理和自一致性决策等策略,在DesignQA基准上实现平均准确率相对提升41.1%,无需完整规则书摄入即可处理工程文档中的多模态问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14637 2026-06-08 cs.CV cs.AI cs.CL cs.HC 62%

Forest-Chat: Adapting Vision-Language Agents for Interactive Forest Change Analysis

Forest-Chat: 为交互式森林变化分析适应视觉-语言代理

James Brock, Ce Zhang, Nantheera Anantrasirichai

机构 * School of Computer Science, University of Bristol(布里斯托尔大学计算机科学学院) School of Geographical Sciences, University of Bristol(布里斯托尔大学地理科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Forest-Chat,一种基于LLM的森林变化分析代理,通过多任务处理实现自然语言查询,提升森林变化检测与语义解释的准确性与可解释性。

Comments 28 pages, 9 figures, 12 tables, Submitted to Ecological Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06109 2026-06-05 cs.CL cs.AI 62%

Harnessing Structural Context for Entity Alignment Foundation Models

利用结构上下文进行实体对齐基础模型

Xingyu Chen, Yuanning Cui, Zequn Sun, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室) Nanjing University of Information Science and Technology, Nanjing, China(南京信息科学技术大学) National Institute of Healthcare Data Science, Nanjing University, Nanjing, China(南京大学健康数据科学国家研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出ContextEA框架,通过交叉KG交互编码器和结构校准解码器增强结构上下文的构建与利用,在29个数据集上超越强基线,实现更强的跨KG迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05481 2026-06-05 cs.LG cs.AI eess.SP 62%

Towards Unified and Data-Efficient Prognostics and Health Management with Tabular Foundation Models

面向统一且数据高效的预测与健康管理:基于表格基础模型

Raffael Theiler, Lev Telyatnikov, Leandro Von Krannichfeldt, Olga Fink

机构 * IMOS Lab, EPFL(IMOS实验室,瑞士联邦理工学院)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出利用表格基础模型通过上下文学习处理工业时间序列,实现预测与健康管理(PHM)任务,在低数据场景下表现优异,并优于序列模型和梯度提升树。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04135 2026-06-05 cs.CY cs.AI cs.CL 62%

Frontier Lag: A Bibliometric Audit of Capability Misrepresentation in Academic AI Evaluation

前沿滞后:学术AI评估中能力误述的文献计量审计

David Gringras, Misha Salahshoor

机构 * Harvard University(哈佛大学) AISST

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过审计112,303篇LLM相关论文,发现中位论文评估的模型落后同期前沿10.85 ECI(约1.4倍Claude Sonnet 3.7与Claude Opus 4.5的差距),且差距以每年5.53 ECI扩大,仅3.2%的摘要披露推理模式状态,52.5%的结论将结果泛化为“AI”,并提出VERSIO-AI检查表等补救措施。

Comments v2. 65 pp, 9 figs, 8 tables, 8 appendices. Pre-registered on OSF: doi.org/10.17605/OSF.IO/7XM3D. Code+data: doi.org/10.5281/zenodo.20060457. VERSIO-AI v1.2 reporting checklist (Appendix A): doi.org/10.5281/zenodo.20060459. frontierlag package + per-DOI audit tool: frontierlag.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04560 2026-06-05 cs.LG cs.AI 62%

Rollout-Level Advantage-Prioritized Experience Replay for GRPO

基于轨迹级别优势优先经验回放的GRPO

Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang, Ik-hwan Kim, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) Interdisciplinary Program in AI, Seoul National University(首尔国立大学人工智能跨学科项目) AIIS, ASRI, INMC, and ISRC, Seoul National University(首尔国立大学人工智能研究所、人工智能研究机构、智能网络与计算中心及人工智能科学研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO样本效率低的问题,提出轨迹级经验回放缓冲器,通过年龄驱逐限制陈旧性、新鲜锚定组合保持在线策略、按优势幅度优先采样,在多个数学基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05056 2026-06-05 cs.CR cs.CL cs.LG 62%

Grounded but Misleading: Evaluating Semantic Alignment in AI-Generated Security Explanations

grounded but Misleading: Evaluating Semantic Alignment in AI-Generated Security Explanations

Heajun An, Connor Ng, Sandesh Sharma Dulal, Junghwan Kim, Jin-Hee Cho

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了AI生成的安全解释中语义对齐的问题,通过VEXA测试平台验证了词汇基础与语义风险对齐之间的差距,发现即使解释在词汇上显得合理,其语义解释可能削弱检测器的意图风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00819 2026-06-04 cs.CL cs.AI 62%

Emotion Entanglement and Bayesian Inference for Multi-Dimensional Emotion Understanding

情感纠缠与贝叶斯推理用于多维情感理解

Hemanth Kotaprolu, Kishan Maharaj, Raey Zhao, Abhijit Mishra, Pushpak Bhattacharyya

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔) University of Texas at Austin(德克萨斯大学奥斯汀分校) IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出基于Plutchik基本情绪理论的情感场景基准EmoScene,并利用情感共现统计的贝叶斯推理框架进行联合后验推理,提升多维情感理解的结构一致性。

Comments 19 pages in total, 10 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09719 2026-06-04 cs.CL cs.AI 62%

Bounded Hyperbolic Tangent: A Stable and Efficient Alternative to Pre-Layer Normalization in Large Language Models

有界双曲正切:大型语言模型中预层归一化的稳定高效替代方案

Hoyoon Byun, Youngjun Choi, Taero Kim, Sungrae Park, Kyungwoo Song

机构 * Yonsei University(延世大学) Upstage AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出BHyT,通过有界双曲正切和数据驱动的输入约束替代Pre-LN,在保持稳定性的同时提升训练和推理效率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03544 2026-06-03 cs.AI cs.CL 62%

SAGE: A Quantitative Evaluation of Socialized Evolution in Agent Ecosystems

SAGE: 智能体生态中社会化演化的定量评估

Linyue Pan, Yaoming Zhu, Lin Qiu, Xuezhi Cao, Xunliang Cai

机构 * Tsinghua University, China(清华大学, 中国) Meituan, China(美团, 中国)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出SAGE框架,通过对比社会演化(SocialEvo)与自我演化(SelfEvo)两种计算条件,在三个领域评估共享经验对智能体性能的影响,发现群体历史并非普遍放大器,但能帮助陷入停滞的智能体取得突破,且社会收益依赖于抽象能力而非暴露量。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03331 2026-06-03 cs.CL cs.AI 62%

Evaluating LLMs' Effectiveness on Real-World Consumer Device Repair Questions

评估大语言模型在真实世界消费设备维修问题上的有效性

Atm Mizanur Rahman, Md Arid Hasan, Syed Ishtiaque Ahmed, Sharifa Sultana

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过引入包含991个真实维修问题的基准测试,评估六种大语言模型在英语和孟加拉语上的正确性、完整性、实用性和安全性,发现模型虽能提供有用帮助,但在高风险维修任务中仍不可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03057 2026-06-03 cs.LG cs.AI 62%

Rethinking Molecular Text Representations for LLMs: An Empirical Study

重新思考用于大语言模型的分子文本表示:一项实证研究

Arun Raja, Garrett M. Morris, Kian Ming A. Chai

机构 * University of Oxford(牛津大学) DSO National Laboratories(DSO国家实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过系统基准测试,评估了9种分子表示和8种化学任务下16个LLM的性能,发现表示选择强烈影响结果,结构化文本表示(CML、MolJSON)在结构任务中占优,IUPAC在语义任务中占优,而SMILES很少最优。

Comments 25 pages, 11 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02584 2026-06-03 cs.CL cs.AI cs.IR 62%

IdiomX A Multilingual Benchmark for Idiom Understanding, Retrieval, and Interpretation

IdiomX:习语理解、检索和解释的多语言基准

Ayman Ali Sharara

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出IdiomX,一个大规模多语言习语基准,通过可复现的多阶段流水线构建,涵盖190K+上下文示例和12K+习语,定义四项任务(检测、上下文-习语检索、阿拉伯语-英语习语检索、习语解释),实验表明上下文Transformer模型提升检测,混合检索重排序增强单语和跨语言检索,习语解释可建模为语义检索任务。

Comments 12 pages, 21 figures. Includes dataset and code. Resources available on HuggingFace, Kaggle, and GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02461 2026-06-03 cs.AI cs.CL 62%

AgentCL: Toward Rigorous Evaluation of Continual Learning in Language Agents

AGENTCL:面向语言代理持续学习的严格评估

Yiheng Shu, Bernal Jiménez Gutiérrez, Saisri Padmaja Jonnalagedda, Yuguang Yao, Huan Sun, Yu Su

机构 * The Ohio State University(俄亥俄州立大学) Johns Hopkins University(约翰霍普金斯大学) Intuit AI Research(Intuit AI研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出AGENTCL评估框架,通过可控任务流和迁移增益指标,严格评估语言代理的持续学习能力,并开发MemProbe探针方法诊断记忆设计的影响。

Comments 10 pages in the main text, 26 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23099 2026-06-03 cs.LG cs.AI stat.ML 62%

ProEval: Proactive Failure Discovery and Efficient Performance Estimation for Generative AI Evaluation

ProEval:生成式AI评估的主动故障发现与高效性能估计

Yizheng Huang, Wenjun Zeng, Aditi Kumaresan, Zi Wang

机构 * Google DeepMind(谷歌DeepMind)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出ProEval框架,利用预训练高斯过程进行贝叶斯积分和超水平集采样,实现高效性能估计和主动故障发现,在推理、安全对齐和分类基准上以8-65倍更少样本达到1%误差内估计。

Comments Our open-sourced code and data can be found at https://github.com/google-deepmind/proeval

Journal ref International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16666 2026-06-03 cs.AI cs.CY cs.LG 62%

Towards a Science of AI Agent Reliability

迈向AI代理可靠性的科学

Stephan Rabanser, Sayash Kapoor, Peter Kirgis, Kangheng Liu, Saiteja Utpala, Arvind Narayanan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出十二个具体指标,从一致性、鲁棒性、可预测性和安全性四个维度分解AI代理的可靠性,并通过实验揭示能力提升仅带来可靠性小幅改进。

Comments Accepted at ICML 2026. Interactive dashboard available at: https://hal.cs.princeton.edu/reliability

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02443 2026-06-02 cs.CL cs.AI cs.CV 62%

PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

PaSBench-Video: 面向主动安全预警的流式视频基准

Yusong Zhao, Yuejin Xie, Youliang Yuan, Junjie Hu, Jitian Guo, Yujiu Yang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出PaSBench-Video基准,包含740个视频,评估多模态大模型在危险发生前及时发出预警的能力,发现现有模型在时序精度和低误报率上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏