arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10507 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10507 篇

2604.12147 2026-08-10 cs.SE cs.AI cs.CL 版本更新 62%

From Plan to Action: How Well Do Agents Follow the Plan?

评估自主编程代理中的计划合规性

Shuyang Liu, Saman Dehghan, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM(IBM公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文系统分析了编程代理在执行任务时对计划的遵循情况,通过16991条轨迹评估不同计划变体的影响,发现计划提醒能提高任务成功率,但不恰当的计划补充可能降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06310 2026-08-07 cs.LG cs.CL 新提交 62%

RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

RRC:基于排序的奖励构造解锁LLM强化学习中的生成式奖励模型

Chenglong Wang, Ziming Zhu, Yifu Huo, Bei Li, Qiaozhi He, Yan Ding, Xiaoyang Hao, Yuxin Gao, Tianhua Zhou, Xiaojia Chang, Tongran Liu, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) NiuTrans Research(NiuTrans研究院) Institute of Psychology, CAS(中国科学院心理研究所) Kunming University of Science and Technology(昆明理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究针对生成式奖励模型在LLM强化学习中潜力未充分发挥的问题,提出RRC方法,通过两种互补策略提升RL训练效果,在多基准上取得一致增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05729 2026-08-07 cs.AI cs.CL cs.CV cs.HC 新提交 62%

Unified Agent: Managing Interactions across Devices

统一智能体:管理跨设备交互

Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei, Xin Lin, Truong Nguyen

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对现有智能体跨设备交互场景的不足,提出带紧凑状态设计的统一智能体,构建对应基准数据集,其性能显著优于多种现有设计,且在不同MLLM设置下表现鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05170 2026-08-07 cs.CL cs.AI 新提交 62%

DREAM: LLM-based Dynamic Role-playing via Event-Aware Memory Graph

DREAM:基于大语言模型的事件感知记忆图动态角色扮演

Zhihao Xiao, Mengting Li, Xintao Wang, Linfeng Li, Limin Shui, Mengqi Ji, Borui Cai

机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) School of Computer Science, Fudan University(复旦大学计算机科学技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DREAM是一种受ABC认知模型启发的结构化记忆框架,通过EMG提升角色扮演智能体的时间与因果连贯性,在CoSER、LIFECHOICE和TCM上取得最优性能。

Comments Accepted at KDD 2026. Camera-ready version to appear. 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03070 2026-08-07 cs.CR cs.AI cs.CL 版本更新 62%

AI Security Leaderboard: Methodology, Results and Minimal Standard

AI安全排行榜:方法、结果与最低标准

Jasper Timm, Lukas Struppek, Ziwei Xu, Grace Cheong, Oscar Mata, Dan Zhao, Mick Yang, Isadora De Andrade, Xiaojun Jia, Yiming Li, Samuel Bauer, Heather McIntyre, Adam Gleave, Edward Yee, Kellin Pelrine

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出AI安全防护最低标准V1.0,测试Claude Fable5等四款模型的越狱鲁棒性,发现模型间防御能力差异大,部分模型未出现通用越狱,可通过现有技术缩小防御差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28609 2026-08-07 cs.AI cs.CL cs.CV 版本更新 62%

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

OSReward:为跨平台计算机使用奖励模型建立标准化评估

Qiushi Sun, Kanzhi Cheng, Yian Wang, Bowen Yang, Hang Yan, Liheng Chen, Fangzhi Xu, Zichen Ding, Nuo Chen, Jialin Cao, Xingdong Gong, Zehao Li, Kaiming Jin, Xinfeng Yuan, Zhoumianze Liu, Jingyang Gong, Zhangyue Yin, Jiahui Gao, Zhiyong Wu, Tianbao Xie, Jianbing Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出OSReward基准评估VLM评判者的可靠性,构建OS-Shepherd开源奖励模型缩小成本差距,为规模化可靠CUA奖励设计提供参考

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04317 2026-08-06 cs.CR cs.AI cs.LG cs.MA 新提交 62%

Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)

三叉戟:如何突破深度强化学习网络防御(智能体式)

Ryozo Masukawa, Ian Bryant, Armita Kazeminajafabadi, Sanggeon Yun, Hyunwoo Oh, SungHeon Jeong, Nathaniel D. Bastian, Mahdi Imani, Mohsen Imani

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对DRL网络防御对自适应威胁鲁棒性不足的问题,提出Trident智能体式LLM红队框架,通过含三类组件的设计,发现现有防御存在根本性脆弱性,大幅降低蓝方防御性能并揭示新兴行为。

Comments code: https://anonymous.4open.science/r/Trident-A934

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04075 2026-08-06 cs.LG cs.AI 新提交 62%

Spatiotemporal Graph Transformer for Traffic Intelligence in Edge Computing

面向边缘计算中交通智能的时空图Transformer

Laha Ale, Letian Lin, Na Cao, Zheng Ma, Peng Yu

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算与人工智能学院) SWJTU-Leeds Joint School, Southwest Jiaotong University(西南交通大学-利兹学院) State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(北京邮电大学网络与交换技术国家重点实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对边缘计算中流量预测的非平稳长程建模难题,提出时空图Transformer框架,经真实蜂窝网络数据集验证,其性能优于GCN-RNN等基线模型,可支撑主动资源管理。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28545 2026-08-06 cs.CL cs.AI cs.SE 版本更新 62%

ORCA-bench: How Ready Are Language Model Agents for Oncall?

ORCA-bench:语言模型智能体的值班待命准备程度如何?

Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi

机构 * Cornell Tech(康奈尔科技学院) Traversal Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出ORCA-bench基准,评估编码智能体在生产级值班待命场景下的根本原因分析能力,发现现有前沿智能体表现不佳,凸显其距离安全胜任生产可靠性工作仍有较大差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02228 2026-08-06 cs.LG cs.CL 版本更新 62%

Unforgettable Generalization in Language Models

语言模型的不可遗忘泛化

Eric Zhang, Leshem Choshen, Jacob Andreas

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究探究语言模型通过随机标签微调遗忘技能时的行为差异,发现遗忘泛化程度与初始预测置信度和训练数据表示变异性相关,且遗忘为浅层,凸显技能移除的难度与不可预测性。

Comments 18 pages, 9 figures, published in First Conference on Language Modeling 2024

Journal ref First Conference on Language Modeling (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03842 2026-08-05 cs.CL cs.LG 新提交 62%

Sensitivity, Causality, and Repair Dissociate: A Layer-Wise Analysis of Perturbation Robustness and Its Scaling

敏感性、因果性与修复能力的分离:扰动鲁棒性的逐层分析及其缩放规律

Nathan Labiosa, David Buff, Ena Nayak, Erica Donno

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 该研究分析了语言模型的扰动鲁棒性,发现敏感性、因果性、补偿能力三种层映射分离,识别两种传播机制,提出级联中断机制,给出实用指导并指出方法学警示。

Comments 29 pages, 18 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03803 2026-08-05 cs.CL cs.LG 新提交 62%

M-GATE: Multilingual Grammar, Accuracy in Translation, and Efficiency Benchmark for Large Language Models

M-GATE:面向大语言模型的多语言语法、翻译准确性与效率基准

Tomáš Burkert, Angelika Peljak-Łapińska, David Zelený

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出多语言基准M-GATE,评估50余种模型的80余种配置,发现翻译与语法能力分离,低资源语言惩罚随模型迭代缩小,推理对翻译提升显著。

Comments 45 pages (97 incl. appendices), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03794 2026-08-05 cs.DB cs.AI cs.CL 新提交 62%

Evaluating LLMs in Database Scenarios: A Lifecycle Benchmark for Assessing Their Potential in Core Database Tasks

评估数据库场景下的大语言模型:用于评估其在核心数据库任务中潜力的生命周期基准

Shunfan Zheng, Dongsheng Shi, Yue Li, Xin Yi, Linlin Wang, Gerard de Melo

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有LLM数据库评估基准仅聚焦Text-to-SQL任务的缺陷,推出覆盖数据库全生命周期的DBLifeBench基准,还提出Progressive-Text2SQL任务,发现专用Text-to-SQL模型在非编码阶段存在灾难性遗忘,为全栈数据库智能构建奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12787 2026-08-05 cs.AI cs.CL cs.CV cs.MM 版本更新 62%

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

我们真的需要参数超过10亿的多模态情感语言模型吗?

Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Shandong University(山东大学人工智能学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 质疑多模态情感识别需参数超10亿模型的假设,提出轻量级MER框架Light-MER,通过知识蒸馏及两种优化策略,在九个基准数据集实验中实现最优性能并显著提高推理效率,凸显小模型潜力。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01012 2026-08-04 cs.CL cs.AI 新提交 62%

MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models

MedUPS:利用大语言模型辅助罕见医疗病例的诊断

Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav Rappoport

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出MedUPS对齐框架及MedUPSQA数据集,通过强化学习使大语言模型对齐临床中游决策,提升了不同规模模型的下一步临床决策准确率,且小模型表现优于部分大模型。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00473 2026-08-04 cs.CV cs.AI cs.CL 新提交 62%

CrossProjection: Geometric Grounding Beyond Viewpoint Change in Architectural Drawings

CrossProjection:建筑图纸中超越视角变化的几何定位

Kaho Li, Pengyu Zeng, Yuqin Dai, Jun Yin, Tianjing Feng, Shuai Lu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出CrossProjection方法评估视觉语言模型在异构建筑视图间的几何定位能力,发现模型在自由几何定位上性能脆弱,仅封闭选择成功不代表具备可靠几何定位能力。

Comments Initial controlled diagnostic study on 23 natural drawing sets and three VLMs; broader model, building, repeated-inference, and human coverage is planned for a subsequent version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00355 2026-08-04 cs.CL cs.LG 新提交 62%

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

CurveShift:智能体的进展是标量吗?区分水平与形态

Hanwen Xing, Pengyun Wang, BingXu Meng, Kumail Alhamoud, Xiang Li, Jicheng Wang, Xin Yu, Xinyang Han, Xiaomin Li, Philip Torr, Yuexing Hao

机构 * University of Southern California(南加利福尼亚大学) University of Chicago(芝加哥大学) University of California, Berkeley(加利福尼亚大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) University of California, Davis(加利福尼亚大学戴维斯分校) Pennsylvania State University(宾夕法尼亚州立大学) Harvard University(哈佛大学) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大型语言模型进展的标量总结问题,通过LiveCodeBench基准分离混淆,发现2024年9月后发布的模型在竞赛编程难任务上有超出预期的增益,发布了相关数据集与代码。

Comments 25 pages, 4 figures, 7 tables. Data and code: https://github.com/harvenstar/CurveShift

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29771 2026-08-04 cs.AI cs.LG q-fin.CP q-fin.PM 版本更新 62%

CLQT: A Closed-Loop, Cost-Aware, Strategy-Consistent Benchmark for Diagnostic Evaluation of LLM Portfolio-Management Agents

CLQT:用于LLM投资组合管理代理诊断评估的闭环、成本感知、策略一致性基准

Bo Qu, Mingguang Chen

机构 * Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出CLQT基准,通过闭环交易环境诊断LLM代理的决策过程,而非仅排名收益,评估五个维度的能力。

Comments 56 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26529 2026-08-04 cs.CL cs.AI cs.CV 版本更新 62%

The inattentional gap in task conditioned AI models that omit otherwise reportable safety critical signals

注意间隙:任务条件化的语言和视觉模型忽略它们本可报告的安全关键信号

Kwan Soo Shin

机构 * PolymathMinds Lab(PolymathMinds 实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示任务条件化会导致语言和视觉模型抑制对共存安全关键信号的报告,形成“注意间隙”,且该现象在多种模型和任务中普遍存在,不随规模增大而减弱,使基准安全与实际安全脱钩。

Comments 62 pages (31-page article and 31-page supplementary information), 8 figures, 4 tables. v3: corrects the author metadata to the sole author, Kwan Soo Shin; revised title and abstract; adds cross-vendor and flagship validation, signal-detection and specified-task controls, and dual-process probes. Reproducibility deposit: doi:10.5281/zenodo.20826823

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21848 2026-08-04 cs.CL cs.AI 版本更新 62%

Keyless Attention: Value-Space Routing and Value-Only Caching for Efficient Transformers

无键注意力:面向高效Transformer的值空间路由与仅值缓存

Xin Gao, Xingming Xu

机构 * York University(约克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出无键注意力机制,通过消除键投影并仅使用查询和值,实现50%的KV缓存减少,同时匹配或超越标准注意力的解码吞吐量,并在多个模型上达到相当或更优的困惑度与下游任务性能。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19913 2026-08-04 cs.CL cs.AI 版本更新 62%

When LLM Essays Outscore Student Essays: What a Korean Writing Rubric Rewards and Where Readers Disagree

从直觉到校准判断:基于评分标准的专家小组研究人类对LLM生成韩语文本的检测

Shinwoo Park, Yo-Sub Han

机构 * Yonsei University(延世大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究通过三阶段盲 longitudinal 研究评估人类对LLM生成韩语文本的判断,提出LREAD框架提升准确性与一致性,证明评分标准辅助判断能提高检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07107 2026-08-04 cs.AI cs.CL 版本更新 62%

MENTOR: A Metacognition-Driven Self-Evolution Framework for Uncovering and Mitigating Implicit Domain Risks in LLMs

MENTOR: 一种元认知驱动的自我进化框架,用于发现和缓解大语言模型中的隐式领域风险

Liang Shan, Kaicheng Shen, Wen Wu, Zhenyu Ying, Chaochao Lu, Yan Teng, Jingqi Huang, Qingshan Liu, Guangze Ye, Guoqing Wang, Jie Zhou, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Lab, Shanghai Innovation Institute(上海人工智能实验室,上海创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在特定领域(如教育、金融、管理)中存在的隐式安全风险,提出基于元认知自我评估和动态规则知识图谱的MENTOR框架,通过激活级引导信号有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29066 2026-08-03 cs.CL cs.AI 新提交 62%

Semantics of Subterfuge: Benchmarking Legal Deception Detection Against General-domain State-of-the-Art

欺骗的语义:针对通用领域最先进模型的法律欺骗检测基准测试

Theekshana Samaradiwakara, Nisansa de Silva, George C. Lobb

机构 * University of Moratuwa(莫拉图瓦大学) The Law Office of George C. Lobb(乔治·C·洛布律师事务所)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文针对法律领域的自动欺骗检测,对比了微调Transformer模型与大型语言模型在通用和法律数据集上的表现,发现领域敏感性显著,思维链提示效果逊于直接分类,强调需开发适配法律领域的可解释系统。

Comments 5 pages paper

Journal ref ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19827 2026-08-03 cs.CL cs.AI cs.IR 版本更新 62%

When Iterative RAG Beats Ideal Evidence: A Diagnostic Study in Scientific Multi-hop Question Answering

当迭代RAG优于理想证据:科学多跳问答中的诊断研究

Mahdi Astaraki, Mohammad Arshi Saloot, Ali Shiraee Kasmaee, Hamidreza Mahyar, Soheila Samiee

机构 * Faculty of Engineering, McMaster University, Canada(麦斯特大学工程学院,加拿大) BASF Canada Inc., Canada(巴斯夫加拿大公司,加拿大)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过化学多跳问答数据集,诊断发现迭代检索-推理循环在科学领域显著优于静态RAG上限,揭示了阶段式检索的优势与失败模式。

Comments 51 pages, 29 figures, Published in Transactions on Machine Learning Research (05/2026). OpenReview: https://openreview.net/forum?id=pa5TnBdyDP

Journal ref Transactions on Machine Learning Research (05/2026), ISSN 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22546 2026-08-03 cs.CL cs.AI 版本更新 62%

Towards the Holographic Characteristic of LLMs for Efficient Short-text Generation

向LLMs的全息特性迈进:为高效短文本生成而努力

Shun Qian, Bingquan Liu, Chengjie Sun, Zhen Xu, Baoxun Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Platform and Content Group, Tencent(腾讯平台与内容组)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HOLO插件,利用语言模型的全息特性提升短文本生成效率,通过提取目标关键词并补充平行文本生成,实现高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28319 2026-07-31 cs.CL cs.CY cs.LG 新提交 62%

Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activations

公平剪枝:通过差分激活定位GLU-MLP层中的人口统计偏差

Pere Martra, Eugenio Martínez Cámara, Alfonso Ureña López

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出Fairness Pruning方法,通过最小对比提示对与激活捕获定位LLM的GLU-MLP层中人口统计偏差神经元,经实验验证该方法可针对性调控偏差且对模型能力影响极小。

Comments 15 pages, 3 figures, 9 tables. Code and datasets publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28074 2026-07-31 cs.AI cs.LG 新提交 62%

Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

Echoverse:用于大规模训练计算机使用智能体的深度演化环境

Yash Pandya, Sahil Gupta, Sarthak Harne, Archana Yadav, Kavyansh Chourasia, Hussein Mozannar, Vibhav Vineet, Sara Abdali, Corby Rosset, Yash Lara, Ahmed Awadallah, Ece Kamar, Akshay Nambi

机构 * Microsoft Research(微软研究院)

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 Echoverse是用于大规模训练计算机使用智能体的深度演化环境,其协同演化循环可提升智能体性能,经12个环境训练后9B模型准确率大幅提升,还发布了基准环境与代码

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27654 2026-07-31 cs.CL cs.AI 新提交 62%

From Single- to Cross-Document: Benchmarking Multi-Granularity Event Analysis of Large Language Models

从单文档到跨文档:大语言模型多粒度事件分析的基准测试

Tao Wen, Shuai Shao, Pei Ke, Xu Han, Jie Zou, Guannan Li, Tao Tian, Jinjie Qiu, Lan Wang, Ke Qin

机构 * University of Electronic Science and Technology of China(电子科技大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文推出MiGUE-Bench基准及MiGUE-Pipeline框架,通过四项核心任务评估LLMs多粒度事件分析能力,明确其能力边界与缺陷,为该领域改进提供方向。

Comments 9 pages. Published in the Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), pp. 3464-3472, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27420 2026-07-31 cs.AI cs.CL 新提交 62%

Dimensionality and Measurement Precision in HLE's Multiple-Choice Subset

HLE多项选择子集的维度与测量精度

Mayank Sharma, Savira Nadela, Tyler Matteson

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估29个LLM在HLE多项选择子集上的表现,发现HLE仅测量单一一般推理因素,其领域子分数不具区分能力,且对前沿模型的区分能力有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12790 2026-07-31 cs.AI cs.CL cs.MA 版本更新 62%

Who Grades the Grader? Co-Evolving Evaluation Metrics and Skills for Self-Improving LLM Agents

谁来评估评估者?用于自我改进的语言模型代理的协同进化评估指标和技能

Xing Zhang, Guanghui Wang, Yanwei Cui, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * Amazon(亚马逊)

专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究自我进化智能体系统中评估指标缺失问题,提出指标可进化,通过“双棘轮”协同进化指标与技能循环,在多任务中保留提升效果,还阐述安全性源于锚定规则与外部审核,为无可靠自动验证器场景提供架构。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Double-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏