arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10530 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10530 篇

2605.15611 2026-05-18 cs.AI 57%

TopoEvo: A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices

TopoEvo: 一种面向拓扑的自演化多智能体框架用于微服务中的根本原因分析

Junle Wang, Xingchuang Liao, Wenjun Wu

机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对微服务中观测数据异质性、故障传播和拓扑漂移问题,TopoEvo通过多模态对齐、拓扑约束推理和自演化机制,提升根本原因分析的鲁棒性与准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15589 2026-05-18 cs.CL 57%

MHGraphBench: Knowledge Graph-Grounded Benchmarking of Mental Health Knowledge in Large Language Models

MHGraphBench: 用于评估大语言模型中心理健康知识的图知识基准

Weixin Liu, Congning Ni, Shelagh A. Mulvaney, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学院) Virginia Tech(弗吉尼亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MHGraphBench基准,评估大语言模型在心理健康实体识别、关系判断及双跳推理能力,发现模型在实体类型识别和小关系类型判断上表现优异,但在关系预测和双跳推理上仍有不足,且输出格式可靠性对性能有显著影响。

Comments Accepted to GEM 2026, ACL 2026 Workshop; 9 pages main text plus references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15581 2026-05-18 cs.AI 57%

STAR: A Stage-attributed Triage and Repair framework for RCA Agents in Microservices

STAR: 一种针对微服务中RCA代理的阶段属性分诊与修复框架

Junle Wang, Xingchuang Liao, Wenjun Wu

机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出STAR框架,通过将RCA流程分解为四个阶段,提升微服务中RCA代理的可靠性与自修复能力。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15404 2026-05-18 cs.CL 57%

Capability Conditioned Scaffolding for Professional Human LLM Collaboration

专业领域能力条件下的支架框架

Sen Yang, Yinglei Ma

机构 * University College London(伦敦大学学院) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出能力条件支架框架,通过划分强、混合和弱领域,基于结构化能力档案调节干预行为,提升专业人类与AI协作的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02651 2026-05-18 cs.DL cs.LG 57%

ARA: Agentic Reproducibility Assessment For Scalable Support Of Scientific Peer-Review

ARA:面向大规模科学同行评审的代理可重复性评估

Kevin Riehl, Andres L. Marin, Nikofors Zacharof, Fan Wu, Patrick Langer, Robert Jakob, Anastasios Kouvelas, Georgios Fontaras, Michail A. Makridis

机构 * ETH Zürich, IVT & Agentic Systems Lab (ASL)(苏黎世联邦理工学院,信息与通信技术研究所及代理系统实验室) European Commission, Joint Research Centre(欧洲委员会,联合研究中心) University of Konstanz(康斯坦茨大学) Ideas Forward

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ARA通过构建实验依赖图并评估可重复性得分,有效提升大规模科研成果的可重复性评估能力,实验表明其在不同领域和模型参数下均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01970 2026-05-18 cs.CR cs.AI 57%

Trojan Hippo: Weaponizing Agent Memory for Data Exfiltration

Trojan Hippo:利用代理记忆进行数据外泄

Debeshee Das, Julien Piet, Darya Kaviani, Luca Beurer-Kellner, Florian Tramèr, David Wagner

机构 * ETH Z\"urich

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究提出Trojan Hippo攻击,通过单次不可信工具调用在代理长期记忆中植入潜伏载荷,当用户讨论敏感话题时激活并外泄数据。通过动态评估框架评估不同内存架构和防御措施,发现现有防御措施在安全性和实用性之间存在显著权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15128 2026-05-15 cs.CV cs.CL cs.IR 57%

MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory

MemEye:一种以视觉为中心的多模态代理记忆评估框架

Minghao Guo, Qingyue Jiao, Zeru Shi, Yihao Quan, Boxuan Zhang, Danrui Li, Liwei Che, Wujiang Xu, Shilong Liu, Zirui Liu, Mubbasir Kapadia, Vladimir Pavlovic, Jiang Liu, Mengdi Wang, Yiyu Shi, Dimitris N. Metaxas, Ruixiang Tang

机构 * Rutgers(罗格斯大学) Notre Dame(圣母大学) Princeton(普林斯顿大学) UMN(明尼苏达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MemEye框架从视觉证据的粒度和证据使用的复杂性两个维度评估多模态代理记忆,通过8个生活场景任务构建新基准,验证记忆方法在细粒度视觉细节保留和时间状态推理上的不足。

Comments 46 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14600 2026-05-15 cs.CL 57%

SciPaths: Forecasting Pathways to Scientific Discovery

SciPaths: 预测科学发现的路径

Eric Chamoun, Yizhou Chi, Yulong Chen, Rui Cao, Zifeng Ding, Michalis Korakakis, Andreas Vlachos

机构 * University of Cambridge(剑桥大学) The Alan Turing Institute(艾伦·图灵研究所) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出SciPaths基准,通过专家标注的262条金路径和2444条银路径,评估科学发现路径预测任务,发现核心方法依赖最难恢复,需改进分解质量以提升端到端路径恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14537 2026-05-15 cs.AI 57%

Cattle Trade: A Multi-Agent Benchmark for LLM Bluffing, Bidding, and Bargaining

牛市交易:一种多智能体基准,用于评估大语言模型在战略推理、对抗互动和资源约束下的表现

Robert Müller, Clemens Müller

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Cattle Trade基准,用于评估大语言模型在多智能体经济游戏中整合战略推理、对抗互动和资源分配的能力,揭示了智能体在资源管理与对抗策略中的表现差异。

Comments malgai workshop at iclr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14237 2026-05-15 cs.AI 57%

Good to Go: The LOOP Skill Engine That Hits 99% Success and Slashes Token Usage by 99% via One-Shot Recording and Deterministic Replay

Good to Go:LOOP技能引擎:通过一次录制和确定性重放实现99%的成功率并减少99%的token使用

Xiaohua Wang, Kai Yu, XuXiao Liang, Liang Wang, Chao Han

机构 * Artificial Intelligence Research Center, Bengbu Medical University(蚌埠医科大学人工智能研究中心) CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物科技有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LOOP技能引擎通过一次录制和确定性重放,实现99%的成功率和99%的token减少,解决重复周期性任务中大语言模型的不确定性与高成本问题。

Comments 8 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20571 2026-05-15 cs.AI 57%

CausalReasoningBenchmark: A Real-World Benchmark for Disentangled Evaluation of Causal Identification and Estimation

因果推理基准:用于解耦评估因果识别和估计的现实世界基准

Ayush Sawarni, Jiyuan Tan, Vasilis Syrgkanis

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CausalReasoningBenchmark,通过173个查询和132个现实数据集评估因果识别与估计,揭示模型在研究设计细节上的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13397 2026-05-15 cs.CV cs.AI 57%

Descriptor: Distance-Annotated Traffic Perception Question Answering (DTPQA)

描述:距离标注的交通感知问答(DTPQA)

Nikos Theodoridis, Tim Brophy, Reenu Mohandas, Ganesh Sistu, Fiachra Collins, Anthony Scanlan, Ciaran Eising

机构 * Department of Electronic and Computer Engineering, University of Limerick(利默尼克大学电子与计算机工程系) Data Driven Computer Engineering Research Centre, University of Limerick(利默尼克大学数据驱动计算机工程研究中心) Lero, The Irish Software Research Centre, University of Limerick(利默尼克大学Lero爱尔兰软件研究中心) Valeo Vision Systems(瓦莱奥视觉系统)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DTPQA基准,用于评估视觉语言模型在交通场景中的感知能力,包含合成和真实数据集,通过距离标注分析模型在远距离下的表现。

Journal ref IEEE Data Descriptions, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06226 2026-05-15 cs.AI 57%

GeoLaux: A Benchmark for Evaluating MLLMs' Geometry Performance on Long-Step Problems Requiring Auxiliary Lines

GeoLaux:一个评估多模态大语言模型在需要辅助线的长步骤问题上几何性能的基准

Yumeng Fu, Jiayin Zhu, Lingling Zhang, Wenjun Wu, Bo Zhao, Shaoxuan Ma, Yushun Zhang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 GeoLaux通过2186道计算与证明题,评估23个领先MLLMs在长步骤推理和辅助线构造上的表现,揭示模型在长步骤问题上性能显著下降,强调提升辅助线理解的重要性,并发现有限答案提示能提高过程正确性。

Comments 26 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03519 2026-05-15 cs.LG 57%

Revisiting Model Inversion Evaluation: From Misleading Standards to Reliable Privacy Assessment

重新审视模型反向评估:从误导性标准到可靠的隐私评估

Sy-Tuyen Ho, Koh Jun Hao, Ngoc-Bao Nguyen, Alexander Binder, Ngai-Man Cheung

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Maryland College Park(马里兰大学学院公园分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文重新审视模型反向攻击的评估框架,揭示其存在虚假正例问题,并提出基于大规模语言模型的新评估方法以提升隐私评估的可靠性。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14186 2026-05-15 cs.LG 57%

LLMs Know When They Know, but Do Not Act on It: A Metacognitive Harness for Test-time Scaling

Qi Cao, Yufan Wang, Peijia Qin, Shuhao Zhang, Pengtao Xie

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 大型语言模型(LLMs)在解决问题前后能够产生自我监控信号,如对自身能否成功解决问题的预判以及对答案正确性的后验判断,但这些信号通常未被用于控制推理过程。本文提出一种元认知控制框架,基于认知心理学中的纳尔逊-纳雷恩斯理论,将监控与推理分离,使模型在推理过程中根据预判和后验判断动态决定是否信任当前结果、是否重试或汇总多轮结果。实验表明,该框架无需参数更新或特定任务微调,即可显著提升基础模型在文本、代码和多模态任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14164 2026-05-15 cs.AI 57%

Unsteady Metrics and Benchmarking Cultures of AI Model Builders

不稳定的度量标准与AI模型构建者的基准文化

Stefan Baack, Christo Buschek, Maty Bohacek

机构 * Independent Researcher(独立研究者) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了AI模型构建者如何通过选择和突出特定基准来定义技术现状,揭示了基准选择的碎片化和跨模型比较的局限性,提出统一的分类框架以解决术语冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14002 2026-05-15 cs.AI 57%

PolitNuggets: Benchmarking Agentic Discovery of Long-Tail Political Facts

PolitNuggets: 评估代理发现长尾政治事实

Yifei Zhu

机构 * The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 PolitNuggets通过构建400位全球精英的政治传记,涵盖10000多个政治事实,评估代理信息合成能力,发现当前系统在细节处理和效率上存在显著差异。

Comments 24 pages, 7 figues, accpeted in The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11907 2026-05-15 cs.LG 57%

Procedural-skill SFT across capacity tiers: A W-Shaped pre-SFT Trajectory and Regime-Asymmetric Mechanism on 0.8B-4B Qwen3.5 Models

跨容量层级的程序技能SFT:一种W形的预SFT轨迹和 regime-不对称机制在0.8B-4B Qwen3.5模型上

Igor Strozzi

机构 * Applied Mathematics Department(应用数学系)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.LG

AI总结 本文研究了不同规模Qwen3.5模型在程序技能SFT上的贡献,发现预SFT轨迹呈W形,且SFT效果在不同模型容量上呈现不对称性,通过实验验证了这一机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13651 2026-05-14 cs.SD cs.AI 57%

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

NAACA:无训练神经听觉注意力认知架构:具有振荡工作记忆的显著性驱动注意力门控

Zhongju Yuan, Geraint Wiggins, Dick Botteldooren

机构 * WAVES Research Group, Ghent University, Gent, Belgium(根特大学WAVES研究组,比利时根特) AI Lab, Vrije Universiteit Brussel, Brussel, Belgium(布鲁塞尔自由大学AI实验室,比利时布鲁塞尔) EECS, Queen Mary University of London, London, UK(伦敦大学学院女王学院电子工程与计算机科学系,英国伦敦)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 NAACA通过振荡工作记忆实现听觉显著性过滤,提升音频理解精度并减少冗余处理,实验显示在XD-Violence数据集上AP提升17.1%。

Comments Accepted as a regular paper by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13408 2026-05-14 cs.CL 57%

From Rosetta to Match-Up: A Paired Corpus of Linguistic Puzzles with Human and LLM Benchmarks

从罗塞塔到配对:一种带有人类和LLM评估的语料库语言谜题

Neh Majmudar, Anne Huang, Jinfan Frank Hu, Elena Filatova

机构 * City University of New York (CUNY)(纽约城市大学) Davidson Academy(戴维森学院) Phillips Academy(菲利普斯学术院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了高中语言竞赛中使用的语言谜题,重点分析了罗塞塔石和配对两种常见形式,并提出了一种系统方法将现有罗塞塔石谜题转换为对应的配对谜题,通过人类和LLM评估验证了其有效性。

Comments Proceedings of the Fifteenth Language Resources and Evaluation Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11726 2026-05-14 cs.LG 57%

Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models

Block-R1: 重新审视块大小在多领域强化学习中的作用以提升扩散大语言模型

Yan Jiang, Ruihong Qiu, Zi Huang

机构 * The University of Queensland(昆士兰大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文从领域冲突角度研究多领域场景下扩散大语言模型强化学习中的块大小问题,提出领域块大小冲突公式、Block-R1-41K数据集、Block-R1基准和跨领域强化学习方法,通过13个数据集和7种算法验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16246 2026-05-14 cs.AI 57%

Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents

迈向可扩展的可验证奖励:基于代理状态的多轮工具调用LLM代理评估

Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra

机构 * PayPal AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于代理状态的评估框架,用于多轮工具调用LLM代理的可扩展可验证奖励评估,通过LLM驱动的模拟框架实现稳定且区分模型的排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13332 2026-05-14 cs.AI cs.CC 57%

Diversity of Extensions in Abstract Argumentation

抽象论证中扩展的多样性

Johannes K. Fichte, Markus Hecher, Yasir Mahmood, Zhengjun Wang

机构 * Department of Computer and Information Science (IDA), Linköping University, Sweden(链接öping大学计算机与信息科学系(IDA)) University of Potsdam, Germany & University of Artois, CNRS, UMR8188 (CRIL), France(波茨坦大学 & 阿尔托伊斯大学、法国CNRS UMR8188(CRIL)) Data Science Group, Heinz Nixdorf Institute, Paderborn University, Germany(帕德博恩大学数据科学小组、海因茨·尼克斯多夫研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究了抽象论证中扩展多样性的量化概念,探讨了扩展的兼容性及计算最大多样性k值的方法。

Comments Technical Report to the paper accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13311 2026-05-14 cs.AI cs.IR cs.MA 57%

IdeaForge: A Knowledge Graph-Grounded Multi-Agent Framework for Cross-Methodology Innovation Analysis and Patent Claim Generation

IdeaForge: 一种基于知识图谱的多智能体框架,用于跨方法论创新分析和专利主张生成

Joy Bose

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 IdeaForge通过多智能体框架整合TRIZ、设计思维和SCAMPER等创新方法,利用知识图谱实现跨方法论的创新分析和专利主张生成,提升创新候选的多样性和可追溯性。

Comments 14 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12988 2026-05-14 cs.AI cs.CY cs.IR 57%

Retrieval-Augmented Tutoring for Algorithm Tracing and Problem-Solving in AI Education

增强检索的辅导系统用于AI教育中的算法追踪与问题解决

Mragisha Jain, Tirth Bhatt, Griffin Pitts, Aum Pandya, Peter Brusilovsky, Narges Norouzi, Arto Hellas, Juho Leinonen, Bita Akram

机构 * North Carolina State University(北卡罗来纳州立大学) University of Pittsburgh(匹兹堡大学) University of California, Berkeley(加州大学伯克利分校) Aalto University(阿尔托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出KITE系统,通过增强检索生成技术辅助学生理解算法追踪和问题解决,提升算法推理能力。

Comments Paper accepted to the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026), co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10267 2026-05-14 cs.AI 57%

IndustryBench: Probing the Industrial Knowledge Boundaries of LLMs

IndustryBench: 探索大语言模型在工业知识边界的限制

Songlin Bai, Xintong Wang, Linlin Yu, Bin Chen, Zhiang Xu, Yuyang Sheng, Changtong Zan, Xiaofeng Zhu, Yizhe Zhang, Jiru Li, Mingze Guo, Ling Zou, Yalong Li, Chengfu Huo, Liang Ding

机构 * Multimodal and Industrial AI Team(多模态与工业AI团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 IndustryBench通过中国国家标准和工业产品记录构建2049项工业采购问答基准,揭示LLM在工业QA中的可靠性问题,发现标准与术语能力最弱,扩展推理降低安全调整分数,安全违规率影响排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18842 2026-05-14 cs.CR cs.AI cs.CV 57%

GUIGuard-Bench: Toward a General Evaluation for Privacy-Preserving GUI Agents

GUIGuard-Bench:面向隐私保护GUI代理的通用评估

Yanxi Wang, Zhiling Zhang, Wenbo Zhou, Weiming Zhang, Jie Zhang, Qiannan Zhu, Yu Shi, Shuxin Zheng, Jiyan He

机构 * Beijing Normal University(北京师范大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) A*STAR Zhongguancun Institution of Artificial Intelligence(中关村人工智能研究所)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 GUIGuard-Bench通过241个真实GUI代理轨迹和4080张截图,评估隐私保护GUI代理的隐私识别、规划一致性和保护策略影响,揭示隐私识别是实际应用中的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00839 2026-05-14 cs.SE cs.AI 57%

CodeClash: Benchmarking Goal-Oriented Software Engineering

CodeClash:面向目标导向软件工程的基准测试

John Yang, Kilian Lieret, Joyce Yang, Carlos E. Jimenez, Muhtasham Oblokulov, Aryan Siddiqui, Ofir Press, Ludwig Schmidt, Diyi Yang

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Cornell University(康奈尔大学) Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CodeClash通过多轮竞赛评估语言模型在无明确指导下迭代开发代码以实现开放性目标的能力,揭示了模型在战略推理和长期代码维护方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12406 2026-05-13 cs.AI 57%

Semantic Reward Collapse and the Preservation of Epistemic Integrity in Adaptive AI Systems

语义奖励崩溃与自适应AI系统中知识完整性保护

William Parris

机构 * BDB Labs / BagelTech(BDB实验室/BagelTech)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了自适应AI系统中语义奖励崩溃问题,指出其导致知识完整性受损,并提出宪法奖励分层框架以保护不同知识属性。

Comments 15 pages including references. Position and framework paper. Companion empirical work available at arXiv:2604.17587

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12370 2026-05-13 cs.CL cs.IR 57%

Context Convergence Improves Answering Inferential Questions

上下文收敛提升推断性问题的回答

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了上下文结构和质量对LLM处理推断性问题的影响,发现高收敛性句子构建的上下文能显著提升回答准确率,且按收敛性排序略有提升,表明LLM倾向于优先使用信息丰富的早期提示。

Comments Accepted at SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏