arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-21 至 2026-08-21 共收录 82 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 19 篇

2608.20317 2026-08-21 cs.IR 新提交 50%

Projecting BrowseComp-Plus onto ClimbMix: Toward More Realistic Corpora for Agentic Search

将BrowseComp-Plus映射到ClimbMix:构建更符合智能体搜索需求的真实语料库

Sahel Sharifymoghaddam, Lingwei Gu, Yijun Ge, Jimmy Lin

专题命中 规划推理 :reasoning(abstract)

AI总结 该研究将BrowseComp-Plus的查询映射到NVIDIA的ClimbMix语料库,构建了与基准无关的映射流水线,生成57个有效查询,使智能体搜索难度向检索环节转移,发布了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18637 2026-08-21 cs.IR 版本更新 50%

PILOT Technical Report

PILOT技术报告

Jiuning Lin, Ruiquan Lan, Xiaodong Zhu, Bin Zhang, Chengyu Lai, Chuxin Chen, Dimin Wang, Han Zhu, Hongtao Cheng, Jialin Zhu, Lingqing Zhang, Shuai Zhong, Tao Wang, Weipeng Huang, Yinjiang Cai, Yinnan Song, Yuan Liu, Zhibo Xiao, Zhixin Ma, Zihong Huang

专题命中 规划推理 :planning(abstract)

AI总结 该研究针对现有推荐系统优化智能体方法的反应式缺陷,提出PILOT框架,通过三类角色构建控制循环,在淘宝平台对比ROAM验证,实现多项指标提升且搜索效率显著提高,无需人工干预。

Comments Technical Report, 42 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17584 2026-08-21 cs.RO 版本更新 50%

HODAgent: Towards On-Demand, Responsive Humanoids for Physical World Human Interaction

HODAgent:面向物理世界人机交互的按需、响应式人形机器人

Wang Warren Chen, Jiahao Zhang, Zhenjiang Li, Mingxu Wang, Lei Yi, Yuchen Kang, Shuo Sun, Ziping Chen, Jie Chen

机构 * Xiaopeng(小鹏)

专题命中 规划推理 :planning(abstract)

AI总结 HODAgent作为面向服务人形机器人的System-2具身智能体,通过半双工架构实现自适应服务,在仿真与实体机器人上均显著优于基准模型。

Comments we have received a formal directive from our company requiring all company assets to undergo a mandatory internal review process before any public release. We are now required to immediately withdraw the paper to comply with this policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22700 2026-08-21 cs.CV 版本更新 50%

4DLoG: Generative Modeling of Neurodegenerative Brain Anatomy with 4D Longitudinal Diffusion Model

利用4D纵向扩散模型生成神经退行性脑解剖结构

Nivetha Jayakumar, Swakshar Deb, Bahram Jafrasteh, Qingyu Zhao, Miaomiao Zhang

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Radiology(放射学系) Department of Electrical and Computer Engineering, Department of Computer Science(电气与计算机工程系、计算机科学系)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种4D纵向扩散模型,用于生成神经退行性疾病的脑解剖结构,通过临床变量条件生成准确的脑部变化轨迹,验证了其在疾病分类和分割中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11665 2026-08-21 cs.CV cs.RO 版本更新 50%

UAV-Based Infrastructure Inspections: A Literature Review and Proposed Framework for AEC+FM

基于无人机的基础设施检查:面向AEC+FM的文献综述与提出框架

Amir Farzin Nikkhah, Dong Chen, Bradford Campbell, Somayeh Asadi, Arsalan Heydarian

专题命中 规划推理 :planning(abstract)

AI总结 本文综述了无人机在基础设施检查中的应用,提出框架整合多模态数据与Transformer架构,以提高检测准确性和可靠性,未来研究方向包括轻量级AI模型和合成数据集。

Comments Accepted for publication in the Proceedings of the International Conference on Computing in Civil Engineering (i3CE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 8 篇

2604.02794 2026-08-21 cs.AI 版本更新 85%

CharTool: Tool-Integrated Visual Reasoning for Chart Understanding

CharTool: 集成工具的视觉推理用于图表理解

Situo Zhang, Yifan Zhang, Zichen Zhu, Da Ma, Lei Pan, Danyang Zhang, Zihan Zhao, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室) AISpeech Co., Ltd.(思必驰科技股份有限公司)

专题命中 视觉空间推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI

AI总结 本文提出CharTool,通过集成工具提升多模态大语言模型对图表的理解能力,通过双重数据管道和代理强化学习,在六个图表基准测试中取得显著提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18574 2026-08-21 cs.LG 版本更新 83%

Continual Reasoning Gym: Diagnosing and Harnessing Shared Reasoning in Continual RLVR

持续推理环境:诊断与利用持续RLVR中的共享推理

Lirui Luo, Guoxi Zhang, Hongming Xu, Rongqing Li, Cong Fang, Lifeng Fan

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室(BIGAI)) Beijing Institute of Technology(北京理工大学) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室、北京大学智能科学与技术学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本研究提出持续推理环境,针对持续RLVR中顺序训练性能低于MTRL的问题,提出CPR方法利用共享推理,使模型平均达到MTRL级性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19726 2026-08-21 cs.CL cs.CV cs.LG 新提交 62%

Projector Is All You Train

仅训练投影器就足够

Nyx Iskandar, Saathvik Selvan, Slater Victoroff

机构 * Ramen VR(拉面VR公司) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究探究多模态大语言模型适配新模态是否需微调主干,经实验发现仅训练投影器即可实现强多模态性能,还能避免联合训练导致的语言模型能力漂移,且训练样本吞吐量约为联合训练的两倍,通过多类基准验证了结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06834 2026-08-21 cs.LG 版本更新 57%

Graph Machine: Exploring Edge Mechanisms as an Inductive Bias

图机:将边机制作为归纳偏置的探索

Lintai Hou

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出Graph Machine架构,含边增强注意力与以边为中心的引用两种边机制,在数独任务上优于Transformer基线,证明显式边机制是有前景的架构设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19298 2026-08-21 cs.CV 新提交 50%

SceneGTMM: A Conformal Mapping-based Scene-Aware Transferable GNN-Transformer Dual-Graph Interaction Framework for Map Matching

SceneGTMM:一种基于保角映射的场景感知可迁移GNN-Transformer双图交互地图匹配框架

Yongliang Zhang, Feng Song, Ji Chen, Lishuai Guo, Yong Deng, Yue Zheng, Tianyi Liu, Zhixiong Chen, Qixin Zhang

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出SceneGTMM框架,通过保角映射场景策略、双图交互架构与CRF增强预测,提升地图匹配的噪声鲁棒性、跨区域迁移性与可解释性,在多源及跨城轨迹匹配中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14497 2026-08-21 cs.CV 版本更新 50%

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

通过自我场景增强在多模态大语言模型中强化自我中心空间感知

Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究如何强化多模态大语言模型的自我中心空间感知,提出自我场景增强框架ESA,利用自我元素图作为中间表示,通过视觉基础模型增强空间感知,在EgoTextVQA基准上取得显著性能提升。

Comments 14 pages, 8 figures. Chi Kit Wong and Ye Pan contributed equally. Code: https://github.com/Chikit-WONG/spatialGraph

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29786 2026-08-21 cs.CV cs.RO 版本更新 50%

OP3DSG: Open-Vocabulary Part-Aware 3D Scene Graph Generation for Real-World Environments

OP3DSG:面向真实环境的开放词汇部件感知3D场景图生成

Yirum Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(全州科学技术院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出OP3DSG框架,通过部件感知检测与融合、几何初始化先验图及LLM精炼,实现开放词汇下对象、交互部件、空间/功能关系及可供性的统一建模,在UniGraph3D基准上达到最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02846 2026-08-21 cs.CV 50%

Action Anticipation at a Glimpse: To What Extent Can Multimodal Cues Replace Video?

瞬间动作预见:多模态线索能替代视频到何种程度?

Manuel Benavent-Lledo, Konstantinos Bacharidis, Victoria Manousaki, Konstantinos Papoutsakis, Antonis Argyros, Jose Garcia-Rodriguez

机构 * Universidad de Alicante(阿利坎特大学) Foundation for Research and Technology-Hellas(希腊基础研究与技术基金会) University of Crete(克里特大学) Hellenic Mediterranean University(希腊地中海大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 AAG通过结合单帧RGB特征与深度线索及先前动作信息,实现了多模态单帧动作预见,能与视频聚合基线和先进方法在教学活动数据集上竞争。

Comments Accepted in WACV 2026 - Applications Track

Journal ref 2026 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 9 篇

2608.20256 2026-08-21 cs.AI 新提交 86%

Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation

学习何时思考:面向测试时计算分配的自适应推理

Gijs Kassenaar, Zhao Yang, Vincent François-Lavet

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title);分类 cs.AI

AI总结 该研究提出基于GRPO的自适应推理模型,通过三种模式选择分配测试时计算,在MATH数据集上减少41%响应长度且保留高准确率,还可迁移至其他基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19807 2026-08-21 cs.LG 新提交 83%

Answer-Level Trust Selection for Physical Vision-Language Reasoning

面向物理视觉-语言推理的答案级信任选择

Rongyu Yu, Ke Niu, Fengxiang He

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 针对VLM部署中预测信任问题,提出模型无关的ATS框架,聚合8种诊断分数评估答案可靠性,可识别稳定错判等失效模式,补充模型级能力评估。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06245 2026-08-21 cs.RO cs.AI 版本更新 83%

MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action

MPCoT: 奖励引导的多路径潜在推理用于测试时可扩展的视觉-语言-动作

Boyang Zhang, Lianlei Shan

机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) Department of Computer Science, Tsinghua University(清华大学计算机系)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出MPCoT框架,通过奖励引导的多路径潜在推理,在保持零推理令牌和原始动作接口的同时,提升长时域和高不确定性控制任务中的VLA策略性能。

Comments 14 pages, 5 figures, submitted to CoRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19009 2026-08-21 cs.CL 版本更新 79%

Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning

评估评估者:面向大语言模型推理的验证自主等级(L0-L5)

Yajie Yin

专题命中 测试时计算 :reasoning(title);verifier(abstract);分类 cs.CL

AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。

Comments v2: reproducibility study (kappa~0.8), agent-security case (PPMF), anchor semantics, 15+ fixes. Code and data: https://github.com/1549080929-debug/math_agent Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02918 2026-08-21 cs.CV 版本更新 78%

Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning

Zoom-IQA:基于可靠区域感知推理的图像质量评估

Guoqiang Liang, Jianyi Wang, Zhonghua Wu, Shangchen Zhou, Chen Change Loy

机构 * S-Lab, Nanyang Technological University, Singapore(S实验室,南洋理工大学,新加坡) SenseTime Research(商汤科技研究院)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 研究图像质量评估问题,提出基于视觉语言模型的Zoom-IQA,通过两阶段训练管道,包括监督微调与强化学习,有效减轻标注偏差,提升了模型在鲁棒性、可解释性和泛化性方面的表现,在下游任务中也展现出有效性。

Comments ECCV 2026, Project Page: https://ethanliang99.github.io/ZOOMIQA-Projectpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20202 2026-08-21 cs.AI cs.CL cs.CY cs.DB cs.LG 新提交 75%

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

MemTrapBench:大语言模型记忆使用中认知陷阱的基准测试

Mengru Wang, Haozhe Luo, Zhenqian Xu, Zhixiang Cui, Haoming Xu, Qu Yang, Jizhan Fang, Junfeng Fang, Ningyu Zhang

专题命中 测试时计算 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究人员提出MemTrapBench基准测试,发现现有LLM记忆策略存在认知陷阱致性能下降,进而提出AdaptiveMem方法可缓解该问题并提升标准记忆基准性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19861 2026-08-21 cs.AI cs.CL cs.LG 新提交 67%

PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents

PolicyGuide:从单一动作防护到合规LLM智能体的全流程引导

Seongjae Kang, Taehyung Yu, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PolicyGuide将领域政策编译为工作流图,通过主动验证器引导LLM智能体合规执行,在多领域提升了合规率,且工作流可跨模型迁移,攻击成功率低、程序性合规性强。

Comments 26 pages, 15 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19611 2026-08-21 cs.CL cs.AI cs.LG 新提交 67%

Forking Fast: Efficiently Estimating Uncertainty Dynamics in Text Generation

快速分叉:高效估计文本生成中的不确定性动态

Eric Bigelow, Amir Zur, Satchel Grant, Tal Haklay, Can Rager, Owen Lewis, Thomas McGrath, Jack Merullo, Ekdeep Singh Lubana, Atticus Geiger

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对文本生成中不确定性动态估计成本高的问题,本研究开发统计模型平滑低采样推理数据以近似高采样数据,提升重采样分析效率,揭示不确定性动态的稳定模式及噪声来源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19893 2026-08-21 cs.CL cs.AI 新提交 62%

Interrupting the Loop: Periodic Subject Changes Raise Judged Surprise and Connection in Base Language Models

打断循环:周期性主体变化提升基础语言模型的惊讶度与关联度

Roberto I. Ono Filho

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 本研究探究基础语言模型的长文本生成特性,发现周期性注入新主体的打断操作可提升模型生成文本的惊讶度与关联度,还提出了长文本生成的评估方案。

Comments 48 pages including appendix; code, data pipeline and lab notebook at https://github.com/RobertoOno/interrupting-the-loop

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 6 篇

2608.20055 2026-08-21 cs.CR cs.AI 新提交 93%

EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models

EchoCoT:从大型推理模型中提取隐藏的思维链

Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出EchoCoT多步骤攻击方法,通过API交互可从开源及前沿专有大型推理模型中近乎逐字提取隐藏思维链,该方法还具备泛化性,凸显隐藏CoT提取的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20099 2026-08-21 cs.MA cs.CL cs.LG 新提交 62%

Reward-Guided Autoregressive Graph Generation for Efficient Multi-Agent Communication Topology Design

奖励引导自回归图生成的高效多智能体通信拓扑设计

Poomphob Suwannapichat, Boonyarit Changaival, Caesar Wu, Pascal Bouvry

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对多智能体系统通信拓扑设计中 token 消耗过高的问题,本文提出 RGA-Designer 方法,通过结合 RLHF 训练奖励模型微调图生成器,在保持任务准确率的同时降低了 token 消耗。

Comments Full version of extended abstract accepted at ICONIP 2026 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01548 2026-08-21 cs.AI cs.LG 版本更新 62%

LLM Capability Limits: Static Emergence and Dynamic Boundary Control

涌现不变性:从符号化思维到结构控制

Yi Liu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21596 2026-08-21 cs.AI 版本更新 57%

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills

FlowEvo:通过工作流和可执行技能的协同进化实现自我进化的智能体

Zeyu Ren, Ling Yue, Ran Li, Yishu Wang, Shengxiang Xu, Hanmo Liu, Shaowu Pan, Shimin Di

机构 * Southeast University(东南大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在让大型语言模型智能体通过工作流解决复杂任务。提出FlowEvo框架,通过工作流到技能编译、技能到工作流反馈、技能管理三个机制,使智能体无需更新模型参数积累完善能力,实验显示其在基准测试中精度-成本权衡优,各机制有贡献。

Comments Published as a conference paper at the Conference on Language Modeling (COLM) 2026. 25 pages, 3 figures, 16 tables. Code: https://github.com/DEFENSE-SEU/FlowEvo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18738 2026-08-21 cs.CL 版本更新 57%

Remask, Don't Replace: Token-to-Mask Refinement in Diffusion Language Models

重新标记,而非替换:扩散大语言模型中的令牌到标记细化

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL

AI总结 本文提出Token-to-Mask(T2M)方法,通过重新标记可疑令牌而非覆盖来提升扩散大语言模型的准确性,在AIME 2025和CMATH上分别提升13.33和8.56个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02353 2026-08-21 cs.CL 57%

Detecting AI-Generated Essays in Writing Assessment: Responsible Use and Generalizability Across LLMs

在写作评估中检测AI生成的论文:在LLMs中的负责任使用与通用性

Jiangang Hao

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了在写作评估中检测AI生成论文的挑战,分析了不同LLM间检测器的泛化能力,并提出了负责任使用检测器的指南。

Comments 21 pages, 2 figures

Journal ref Artificial Intelligence Applications in Educational Learning and Assessment, 2027

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 19 篇

2605.24960 2026-08-21 cs.CL cs.AI cs.LG 版本更新 87%

Investigating the Interplay between Contextual and Parametric Chain-of-Thought Faithfulness under Optimization

探究优化下上下文与参数化思维链忠实性之间的相互作用

Jingyi Sun, Qianli Wang, Pepa Atanasova, Nils Feldhus, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学) Technische Universität Berlin(柏林技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD – 柏林学习与数据基础研究院)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 通过提出统一偏好对齐接口FaithMate,研究上下文与参数化两种思维链忠实性范式在优化下的相互作用,发现两者正相关但不对称,且上下文忠实性指标间存在权衡。

Comments The first two authors contributed equally and share first-authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02239 2026-08-21 cs.AI cs.SE 79%

Engineering Reasoning and Instruction (ERI) Benchmark: A Large Taxonomy-driven Dataset for Foundation Models and Agents

工程推理与指令(ERI)基准:一个大规模的基于分类体系的数据集用于基础模型和代理

MZ Naser, Ahmad Bani Awwad, Zoie McCreery, Radwa Eissa, Ahmad Naser, Gianluca Cusatis, Andrew Metcalf, Kapil Madathil, Jamal Abdalla, Venkatesh Kodur, Mohammad Reza Saeb

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ERI基准通过大规模分类数据集评估工程能力,揭示LLM在不同难度问题上的性能差异,并采用收敛验证协议降低幻觉风险。

详情

展开后加载摘要…

URL PDF HTML 收藏