arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-25 至 2026-08-25 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 22 篇

2608.22332 2026-08-25 cs.CL 新提交 91%

Mechanistic Interpretability of Chain-of-Thought Reasoning via Sequential Activation Patching

通过顺序激活补丁的思维链推理的机制可解释性

Murat Dura, Serkan Öztürk, Selma Tekir

机构 * İzmir Institute of Technology(伊兹密尔理工学院)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出顺序激活补丁框架及顺序多头补丁,探究思维链推理的因果效应位置与相关注意力头,证实存在支持思维链的分布式推理子电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23205 2026-08-25 cs.AI cs.CL 新提交 81%

Cognitive Profiling of LRMs' Reasoning Traces Using Bloom's Taxonomy

基于布鲁姆教育目标分类学的大型推理模型(LRMs)推理轨迹认知画像分析

Maria-Eleni Zoumpoulidi, Georgios Paraskevopoulos, Alexandros Potamianos

机构 * Institute for Language and Speech Processing, Athena Research Center(雅典娜研究中心语言与言语处理研究所) National Technical University of Athens(雅典国立技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究引入基于布鲁姆教育目标分类学的推理步骤自动标注框架,对LRMs开展大规模分析,发现思维类型与推理正确性相关,为提升推理质量提供洞见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23078 2026-08-25 cs.AI cs.CL 新提交 81%

AgentWeave: Routing Before Reasoning for Efficient Function Calling in Tool-Rich Language Models

AgentWeave:在工具丰富的语言模型中实现高效函数调用的推理前路由

Saurav Singla, Aarav Singla, Advik Gupta, Parnika Gupta

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出AgentWeave,一种推理前确定性路由层,可缩小工具丰富语言模型的函数调用候选集,在BFCL V4多函数任务上实现12.5%的原生BFCL成功,同时减少工具数量、输入token和延迟。

Comments 12 pages, 2 figures, 6 tables. Open-source implementation and reproducibility artifacts available in the AgentWeave repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22857 2026-08-25 cs.CL 新提交 79%

SAVER: Selective Auditing of Verbal Evidence for Error Recovery in VLM Change Reasoning

SAVER:面向VLM变化推理中错误恢复的口头证据选择性审计

Youdi Li

机构 * Panasonic Connect Co., Ltd.(松下连接公司)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 针对VLMs视觉变化推理的表述失败问题,提出轻量规则方法SAVER,通过选择性审计VLM输出的口头证据触发结构化重提示,在CLEVR-Change等基准上显著提升准确率。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01347 2026-08-25 cs.CL 版本更新 79%

Prompt-Induced Waste in Coding Agents: Reasoning, Effort, Harness Design, and End-to-End Cost

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02408 2026-08-25 cs.CV cs.AI 版本更新 79%

ReasonEdit: Editing Vision-Language Models using Human Reasoning

ReasonEdit:通过人类推理编辑视觉语言模型

Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ReasonEdit通过引入人类推理机制,改进视觉语言模型的编辑能力,提升编辑泛化性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23242 2026-08-25 cs.MM 新提交 78%

Mind the Couch! Eliciting MLLM Reasoning in Interior Design via Weak-to-Strong Task Vector Injection

留意沙发!通过弱到强任务向量注入激发多模态大语言模型在室内设计中的推理能力

Yuxuan Yang, Jingyao Wang, Luntian Mou

专题命中 其他推理 :reasoning(title,abstract)

AI总结 针对MLLMs在室内设计中因模态对齐问题产生的空间碰撞与审美不和谐,本文提出DART-I机制,通过弱到强任务向量注入引导MLLMs推理,无需微调即可实现精确推理,且经实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22337 2026-08-25 cs.MM cs.CV cs.SD 新提交 71%

Motion-Aware Reasoning from Speech to Mask Tracks: Runner-up Solution for the MeViS-Audio Track of the 8th LSVOS Challenge 2026

从语音到掩码轨迹的运动感知推理:2026年第8届LSVOS挑战赛MeViS音频赛道亚军方案

Jinxing Zhou, Suiyi Zhao, Yanghao Zhou, Ruohao Guo

专题命中 其他推理 :reasoning(title)

AI总结 该研究提出Speech2MaskTrack方案,整合语音识别、运动定位等技术,在第8届LSVOS挑战赛MeViS音频赛道获亚军,实现语音引导的参考视频对象分割任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22916 2026-08-25 cs.CL 新提交 70%

Knowing Isn't Always Saying: When Do Spatial Encodings Reach Answers in Vision-Language Models?

知晓并非总能表达:视觉语言模型中空间编码何时能抵达答案?

Zeyu Wang, Xinming Xu

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 其他推理 :chain-of-thought(abstract,abstract_cn);分类 cs.CL

AI总结 本研究针对视觉语言模型的空间编码何时能抵达答案的问题,采用方向干预方法,揭示了因果影响仅出现在中深层、文本思维链与视觉接地提示的不同作用等传输模式,为解决编码-接地差距提供了新视角。

Comments Accepted to appear in the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23244 2026-08-25 cs.CL cs.AI cs.LG stat.ML 新提交 67%

Credal Large Language Models for Semantic Commitment under Uncertainty

用于不确定性下语义承诺的Credal大语言模型

Shireen Kudukkil Manchingal, Sofiia Nikolenko, Fabio Cuzzolin

机构 * Oxford Dynamics(牛津动力学) Ludwig-Maximilians-Universität München(慕尼黑大学) Institute for Artificial Intelligence, Data Analysis and Systems (AIDAS)(人工智能、数据分析与系统研究所) School of Engineering Computing & Mathematics(工程计算与数学学院) Oxford Brookes University(牛津布鲁克斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出Credal大语言模型(CLLMs),通过LoRA适配器集成体构建Credal集合,推导CTC和SCC两类承诺分数,在多模型多数据集上验证其在问答、幻觉检测等任务中表现优异。

Comments 31 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22176 2026-08-25 cs.AI cs.LG 新提交 62%

Role-Specialized Mixture-of-Agents with Open-Weight LLMs for Clinical Prediction

采用开源权重大语言模型的角色专业化智能体混合架构用于临床预测

Jun Hou, Yi Fang, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出角色专业化的开源权重智能体混合架构,结合医学知识检索与相似患者推理,在死亡率预测上媲美闭源模型且标记更多高危患者,为隐私约束下的临床LLM预测提供关键角色设计思路。

Comments COLM 2026 DAIH Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21727 2026-08-25 cs.LG cs.AI 新提交 62%

Reinforcement Learning on Benign Facts Amplifies Leakage of Memorized Private Data

基于良性事实的强化学习会放大模型对已记忆私人数据的泄露

Renfei Zhang, Niloofar Mireshghallah

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现,基于良性事实的强化学习可放大指令模型对已记忆个人身份信息的泄露,且推理能力与拒绝率得以保留,为攻击者提供了无需接触私人数据即可提取的途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01101 2026-08-25 cs.LG cs.AI 版本更新 62%

Soft-NBCE: Entropy-Weighted Chunk Fusion for Long-Context

Soft-NBCE: 基于熵加权分块融合的长上下文处理

Shihao Ji, Mingyu Li, Zihui Song

机构 * Beijing Normal University(北京师范大学) Chunjiang Intelligence(春江智能)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对长上下文推理中硬选择策略导致语义碎片化的问题,提出Soft-NBCE,通过熵加权软融合和一致性蒸馏,在保持检索精度的同时提升多跳推理性能。

Comments Withdrawn due to serious concerns regarding the authenticity and accuracy of the listed authorship. The identity of one or more listed authors cannot presently be verified, and the author list may not represent distinct contributors. The manuscript is withdrawn pending institutional review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10488 2026-08-25 cs.CL cs.AI 版本更新 62%

DeepRefine: Agentic Knowledge Refinement via Reinforcement Learning

DeepRefine: 通过强化学习进行代理编译知识的精炼

Haoyu Huang, Jiaxin Bai, Shujie Liu, Yang Wei, Huihao Jing, Hong Ting Tsang, Yisen Gao, Zhongwei Xie, Yufei Li, Yangqiu Song

机构 * HKUST(香港科技大学) HKBU(香港大学) Microsoft Research Asia Hong Kong(微软亚洲研究院(香港))

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 DeepRefine是一种基于LLM的推理模型,通过用户查询提升预构建知识库的质量,以适应下游任务。该模型通过多轮交互和归纳诊断定位缺陷并进行针对性精炼,采用Gain-Beyond-Draft奖励机制进行强化学习训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22854 2026-08-25 cs.LG 新提交 57%

Thinking at the Right Size: Amortized Distillation Across Post-Trained LLMs

合适规模的思考:跨后训练大语言模型的摊销蒸馏

Yan Zhou, Sara Kangaslahti, Jonathan Geuter, Nihal V. Nayak, Marco Fumero, Francesco Locatello, David Alvarez-Melis

机构 * Harvard University(哈佛大学) IST Austria(奥地利科学技术研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出ADAPT框架,可单次蒸馏生成跨后训练大语言模型的多规模多变体模型,实现平滑规模插值与自适应规模选择,优化长文本推理的计算-准确率权衡。

Comments 8 pages, 6 figures. EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22376 2026-08-25 cs.CL 新提交 57%

Can Large Language Models "Hyper-Thread"?

大语言模型能否实现“超线程”?

Fei Ding

机构 * Alibaba Group(阿里巴巴集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出模型超线程假说,设计三种条件评估并行功能加载等,在 AIME 2025 开发集上获最高准确率,为超线程假说提供初步证据,推动推理扩展视角转变。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22152 2026-08-25 cs.CL 新提交 57%

The Collaboration Tax: How Much LLM Multi-Agent Systems Pay to Coordinate

协作损耗:LLM多智能体系统协调时的性能损失有多大

Weixiang Sun, Zehong Wang, Hong Huang, Colby Nelson, Yanfang Ye

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究定义了LLM多智能体系统的协作损耗,揭示其随模型能力提升单调下降,可通过对话特征预测,提示干预可缩小差距,为优化多智能体协作提供了量化依据。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16647 2026-08-25 cs.CL 版本更新 57%

Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models

硬币皆有两面:关于大型语言模型的策略内蒸馏中泛化的双重性质

Zhaoyi Li, Deyang Kong, Yuan Wei, Evan Yang, Ranran Shen, Mahardika Krisna Ihsani, Ming Yang, Wei Zhang, Chuan Hao, Jian Yang, Ran Tao, Bryan Dai, Shikun Zhang, Wei Ye, Ying Wei, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) IQuest Research(IQuest研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Zhejiang University(浙江大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究探究大型语言模型策略内蒸馏(OPD)的泛化特性,发现其迁移教师推理行为而非答案,同源配对泛化性强,异源配对适配性有限,多教师组合存在能力跷跷板效应,为诊断多教师OPD提供了视角。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14782 2026-08-25 cs.CV cs.CL 版本更新 57%

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

最后但同样重要:用于多模态KV缓存压缩的边界注意力校准

Tianhao Chen, Yuheng Wu, Kelu Yao, Xiaogang Xu, Xiaobin Hu, Dongman Lee

机构 * KAIST(韩国科学技术院) Zhejiang Laboratory(之江实验室) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对多模态大语言模型长视觉上下文中KV缓存压缩导致关键证据丢失的问题,提出BACON方法,通过校准观察窗口注意力与最后查询注意力,并利用层内一致性和层间持久性抑制噪声,在激进压缩下平均提升7.5%性能。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23234 2026-08-25 cs.CV 新提交 50%

MLLM-Assisted Audio VOS: A 3rd Place Report for the MeViS-Audio Track, 8th LSVOS Challenge

多模态大语言模型(MLLM)辅助音频引导的视频目标分割:第8届LSVOS挑战赛MeViS音频赛道第3名报告

Liangtao Shi, Jinxia Xie, Xiantao Hu, Ting Liu

机构 * Hefei University of Technology(合肥工业大学) Nanjing University of Science and Technology(南京理工大学) Hunan Police College(湖南警察学院)

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究提出一种结合MLLM与SAM的无训练音频引导视频分割框架,分解任务至各阶段并选用适配基础模型,在第8届LSVOS挑战赛MeViS音频赛道获第3名,验证了基础模型用于该任务的有效性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21657 2026-08-25 cs.AR 新提交 50%

Model Compression and Hardware-Aware Acceleration for Deep Learning on FPGAs: A Co-Design Taxonomy and Comparative Analysis

面向FPGA的深度学习模型压缩与硬件感知加速:协同设计分类体系与对比分析

Peter Forcha, H. Kajekusumadhar, Mbua Peter, Muhammed Kawser, Audrey Cyriell Mo, Christophe Bobda

专题命中 其他推理 :reasoning(abstract)

AI总结 本综述针对FPGA的深度学习部署,建立压缩与硬件加速的分类体系,分析25项案例研究,发现领域表征缺口,明确六项开放挑战并给出具体下一步方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17681 2026-08-25 cs.CV 版本更新 50%

Motion-Aware Vision-Reference Alignment for Referring Multi-Object Tracking

基于多模态大语言模型的视觉-运动-参考对齐的指称多目标跟踪

Weiyi Lv, Ning Zhang, Hanyang Sun, Haoran Jiang, Kai Zhao, Yixiao Gu, Jing Xiao, Dan Zeng

机构 * Shanghai University(上海大学) PAII Inc.(PAII公司)

专题命中 其他推理 :reasoning(abstract)

AI总结 VMRMOT通过多模态大语言模型实现视觉-运动-参考对齐,提升指称多目标跟踪的性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏