arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-25 至 2026-08-25 共收录 249 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 69 篇

2608.21381 2026-08-25 cs.CY cs.CL 新提交 57%

PersonaMem-v3: Toward Omni-Platform Personal Intelligence for Holistic User Understanding, Recommendation, and Agentic Tasks

PersonaMem-v3:面向全平台个人智能以实现全面的用户理解、推荐及智能体任务

Bowen Jiang, Yuan Yuan, Zhuoqun Hao, Yuchen Liu, Maohao Shen, Sihao Chen, Gregory Wornell, Chris Callison-Burch, Lyle Ungar, Dan Roth, Qi Guo, Xiangjun Fan, Camillo J. Taylor, Hanchao Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出PersonaMem-v3基准,用于评估全平台个人智能,助力开发兼具跨场景用户理解、可控推荐及合理个性化能力的LLM驱动智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15763 2026-08-25 cs.CL 版本更新 57%

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

TaoLive数字虚拟人智能体技术报告:训练智能体随其Harness进化

TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen

机构 * TaoLive(陶境科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究针对直播电商数字虚拟人主播的实时需求,提出HAT方法,结合HSA的三阶段训练,使35B紧凑模型在低延迟下适配Harness变化,性能优于基础模型及通用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15592 2026-08-25 cs.AI 版本更新 57%

When Entropy Is Not Enough: Reclaiming Lost Semantics in LLM Output Length Prediction

当熵不够用时:在大语言模型输出长度预测中恢复丢失的语义

Feiyang Ren, Shengtao Wen, Lingbing Guo, Yu Tian, Yuanning Cui, Xiang Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对 LLM 服务中序列填充导致的算力浪费问题,提出 ESTP 框架结合熵与语义重要性预测输出长度,在 ForeLen 基准及端到端测试中均表现更优,可提升吞吐量并降低填充率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12129 2026-08-25 cs.CL 版本更新 57%

SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges

SAG:基于查询时动态超边的SQL检索增强生成

Yuchao Wu, Junqin Li, XingCheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li

机构 * Zleap AI(智量科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出SAG(SQL检索增强生成)架构,通过查询时动态超边实现结构化检索,在HotpotQA等多跳问答基准上性能优于基线,为LLM智能体处理组织知识提供了新方案。

Comments This work was intended as a replacement of arXiv:2606.15971 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-08-25 cs.CV cs.AI 版本更新 57%

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08269 2026-08-25 cs.AI 版本更新 57%

PolyUQuest: Verifiable Structure-Aware Web RAG over Heterogeneous Graphs

PolyUQuest:基于异构图的可验证结构感知网络检索增强生成

Ying Liu, Yi Ye, Quanyu Feng, Mingxi Ye, Mingtao Zhang, Haoyang Li, Chen Jason Zhang, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对现有RAG系统不足,提出基于异构图的PolyUQuest框架。通过双层路由器分配查询到三种检索模式,答案可验证。在PolyU官网等评估中,该框架在多方面优于现有系统,还提供交互式界面,准备部署为学生问答服务。

Comments Accepted at CIKM 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10949 2026-08-25 cs.AI 版本更新 57%

Recalling Too Well: Sycophancy Evaluation and Mitigation in Memory-Augmented Models

回忆过好:记忆增强模型中的谄媚评估与缓解

Shelly Bensal, Axel Magnuson, Aparna Balagopalan, Daniel M. Bikel

机构 * Writer, Inc.(Writer公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究首次系统评估记忆增强模型中的谄媚现象,提出MIST基准测试,发现记忆会放大谄媚行为(最高25倍),并提出两种轻量级缓解方法。

Comments Under submission; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11533 2026-08-25 cs.CL cs.CV 版本更新 57%

Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation

Checkup2Action:面向患者行动的多模态临床检查报告数据集

Sike Xiang, Shuang Chen, Kevin Qinghong Lin, Jialin Yu, Yijia Sun, Philip Torr, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22281 2026-08-25 eess.IV cs.CV 新提交 50%

CiUNet: A Hybrid Swin-CNN UNet for Medical Image Segmentation

CiUNet:用于医学图像分割的混合Swin-CNN UNet

Bin Dong, Jinghong Chen

专题命中 推理评测 :reasoning(abstract)

AI总结 针对医学图像分割的隐私、效率需求,提出基于Swin-UNet的混合架构,融合并行CNN编码器与XSkip连接等,在Synapse数据集上实现SOTA分割性能,为临床部署提供可行方案。

Comments 14 pages, 3 figures. The demo predictor and trained weights are available at:https://github.com/ciphoBD/CiUNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22660 2026-08-25 cs.CY 新提交 50%

Evaluation in the Age of AI: Output as Evidence of Learning

AI时代的评价:输出作为学习的证据

Md Zarzees Uddin Shah Chowdhury, Samin Rahman Khan

专题命中 推理评测 :reasoning(abstract)

AI总结 本文探讨AI时代大学教育评价的伦理挑战,指出传统评价指标易被AI外包的问题,提出需转向重视过程的替代评价模式,以保留学生自主性与问责制。

Comments 12 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22323 2026-08-25 cs.CV 新提交 50%

MedReaMM: Evaluating Large Multimodal Models on Expert-Level Clinical Diagnostic Synthesis

MedReaMM:评估大型多模态模型在专家级临床诊断综合能力上的表现

Lai Wei, Yuchao Chen, Zhenbiao Cao, Xiaojin Zhang, Zhongyu Wei, Bangting Wang, Wei Chen, Xiang Bai

机构 * The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院) Jiangsu Province Hospital(江苏省医院) Huazhong University of Science Technology(华中科技大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究构建了多模态临床诊断基准MedReaMM,评估23个大型多模态模型的诊断综合能力,发现多数模型准确率不足50%,揭示了该领域的能力差距及相关影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22004 2026-08-25 cs.SE 新提交 50%

LLM-Enhanced Commit Message Generation via Issue Information: An Exploratory Study

结合问题信息的大语言模型增强型提交消息生成:一项探索性研究

Zongen Ren, Wei Shi, Bo Xiong, Chong Wang, Peng Liang

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究提出ISAC框架,将代码差异与问题信息结合作为LLM输入生成提交消息,经实验验证其性能优于现有基线,且纳入问题信息可提升CMG效果。

Comments 28 pages, 7 images, 11 tables, Manuscript submitted to a journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31192 2026-08-25 cs.CV 版本更新 50%

Specialist-Generalist Fusion with Outcome-Supervised Rationales for Deepfake Detection

语言训练深度伪造检测器的正则化能力

Benedikt Hopf, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00968 2026-08-25 cs.HC 版本更新 50%

SherpaAI: A Multi-modal Solution for Delivering Personalized and Adaptive Fitness Interventions

FlexAI: 一种多模态解决方案,用于提供个性化和自适应的健身干预

Shivangi Agarwal, Zoya Ghoshal, Bharat Jain, Siddharth

专题命中 推理评测 :reasoning(abstract)

AI总结 FlexAI通过整合计算机视觉、生理传感器和大语言模型,提供实时个性化健身指导,显著提升用户参与度和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18537 2026-08-25 cs.SE 版本更新 50%

CRANE-LLM: Runtime-Augmented LLMs for Crash Prediction and Diagnosis in ML Notebooks

运行时增强的LLM用于ML笔记本的崩溃检测与诊断

Yiran Wang, José Antonio Hernández López, Ulf Nilsson, Dániel Varró

专题命中 推理评测 :reasoning(abstract)

AI总结 CRANE-LLM通过整合运行时信息提升ML笔记本崩溃检测与诊断的准确性与F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23155 2026-08-25 cs.RO 版本更新 50%

LaGEA: Language Guided Embodied Agents for Robotic Manipulation

LAGEA:基于语言引导的机器人操作代理

Abdul Monaf Chowdhury, Akm Moshiur Rahman Mazumder, Safaeid Hossain Arib, Rabeya Akter

机构 * Department of Robotics Mechatronics Engineering, University of Dhaka, Bangladesh Center for Computational \& Data Sciences, Independent University, Bangladesh

专题命中 推理评测 :reasoning(abstract)

AI总结 LAGEA通过语言引导具身代理学习,提升机器人操作任务的成功率和效率。

Comments ICML 2026 Main Track Poster

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 23 篇

2608.22332 2026-08-25 cs.CL 新提交 91%

Mechanistic Interpretability of Chain-of-Thought Reasoning via Sequential Activation Patching

通过顺序激活补丁的思维链推理的机制可解释性

Murat Dura, Serkan Öztürk, Selma Tekir

机构 * İzmir Institute of Technology(伊兹密尔理工学院)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出顺序激活补丁框架及顺序多头补丁,探究思维链推理的因果效应位置与相关注意力头,证实存在支持思维链的分布式推理子电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16205 2026-08-25 cs.CR cs.AI cs.CL cs.LG 82%

Reasoning as a Weapon: Adaptive Dual-Path Jailbreak Attack on Large Language Models

Shi Lin, Peng Qian, Hongming Yang, Renjie Sun, Dezhang Kong, Xun Wang

机构 * Zhejiang Gongshang University(浙江工商大学) Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23205 2026-08-25 cs.AI cs.CL 新提交 81%

Cognitive Profiling of LRMs' Reasoning Traces Using Bloom's Taxonomy

基于布鲁姆教育目标分类学的大型推理模型(LRMs)推理轨迹认知画像分析

Maria-Eleni Zoumpoulidi, Georgios Paraskevopoulos, Alexandros Potamianos

机构 * Institute for Language and Speech Processing, Athena Research Center(雅典娜研究中心语言与言语处理研究所) National Technical University of Athens(雅典国立技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究引入基于布鲁姆教育目标分类学的推理步骤自动标注框架,对LRMs开展大规模分析,发现思维类型与推理正确性相关,为提升推理质量提供洞见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23078 2026-08-25 cs.AI cs.CL 新提交 81%

AgentWeave: Routing Before Reasoning for Efficient Function Calling in Tool-Rich Language Models

AgentWeave:在工具丰富的语言模型中实现高效函数调用的推理前路由

Saurav Singla, Aarav Singla, Advik Gupta, Parnika Gupta

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出AgentWeave,一种推理前确定性路由层,可缩小工具丰富语言模型的函数调用候选集,在BFCL V4多函数任务上实现12.5%的原生BFCL成功,同时减少工具数量、输入token和延迟。

Comments 12 pages, 2 figures, 6 tables. Open-source implementation and reproducibility artifacts available in the AgentWeave repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22857 2026-08-25 cs.CL 新提交 79%

SAVER: Selective Auditing of Verbal Evidence for Error Recovery in VLM Change Reasoning

SAVER:面向VLM变化推理中错误恢复的口头证据选择性审计

Youdi Li

机构 * Panasonic Connect Co., Ltd.(松下连接公司)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 针对VLMs视觉变化推理的表述失败问题,提出轻量规则方法SAVER,通过选择性审计VLM输出的口头证据触发结构化重提示,在CLEVR-Change等基准上显著提升准确率。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01347 2026-08-25 cs.CL 版本更新 79%

Prompt-Induced Waste in Coding Agents: Reasoning, Effort, Harness Design, and End-to-End Cost

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02408 2026-08-25 cs.CV cs.AI 版本更新 79%

ReasonEdit: Editing Vision-Language Models using Human Reasoning

ReasonEdit:通过人类推理编辑视觉语言模型

Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ReasonEdit通过引入人类推理机制,改进视觉语言模型的编辑能力,提升编辑泛化性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23242 2026-08-25 cs.MM 新提交 78%

Mind the Couch! Eliciting MLLM Reasoning in Interior Design via Weak-to-Strong Task Vector Injection

留意沙发!通过弱到强任务向量注入激发多模态大语言模型在室内设计中的推理能力

Yuxuan Yang, Jingyao Wang, Luntian Mou

专题命中 其他推理 :reasoning(title,abstract)

AI总结 针对MLLMs在室内设计中因模态对齐问题产生的空间碰撞与审美不和谐,本文提出DART-I机制,通过弱到强任务向量注入引导MLLMs推理,无需微调即可实现精确推理,且经实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22337 2026-08-25 cs.MM cs.CV cs.SD 新提交 71%

Motion-Aware Reasoning from Speech to Mask Tracks: Runner-up Solution for the MeViS-Audio Track of the 8th LSVOS Challenge 2026

从语音到掩码轨迹的运动感知推理:2026年第8届LSVOS挑战赛MeViS音频赛道亚军方案

Jinxing Zhou, Suiyi Zhao, Yanghao Zhou, Ruohao Guo

专题命中 其他推理 :reasoning(title)

AI总结 该研究提出Speech2MaskTrack方案,整合语音识别、运动定位等技术,在第8届LSVOS挑战赛MeViS音频赛道获亚军,实现语音引导的参考视频对象分割任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22916 2026-08-25 cs.CL 新提交 70%

Knowing Isn't Always Saying: When Do Spatial Encodings Reach Answers in Vision-Language Models?

知晓并非总能表达:视觉语言模型中空间编码何时能抵达答案?

Zeyu Wang, Xinming Xu

机构 * Peking University(北京大学) Tsinghua University(清华大学)

专题命中 其他推理 :chain-of-thought(abstract,abstract_cn);分类 cs.CL

AI总结 本研究针对视觉语言模型的空间编码何时能抵达答案的问题,采用方向干预方法,揭示了因果影响仅出现在中深层、文本思维链与视觉接地提示的不同作用等传输模式,为解决编码-接地差距提供了新视角。

Comments Accepted to appear in the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23244 2026-08-25 cs.CL cs.AI cs.LG stat.ML 新提交 67%

Credal Large Language Models for Semantic Commitment under Uncertainty

用于不确定性下语义承诺的Credal大语言模型

Shireen Kudukkil Manchingal, Sofiia Nikolenko, Fabio Cuzzolin

机构 * Oxford Dynamics(牛津动力学) Ludwig-Maximilians-Universität München(慕尼黑大学) Institute for Artificial Intelligence, Data Analysis and Systems (AIDAS)(人工智能、数据分析与系统研究所) School of Engineering Computing & Mathematics(工程计算与数学学院) Oxford Brookes University(牛津布鲁克斯大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出Credal大语言模型(CLLMs),通过LoRA适配器集成体构建Credal集合,推导CTC和SCC两类承诺分数,在多模型多数据集上验证其在问答、幻觉检测等任务中表现优异。

Comments 31 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22176 2026-08-25 cs.AI cs.LG 新提交 62%

Role-Specialized Mixture-of-Agents with Open-Weight LLMs for Clinical Prediction

采用开源权重大语言模型的角色专业化智能体混合架构用于临床预测

Jun Hou, Yi Fang, Xuan Wang

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出角色专业化的开源权重智能体混合架构,结合医学知识检索与相似患者推理,在死亡率预测上媲美闭源模型且标记更多高危患者,为隐私约束下的临床LLM预测提供关键角色设计思路。

Comments COLM 2026 DAIH Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21727 2026-08-25 cs.LG cs.AI 新提交 62%

Reinforcement Learning on Benign Facts Amplifies Leakage of Memorized Private Data

基于良性事实的强化学习会放大模型对已记忆私人数据的泄露

Renfei Zhang, Niloofar Mireshghallah

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现,基于良性事实的强化学习可放大指令模型对已记忆个人身份信息的泄露,且推理能力与拒绝率得以保留,为攻击者提供了无需接触私人数据即可提取的途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01101 2026-08-25 cs.LG cs.AI 版本更新 62%

Soft-NBCE: Entropy-Weighted Chunk Fusion for Long-Context

Soft-NBCE: 基于熵加权分块融合的长上下文处理

Shihao Ji, Mingyu Li, Zihui Song

机构 * Beijing Normal University(北京师范大学) Chunjiang Intelligence(春江智能)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对长上下文推理中硬选择策略导致语义碎片化的问题,提出Soft-NBCE,通过熵加权软融合和一致性蒸馏,在保持检索精度的同时提升多跳推理性能。

Comments Withdrawn due to serious concerns regarding the authenticity and accuracy of the listed authorship. The identity of one or more listed authors cannot presently be verified, and the author list may not represent distinct contributors. The manuscript is withdrawn pending institutional review

详情

展开后加载摘要…

URL PDF HTML 收藏