arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-25 至 2026-08-25 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 21 篇

2608.21860 2026-08-25 cs.LG cs.AI 新提交 91%

ChainPrune: Evaluating and Reducing Redundancy in Long Chain-of-Thought Reasoning

ChainPrune:评估与减少长思维链推理中的冗余

Weihang Pan, Zhengxu Yu, Yuxiang Zhang, Wenzhi Li, Zhongming Jin, Binbin Lin, Xiaofei He, Jieping Ye

机构 * Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 ChainPrune 是一种推理路径语义结构优化方法,通过整合推理路径为树结构、选择主导路径及结合 DPO 与监督损失,减少长思维链冗余,在保精度的同时降低了步骤长度与计算开销。

Comments 15 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22090 2026-08-25 cs.CL cs.AI cs.LG 新提交 87%

Semantic Reasoning Denoising: Correcting Language Model Reasoning with Semantic Operators

语义推理去噪:用语义算子修正语言模型的推理

Yujiao Yang

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出语义推理去噪(SRD)方法,用语义算子修正语言模型推理,在六个域内基准平均提升基线3.2个点,七个跨数据集迁移目标上也有良好表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23172 2026-08-25 cs.CL cs.CV 新提交 85%

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

CaRGo-T:因果推理思维图提升多模态幽默理解能力

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly

机构 * Microsoft Research India(微软研究院印度分部) LinkedIn(领英公司) Nutanix(Nutanix公司) Indian Institute of Science(印度科学学院) Apple(苹果公司) Fujitsu Research India(富士通印度研究院) Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究提出CaRGo-T因果推理思维图框架,在四类含讽刺等喜剧内容的数据集上,提升VLMs的幽默理解与检测性能,相关代码已公开。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17610 2026-08-25 cs.CV cs.CL 版本更新 84%

SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening

SafeLens: 一种高效且可靠的视频护栏系统,采用快速和缓慢筛查

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * University of South Florida(佛罗里达州立大学) University of California, Davis(加州大学戴维斯分校)

专题命中 复杂问题求解 :chain-of-thought(summary_cn,abstract);reasoning(abstract);分类 cs.CL

AI总结 本研究提出SafeLens视频护栏框架,通过快速和缓慢的推理架构实现高效的视频内容审核,同时构建高质量数据集并采用结构化Chain-of-Thought追踪来解决训练时间扩展的限制,从而在实际和AI生成视频基准测试中取得最佳性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21863 2026-08-25 cs.CL cs.AI 新提交 84%

HiDiffTIR: Hierarchical Difficulty-Aware Policy Optimization for Multi-Turn Tool-Integrated Reasoning

HiDiffTIR:面向多轮工具集成推理的分层难度感知策略优化

Yucan Guo, Xiaohan Wang, Miao Su, Saiping Guan, Zhongni Hou, Jiajun Chai, Wei Lin, Guojun Yin, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Meituan(美团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 HiDiffTIR是面向多轮工具集成推理的分层难度感知策略优化框架,通过在轨迹和轮次两级执行难度感知信用分配,无需额外监督即可提升工具集成推理性能。

Comments Accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22479 2026-08-25 cs.CL cs.LG 新提交 81%

GTA-RAG: Graph-Trajectory-Augmented Reinforcement Learning for Multi-Turn Retrieval-Augmented Reasoning

GTA-RAG:用于多轮检索增强推理的图轨迹增强强化学习

Jun Chen, Yongchao Liu, Pengyu Qiu, Jiajun Zheng, Juelu Zhang, Yujie Zeng, Qin Zhang, Ziyue Qiao, Xiao Luo

机构 * Shenzhen University(深圳大学) Great Bay University(大湾区大学) Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 GTA-RAG是一种图轨迹增强强化学习框架,通过轨迹级监督优化检索策略,在多跳和简单问答基准上,相比RL-based RAG基线提升了性能与证据链覆盖率。

Comments 11 pages, 5 figures. Accepted to EMNLP 2026 Fundings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21948 2026-08-25 cs.CV 新提交 78%

Sparse Multi-Stage Expert-Agent Routing for Complex Clinical Reasoning

面向复杂临床推理的稀疏多阶段智能体专家路由机制

Sike Xiang, Shuang Chen, Qian sun, Jia Cheng, Yusi Wei, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出Sparse Multi-Stage Expert-Agent Routing框架,通过自适应激活稀疏专家智能体实现高效临床推理,引入ClinFEScore评估协议,在200例真实MDT病例上达91.5%诊断准确率,激活专家数从17.0降至3.0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21939 2026-08-25 cs.IR 新提交 78%

Enhancing Group Recommendation with Memory-Augmented Reasoning in LLM Agent

基于记忆增强推理的大语言模型智能体群组推荐增强方法

Qimeng Niu, Bowen Hao, Zixuan Zhang, Shuyu Qu, Hongzhi Yin

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本研究提出基于LLM智能体的AGR模型,通过记忆模块与推理模块建模群组偏好动态演变及决策过程,在公开数据集上显著提升了群组推荐的准确率与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10029 2026-08-25 cs.GT 版本更新 73%

Auditing Game-Theoretic Measures of Strategic Reasoning in LLMs

量子反应均衡作为战略成熟度的度量:理论与LLM评估中的验证

Mateo Pechon-Elkins (Yale University), Jon Chun (Kenyon College)

专题命中 复杂问题求解 :reasoning(title);self-correction(comments)

AI总结 本文提出基于量子反应均衡的理论框架,用于评估大型语言模型的战略成熟度,通过实验验证了模型在不同认知能力上的表现及参数估计的稳健性。

Comments v2: substantive self-correction of v1 against raw transcripts; title changed. Corrects game specs to the implemented games; exact equilibrium solve (conditional bluff rate 2/3, not 0.340); response-validity audit: parser-substituted defaults retract Kimi K2's profile; prompt-framing result reversed. Appendix itemizes all changes. Data: this https URL (https://doi.org/10.5281/zenodo.21943627). 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22963 2026-08-25 cs.AI cs.CL 新提交 62%

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

被文本债务掩埋:面向多模态大语言模型智能体的保留视觉证据的上下文剪枝

Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型智能体长轨迹中文本主导上下文、抑制视觉证据的问题,提出基于KL引导的SPARE框架,结合OPSD与SFT实现高效剪枝,在多步视觉工具使用基准中达到最优准确率与剪枝比例的权衡。

Comments 14 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22232 2026-08-25 cs.AI cs.CL cs.CV cs.MM 新提交 62%

Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models

超越表象:揭示多模态大语言模型的情境错觉

Zhiming Yang, Zhuoxi Xiong, Donglin Zhou, Wenjun Wei, Shiyao Cui, Jinqiao Shi

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对多模态大语言模型(MLLMs)面临的情境错觉问题,构建分类体系并推出MSIBench基准,发现27种模型配置均易受6类错觉影响,通过提示工程和监督微调最多提升性能20%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22762 2026-08-25 cs.AI 新提交 57%

Compositional Chain-of-Relations for Faithful Knowledge Graph Question Answering with Large Language Models

面向大型语言模型的忠实知识图谱问答的组合式关系链

Chenhui Liu, Jianpeng Zhou, Jiahai Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文针对现有基于LLM的KGQA方法存在的实体剪枝不可靠、约束处理无基础的局限,提出组合式关系链(CCoR)框架,以关系为中心探索实现更忠实的多跳KGQA,在多个基准上性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22429 2026-08-25 cs.AI 新提交 57%

Think with Structured Grounding: Perceptual Reinforcement Learning for Chart and Visual-Tabular Understanding

基于结构化接地的思考:面向图表与视觉表格理解的感知强化学习

Changjiang Jiang, Qiannian Zhao, Lei Xin, Jinxiang Xie, Preslav Nakov, Zhuohan Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Nanjing University(南京大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对MLLMs依赖外部工具感知图表等视觉内容的问题,提出TwSG框架,通过两阶段训练实现细粒度视觉推理,降低延迟并提升准确率与鲁棒性。

Comments Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22130 2026-08-25 cs.MA cs.CL 新提交 57%

PropUQ-MAS: Propagation-Aware Uncertainty Quantification for LLM Multi-Agent Systems

PropUQ-MAS:面向大语言模型多智能体系统的传播感知不确定性量化

Yaokun Liu, Yifan Liu, Daniel Yue Zhang, Ruichen Yao, Zelin Li, Dong Wang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 针对现有不确定性量化方法无法捕捉大语言模型多智能体系统中不确定性传播的问题,提出PropUQ-MAS框架,实验显示其可显著提升该系统的不确定性量化性能。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22055 2026-08-25 cs.AI 新提交 57%

GenCoord: Skill-Path Commitments under Private Information

Peng He, Junning Zhu, Haohan Yuan, Jianpeng Liang

机构 * Tsinghua University(清华大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of California San Diego(加利福尼亚大学圣迭戈分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

Comments 25 pages, 10 figures, and 23 tables, including supplementary material. Peng He and Junning Zhu contributed equally. Paper source and compact evidence: this https URL (https://github.com/JulianZJN/GenCoord)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10330 2026-08-25 cs.AI 版本更新 57%

Hierarchical Compositionality for An Assistive AI Agent

面向辅助AI智能体的分层组合性

Tianyi Fu, Mohan Sridharan

机构 * University of Edinburgh(爱丁堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文针对辅助AI智能体的歧义问题,提出嵌入分层组合性原则的架构,结合语义兼容性等模型推理实现歧义消除,实验表明其性能优于当前最优数据驱动基线,可适配特定用户画像。

Comments 29 pages, 9 figures, 4 tables. Project page: this https URL (https://tianyi-fu.github.io/HCAA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23115 2026-08-25 cs.SE 新提交 50%

A Multi-Viewpoint Modeling Framework for Digital Twin Integration and Reuse with LLM-Assisted Compatibility Analysis

基于大语言模型辅助兼容性分析的数字孪生集成与重用多视点建模框架

Nafiseh Soveizi, Milan Kopp, Parinaz Rashidi, Qing Shan, Geerten M. Hengeveld, Ioannis N. Athanasiadis, Zhiming Zhao

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出基于RM-ODP的多视点DT集成建模框架,结合LLM辅助的不匹配检测,实现结构化兼容性推理,提升互操作性,支持异构DT生态系统的可扩展模型重用。

Comments 45 page, 14 figs, 6 tables, 2 Appendix, Submitted to the International Journal on Software and Systems Modeling (SoSyM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23050 2026-08-25 cs.HC 新提交 50%

What Makes an Initial Reaction Ready for Discussion?: Multi-Persona AI Support for Stance Reflection and Writing

是什么让初始反应适合讨论?:用于立场反思与写作的多角色AI支持

Sky Shih-Kai Hong, Mu-Tien Kuo, Wei-Ji Chen

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本研究提出多角色AI工具StanceLab,通过对比三角色模式与独立LLM模式的试点,明确了设计需求并规划了未来工作流,助力用户准备讨论立场。

Comments 5 pages, 3 figures, 2 tables. Accepted to TAICHI 2026 ( this https URL (https://taichi2026.taiwanchi.org/program) )

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22151 2026-08-25 cs.SE cs.ET 新提交 50%

Towards Actionable Visualization: Ten Years Later, What Generative AI Changes and What It Cannot

面向可操作的可视化:十年之后,生成式AI带来了什么改变,又有什么是它做不到的

Leonel Merino, Mohammad Ghafari, Oscar Nierstrasz

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究回顾了十年前软件可视化领域的研究现状,探讨生成式AI对该领域的改变与局限,提出未来应聚焦于帮助人类理解复杂软件系统及AI生成内容,并指出可操作可视化已成为该领域可达成的标准。

Comments 2026 IEEE Working Conference on Software Visualization (VISSOFT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17949 2026-08-25 cs.CV 版本更新 50%

SkyNative: A Native Multimodal Architecture for Remote Sensing Vision-Language Understanding

SkyNative: 一种面向遥感视觉证据推理的原生多模态框架

Xiao Yang, Ronghao Fu, Zhiwen Lin, Zhuoran Duan, Lang Sun, Jiaqi Liu, Jiashun Zhu, Jiasen Hu, Xu Na, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出SkyNative,一种原生多模态框架,通过去除预训练视觉骨干,直接在语言模型token空间中表示图像为原始patch tokens,以提升遥感图像的细粒度空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-08-25 cs.CV 版本更新 50%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏