arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-28 至 2026-08-28 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 14 篇

2608.26386 2026-08-28 cs.CL cs.AI cs.LG 新提交 82%

Co-Evolving Structured Knowledge and Reasoning in Language Models

语言模型中结构化知识与推理的协同演化

Ryan Thomas Noonan, Linxi Zhao, Menghan Xu, Akanksha Sarkar, Mihir Mishra, Dongyoung Go, Kilian Q. Weinberger, Yoav Artzi, Jennifer J. Sun

机构 * Cornell University(康奈尔大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对检索增强方法的局限,提出协同演化框架KBevo,联合学习构建结构化知识库与推理,提升了知识结构质量、答案可达性及推理与可控性。

Comments COLM2026. Code available at this https URL (https://github.com/kilian-group/KBevo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25531 2026-08-28 cs.CL 版本更新 79%

ClueWeaver: Reward-Guided Dual-Agent Evidence Reasoning for Compact LLMs on Literary Long Narratives

ClueWeaver:面向紧凑型大语言模型的、针对文学长篇叙事的奖励引导双智能体证据推理框架

Jihao Zhu, Zhiwei Yang, Wenxiao Zhang, Junqian Zhao, Qi You, Fangqi Wang, Zheyuan Deng, Hanzhe Yang, Yu Liu, Jin B. Hong

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) University of Aberdeen(阿伯丁大学) The University of Western Australia(西澳大学) Brown University(布朗大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 ClueWeaver是用于紧凑型本地模型的双智能体证据推理框架,可提升本地语言模型在长篇叙事问答与声明验证任务中的性能,提供可检查的证据推理轨迹。

Comments Accepted by ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05876 2026-08-28 cs.CL 版本更新 79%

Addressing the Reasoning Gap: Mechanistic Circuit-Based Knowledge Editing in Large Language Models

基于机制电路的知识编辑在大语言模型中

Tianyi Zhao, Yinhan He, Wendy Zheng, Chen Chen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MCircKE框架,通过识别因果电路实现精准的知识编辑,解决大语言模型在动态环境中更新知识时的推理缺口问题,提升多跳推理能力。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26684 2026-08-28 cs.CV 新提交 78%

Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs

用你所说的语言推理:为VideoLLM中的推理蒸馏进行个人习语式的离线策略轨迹改写

Ji Soo Lee, Jinyoung Park, Seohyun Lee, Jongha Kim, Joonmyung Choi, Jinsung Yoon, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) Korea University(高丽大学) Google Cloud AI Research(谷歌云人工智能研究院)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 该研究针对VideoLLM的推理蒸馏提出Echo-GRPO框架,通过改写教师特权轨迹为学生自身习语实现策略对齐,实例化的VideoEcho-R1在多骨干和基准测试中均获性能提升,且作为插件模块适配多种训练框架。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26480 2026-08-28 cs.MA cs.AI cs.CL cs.SE 新提交 62%

Zero-Shot Self-Orchestration with Ledger-Based Control for Improved LLM Coding Performance

基于账本控制的零样本自编排提升大语言模型的代码生成性能

Victor Gao, Vida Khosrowshahi, Ali Khosrowshahi, Xihao Sun, Juhyun Lee, Simon (Sang Won)Lee

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于账本控制的管理者-工作者零样本自编排架构,在9个模型的100个困难代码问题上验证其可提升大语言模型代码生成性能,且成本低于改用更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22963 2026-08-28 cs.AI cs.CL 版本更新 62%

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

被文本债务掩埋:面向多模态大语言模型智能体的保留视觉证据的上下文剪枝

Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型智能体长轨迹中文本主导上下文、抑制视觉证据的问题,提出基于KL引导的SPARE框架,结合OPSD与SFT实现高效剪枝,在多步视觉工具使用基准中达到最优准确率与剪枝比例的权衡。

Comments 17 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16313 2026-08-28 cs.AI cs.LG 版本更新 62%

Learning to Predict, Discover, and Reason in High-Dimensional Event Sequences

学习预测、发现和推理高维事件序列

Hugo Math

机构 * Faculty of Applied Computer Science(应用计算机科学系) University of Augsburg(艾格堡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一事件序列建模、因果发现和大语言模型的框架,用于高维事件流中的自动化故障诊断,解决传统方法在高维数据中的不足。

Comments PhD dissertation, 135 pages of main content, 201 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27038 2026-08-28 cs.CL 新提交 57%

Cascaded Batch Prompting

级联批量提示

Sho Hoshino, Peinan Zhang

机构 * CyberAgent(赛博agent公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 针对批量提示导致大语言模型下游任务性能不可预测的问题,提出级联批量提示方法,在多项选择问答等任务上性能优于单提示基线,且加速效果与批量大小成正比,在帕累托前沿达到新最优。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26530 2026-08-28 cs.AI 新提交 57%

PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

循环中的PILOT:长智能体的实时自我改进

Yang Xiao, Yusong Sun, Haoyi Wu, Wenyang Hui, Wen Da, Zhaokai Luo, Mu Chuan, Yao Hu, Wenjie Li, Chengyue Jiang

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 该研究针对长智能体自我改进方法无法实时利用经验的问题,提出PILOT框架,通过实时引导与实时自我进化机制,在多基准测试中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26263 2026-08-28 cs.AI cs.MA 新提交 57%

SKILL.state: Scalable Long-Horizon Agent Skills

SKILL.state:可扩展的长程智能体技能

Sanket Badhe, Priyanka Tiwari, Jonghyun Chung

机构 * Google LLC(谷歌公司) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对现有智能体运行时的长程延迟与上下文污染问题,提出SKILL.state架构,用显式可变执行状态替代追加式对话历史,提升任务准确率并降低令牌消耗。

Comments accepted at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26164 2026-08-28 cs.AI 新提交 57%

A Task-Centric Ontology and Deterministic Domain Rules as a Verifiable Core for AI-Assisted Chemistry Problem Solving

以任务为中心的本体与确定性领域规则:AI辅助化学问题求解的可验证核心

Ibrokhimsho Abduchaborov

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ChemOntoRule,以任务为中心构建本体与确定性规则,在300道中学化学题上取得98.67%的匹配准确率,为AI辅助化学问题求解提供可验证的符号核心。

Comments 15 pages, 4 figures, 5 tables. Proof-of-concept evaluation of a task-centric chemistry ontology and deterministic rule engine on 300 human-authored and manually validated school-level problems. The proposed LLM translation layer and token-efficiency hypothesis are not evaluated in the current study

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06474 2026-08-28 cs.CL 版本更新 57%

DataSTORM: Deep Research on Large-Scale Databases using Exploratory Data Analysis and Data Storytelling

DataSTORM:利用探索性数据分析和数据叙事进行大规模数据库的深度研究

Shicheng Liu, Yucheng Jiang, Sajid Farook, Camila Nicollier Sanchez, David Fernando Castro Pena, Monica S. Lam

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 DataSTORM通过探索性数据分析和数据叙事,实现对大规模结构化数据库的深度研究,提出基于论点的分析流程,并在InsightBench上取得新的最佳成绩。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27338 2026-08-28 cs.MA 新提交 50%

One Model, Many Minds: Unlocking Multi-Agent Synergy in a Single Agent via Mixture of Roles

一个模型,多种心智:通过角色混合在单个智能体中解锁多智能体协同

Zhichen Zeng, Huiyuan Chen, Jingru Cheng, Juan Zha, Ming Liu, Ying Chen, Xiyuan Yang, Chaosheng Dong, Haiyang Zhang, Hanghang Tong

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究提出 MoRe 方法,将多种专门化组合为单个引导向量,使单智能体实现多视角专门化,性能优于单智能体基线,与 MAS 相当且 token 成本大幅降低。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26716 2026-08-28 cs.CV 新提交 50%

Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models

超越原子布局:基于视觉-语言模型的组合式设计理解

Yiyang Huang, Zhaowen Wang, Simon Jenni, Jing Shi, Yitian Zhang, Yizhou Wang, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(奥多比研究院)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文针对组合式布局理解任务,提出后训练范式MASON,利用约2万布局的CoDeLayout数据集,使Qwen2.5-VL 7B准确率达91.66%,优于基线及全数据微调。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏