Efficient Thought Space Exploration Through Strategic Intervention
通过战略干预实现高效思维空间探索
机构 * Baidu(百度)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 HPR框架通过战略干预减少计算成本,在保持高准确率的同时实现高效推理。
Comments AAAI 2026
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
通过战略干预实现高效思维空间探索
机构 * Baidu(百度)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI
AI总结 HPR框架通过战略干预减少计算成本,在保持高准确率的同时实现高效推理。
Comments AAAI 2026
迈向遥感中的可信推理:一种基于感知的地理空间思维链用于视觉-语言模型
机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract)
AI总结 本研究提出Geo-CoT框架,通过两阶段策略提升遥感VLMs的推理能力,实现可验证的多步骤分析,显著优于现有模型。
在多步骤LLM推理中发现过程-结果信用
机构 * The University of Melbourne(墨尔本大学)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种新的框架,通过分步边际信息增益机制和解耦掩码策略,提升多步骤LLM推理的样本效率和准确性,并增强模型的分布外鲁棒性。
训练LLMs进行分而治之推理以提高测试时的可扩展性
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 本文提出一种端到端强化学习框架,通过分而治之推理提升LLMs在复杂任务上的推理能力和测试时可扩展性。
ROG:基于知识图谱的复杂一阶查询的检索增强大语言模型推理
机构 * School of Information Science and Engineering, Chongqing Jiaotong University(信息科学与工程学院,重庆交通大学) ; State Grid Chongqing Electric Power Company(国网重庆市电力公司)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 ROG通过检索增强的大语言模型推理,解决复杂一阶查询中的投影、交集、并集和否定问题,提升知识图谱推理的鲁棒性和准确性。
一种用于高效大语言模型推理的状态转换框架
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; Alibaba International Digital Commerce(阿里巴巴国际数字商务) ; Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),文化和旅游部,中国) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出了一种基于状态转换的高效推理框架,通过线性注意力机制和状态策略提升大语言模型的推理效率和性能。
Comments ICLR 2026
RGBX-R1: 多视觉模态链式推理引导的多模态接地强化学习
机构 * School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) ; Low-Altitude Intelligence Lab, Xiong’an National Innovation Center(雄安国家创新中心低空智能实验室) ; Xiong’an Guochuang Lantian Technology Co., Ltd.(雄安国创莲田科技有限公司) ; College of Electronic Science and Technology, National University of Defense Technology(国防科技大学电子科学学院)
专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)
AI总结 RGBX-R1通过视觉模态链式推理引导的强化学习提升多模态接地能力,首次构建RGBX-接地基准并在多个任务中取得显著优势。
超越输出批评:通过任务蒸馏实现自我纠正
机构 * AI Center, University College London(伦敦大学学院人工智能中心) ; Microsoft(微软)
专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 SELF-THOUGHT通过任务蒸馏引入任务抽象步骤,提升大型和小型语言模型的自我纠正能力,提高准确性和鲁棒性。
熵引导的数据高效训练用于多模态推理奖励模型
机构 * School of Software, Tsinghua University(清华大学软件学院) ; AMAP, Alibaba Group(阿里巴巴集团AMAP)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出熵引导训练方法,通过熵指导数据筛选和训练策略提升多模态推理奖励模型的性能。
适应性能力分解用于解锁大型推理模型有效强化学习
机构 * Renmin University of China(中国人民大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出A$^2$D方法,通过分解复杂问题提升RLVR效果,适用于多种强化学习算法。
Comments 21 pages, Working in progress
推理大语言模型能否增强临床文档分类?
机构 * College of Science and Engineering, James Cook University(科学与工程学院,詹姆斯库克大学) ; School of Computing, Macquarie University(计算学院,麦考瑞大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文研究推理大语言模型在临床文档分类中的性能,发现其在准确率上优于非推理模型,但一致性较低,建议采用混合方法提升临床编码效率。
Comments 27 pages
Journal ref Health and Technology (2026): 1-14
D-CORE:激励大型推理模型在复杂工具使用中的任务分解
机构 * Alibaba Cloud Computing, Alibaba Group(阿里巴巴云 computing,阿里巴巴集团)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 D-CORE通过两阶段训练框架提升大型推理模型在复杂工具使用中的任务分解能力,实验显示其在多个基准上优于现有方法。
通过代理强化学习在NetGPT中实现通信激励的协作推理
机构 * IEEE
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG
AI总结 本文提出NetGPT框架,通过代理强化学习实现AI原生xG网络的协作推理与自适应优化。
Self-Guard:通过增强的自我反思防御大型推理模型
机构 * National University of Singapore(新加坡国立大学) ; Southern University of Science and Technology(南方科技大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanyang Technological University(南洋理工大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 Self-Guard通过增强的自我反思机制,有效解决大型推理模型的安全合规问题,实现安全与实用性的平衡。
通过强化学习蒸馏LLM的推理能力:RLKD
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Huawei Inc.(华为公司)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 RLKD通过强化学习和生成结构奖励模型,有效蒸馏LLM的多分支推理结构,提升学生模型的推理能力。
Comments 15 pages
智能推理提示:AI信息在复杂决策中的作用框架与案例研究
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Pomona College(普莫纳学院) ; University of Pittsburgh(匹兹堡大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出智能推理提示框架,通过临床决策案例研究,探讨AI信息在复杂决策中的作用及设计优化策略。
Comments Accepted at CHI 2026
从认知到精准执行:一种通用的自我校正与终止框架用于VLA模型
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) ; Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司,深圳,中国)
专题命中 复杂问题求解 :self-correction(title);reasoning(abstract)
AI总结 本文提出VLA-SCT框架,通过自我校正和终止机制提升VLA模型在抓取任务中的精度和鲁棒性,提高复杂环境下的执行可靠性。
Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)
DR$^2$Seg: 分解式两阶段 rollout 用于多模态大语言模型中的高效推理分割
机构 * School of Computer, National University of Defense Technology, Changsha, China(计算机学院,国防科技大学,中国长沙)
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 DR$^2$Seg通过分解式两阶段rollout策略提升多模态大语言模型中的推理效率和分割准确性。
SRVAU-R1: 通过反射感知学习增强视频异常理解
机构 * The University of Iowa(艾奥瓦大学) ; Knox College(克诺克斯学院)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)
AI总结 SRVAU-R1通过引入反射感知学习框架,提升视频异常理解的推理能力和准确性。
PPoGA: 基于图的预测计划与动作的知识图谱问答
机构 * MODULABS
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI
AI总结 PPoGA通过引入规划器-执行器架构和预测处理机制,提升知识图谱问答的鲁棒性和灵活性,实现状态-of-the-art性能。
CrossCheck-Bench:多模态冲突解决中的组成性故障诊断
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 CrossCheck-Bench通过多阶段注释流程构建的基准测试,揭示了多模态模型在处理跨模态冲突时的瓶颈,并表明融合符号推理与视觉处理的方法能提升模型的稳健性。
Comments Accepted by AAAI 2026
Omni-Judge: 能否将 Omni-LLMs 用作文本条件音频视频生成的人类对齐裁判?
机构 * University of Rochester(罗切斯特大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)
AI总结 Omni-Judge 评估 Omni-LLMs 是否能作为文本条件音频视频生成的人类对齐裁判,展现其在多模态评估中的潜力与局限。
通过指令-策略共演进行代理策略优化
机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) ; Machine Learning Research Group, University of Oxford(牛津大学机器学习研究组)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 INSPO通过指令与策略的共演机制,动态优化指令以提升代理在多轮检索和推理任务中的性能,显著优于静态指令基线。
Comments 8 pages, 4 figures, 1 table (17 pages including references and appendices)
混合线性-全注意力的可证明表达性层级
机构 * Taylor Lab, Huawei(华为泰勒实验室) ; Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉研究关键实验室) ; Shanghai University of Finance and Economics(上海财经大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文通过理论分析,揭示了混合注意力与全注意力在表达能力上的差异,证明了混合注意力在解决多步推理任务时的局限性。
利用元工具优化代理工作流
机构 * EPFL, Switzerland(瑞士联邦理工学院)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出AWO框架,通过识别并优化重复的工具执行模式,减少LLM调用次数并提高代理工作流的成功率。
Auto-Comp: 一种用于可扩展组合探测对比视觉-语言模型的自动化流水线
机构 * Politecnico di Milano(米兰理工学院) ; The University of Tokyo(东京大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 Auto-Comp通过自动化生成可扩展基准,揭示了对比视觉-语言模型在组合推理中的普遍缺陷及视觉-语言上下文的权衡问题。
面向代理AI安全的人类社会启发方法:4C框架
机构 * University of New South Wales, Sydney(新南威尔士大学悉尼分校)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出4C框架,通过人类社会治理理念,为代理AI安全提供多维度保护,强调行为完整性和意图,构建可信可控的AI系统。
Comments 10 pages
你只需一次转发:一种高效的组合判断范式
机构 * School of Science, Harbin Institute of Technology, Shenzhen, Guangdong Province, China(哈尔滨工业大学深圳校区科学学院) ; Accio, Alibaba Group, Hangzhou, Zhejiang Province, China(阿里集团杭州Accio)
专题命中 复杂问题求解 :CoT(abstract);分类 cs.AI
AI总结 YOFO通过单次前向传递高效判断多模态大语言模型的结构化要求,实现速度与可解释性的平衡,同时支持依赖分析和事后CoT。
在视频多模态大语言模型中学习对抗组合性幻觉
机构 * Sun Yat-sen University(中山大学) ; Huaqiao University(华侨大学) ; Shenzhen University(深圳大学) ; Guangming Laboratory(光明实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 针对视频多模态大语言模型中的组合性幻觉问题,提出TriCD框架,通过对比解码和三路径校准机制提升模型在对抗幻觉时的准确率。
LongCat-Flash-Thinking-2601 技术报告
机构 * Meituan LongCat Team(美团LongCat团队)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 LongCat-Flash-Thinking-2601是一款拥有5600亿参数的开源混合专家推理模型,通过统一训练框架和Heavy Thinking模式,在代理推理任务中表现出卓越的性能和鲁棒性。