Thinking Fast and Laterally: Multi-Agentic Approach for Reasoning about Uncertain Emerging Events
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
Comments Presented in The 1st Workshop on System-2 Reasoning at Scale (NeurIPS 2024), Vancouver, Canada
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
Comments Presented in The 1st Workshop on System-2 Reasoning at Scale (NeurIPS 2024), Vancouver, Canada
专题命中 复杂问题求解 :planning(title,abstract);分类 cs.LG;reasoning(comments)
Comments Accepted at the Generative Modeling and Model-Based Reasoning for Robotics and AI workshop at ICML 2019. Presented on June 14th 2019. See https://sites.google.com/view/mbrl-icml2019
Journal ref https://sites.google.com/view/mbrl-icml2019
MoT:用于有效代码生成的思维模块化提示
专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 研究针对大语言模型代码生成中现有提示技术不足,提出MoT技术,利用模块化原则分解问题,用MLR图构建推理过程,经实验对比六种基线技术,在八个基准上显著提升代码生成性能,Pass@1分数达58.1%至95.1%。
解读点之间的信息:解码跨填充令牌的隐藏计算
机构 * Harvard University(哈佛大学) ; Cambridge Boston Alignment Initiative(剑桥波士顿对齐计划) ; Massachusetts Institute of Technology(麻省理工学院) ; Anthropic
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究前沿语言模型对无内容填充令牌的隐藏计算,通过分析两个前沿模型在四个任务家族中的表现,介绍无监督解码管道,能从隐藏状态恢复中间值,证明隐藏计算可从残差流读取。
Comments Accepted to ICML 2026 Mech Interp Workshop, 10 main paper pages, 20 appendix pages
PestVL-Net: 通过细粒度视觉-语言交互实现多模态害虫学习
机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) ; University of Science and Technology of China(中国科学技术大学) ; Zhongke Hefei Institute of Technology Innovation Engineering(中科合肥技术创新工程研究院)
专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出PestVL-Net框架,结合视觉与语言模型,解决细粒度害虫识别难题,通过RWKV架构和多模态大语言模型实现高效害虫学习。
Comments 10 pages, 7 figures
briefly, Then Decide: 通过累积熵调节缓解LLM过度思考
机构 * Tongji University(同济大学) ; Hong Kong Polytechnic University(香港理工大学) ; Shanghai University of Electric and Power(上海电力大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出TECA指标和
Comments Code: https://github.com/AusertDream/CumulativeEntropyRegulation
LLM概率集中:对齐如何缩小生成范围
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现对齐微调通过减少生成多样性,使LLM生成更一致,从而影响复杂推理稳定性。
Comments Codebase: https://github.com/yangalan123/LLMBranchingFactor. V3: Significantly rewrite the whole paper for a clearer structure. Correct problems in the theory parts (Remove emphasis on AEP, discussions on variable LLM generation lengths) and strengthen asymptotic analysis. Add Qwen and OLMo2 experiments. Preliminary SFT v.s. RL comparison to better understand the alignment effects on BF
一种具有视觉提示的视觉-语言-动作模型用于越野自动驾驶
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
AI总结 本文提出OFF-EMMA模型,通过视觉提示和COT-SC策略提升越野自动驾驶轨迹规划的准确性和鲁棒性。
机构 * FAIR at Meta(Meta 公司)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 10 pages, 13 tables, 14 figures
机构 * National Taiwan University(国立台湾大学) ; Apple(苹果公司)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Walmart Global Tech(沃尔玛全球科技)
专题命中 复杂问题求解 :chain-of-thought(abstract,comments);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments Keywords: text-to-SQL LLM, fine-tuning, meta-aware leanring, metadata, chain-of-thought, BigQuery SQL, business database
超越基于大语言模型的推理:用于智能体故障归因的轻量级图神经网络
机构 * University of Illinois(伊利诺伊大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究针对多智能体系统故障归因任务,提出轻量级图框架AFANet,其参数少、推理成本低,在域内基准上性能匹配或优于LLM基线,分布外基准可经低成本自适应提升,证明轻量级结构化方法可实现优异故障归因效果。
ClosureBench:面向组合图推理的构造式基准
机构 * AIM Research Lab(AIM研究实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG
AI总结 本研究推出ClosureBench基准,评估不同规模模型在组合图推理任务的表现,发现模型存在记忆效应、组合推理瓶颈,微调输出程序的模型可提升性能。
Comments 30 pages, 5 figures, 11 tables. Code and data: https://github.com/egolabs-ai/closurebench
事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架
机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) ; Tianjin University(天津大学) ; Institute of Computing and Intelligence(计算与智能研究所) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) ; Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) ; School of Future Technology(未来技术学院) ; Shanghai University(上海大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。
TDD-Agent:用于代码生成的测试驱动推理
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。
生成式上下文与受控状态:可问责纵向临床推理的功能条件
机构 * MyndwareMed(迈恩德韦尔医疗)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文区分生成式上下文与受控状态,定义可问责临床AI的审计标准与信息要求,提出六级成熟度框架,将当前LLM临床实践定位于高能力低成熟度,为可问责临床AI提供概念与审计工具。
SheetCompass:面向智能体电子表格推理的分层关系图
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 针对LLM处理电子表格时丢失多维结构语义的问题,提出SheetCompass框架,通过显式建模表内外结构关系并结合内存机制,提升智能体对复杂工作簿的推理能力。
Intern-S2-Mobius:知识与推理解耦的基础模型
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究提出知识与推理解耦的Mobius-v0架构,基于此构建的7B模型和Intern-S2-Mobius模型,分别在减少训练数据和提升推理速度的同时保持了相近的下游任务性能。
局部验证无法检测不可迁移性:智能体推理中上下文保持的上同调理论
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出智能体推理上下文保持的上同调理论,证明局部验证无法检测不可迁移性,提出Ksetra方法并通过外汇市场验证了所提检验的有效性。
Comments 17 pages, 10 figures. Includes an exact F-test for non-transportability with verified size and power, its precision-whitened generalisation, and a foreign-exchange case where the null hypothesis is known analytically rather than estimated
CastFSR:用于上下文感知时间序列预测的快慢反思智能体推理框架
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出CastFSR智能体框架,将上下文感知时间序列预测建模为快慢反思工作流,通过实验证明其在公共数据集上的表现优于代表性基线。
LaViT:对齐潜在视觉思维以进行多模态推理
机构 * City University of Hong Kong(香港城市大学) ; University of Science and Technology of China(中国科学技术大学) ; Utrecht University(乌特勒支大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 LaViT通过对齐潜在视觉思维提升多模态推理能力,实现视觉感知增强和模型性能突破。
REIN:通过反思与弃权对齐缩小推理与可靠性之间的差距
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 REIN是一个对齐框架,通过训练大型推理模型生成结构化推理序列,引入奖励机制鼓励模型在无正确推理链时弃权,在单次前向传播中减少幻觉、提升选择性准确率并保持高覆盖率。
Comments 26 pages and 22 figures
ViSR-KGC:结合视觉语言模型的视觉子图推理用于多模态知识图谱补全
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; CITIC Securities(中信证券) ; School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 针对多模态知识图谱补全的痛点,提出ViSR-KGC方法,结合表示学习、视觉语言模型与预训练常识,通过提取查询感知子图并转换为可视化内容辅助VLM推理缺失实体。
ReflectRL:通过反思到直接推理从优质负轨迹中学习
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 ReflectRL是一种轻量即插即用框架,将专家失败的优质负轨迹作为反思对象而非丢弃,经反思推理与策略转换,在多基准、多模型及多训练方法上以极小开销提升大语言模型推理性能。
Comments Project page: https://github.com/bibisbar/ReflectRL
共享前缀,更优信用:面向多智能体推理的自适应路由
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究针对现有多智能体推理自适应路由方法的粗粒度监督缺陷,提出TreeCredit共享前缀信用分配框架,通过状态匹配下游比较估计算子效用,在六个推理基准上实现了准确率与推理成本的更优权衡。
HyperGuide: 用于大型语言模型高效多步推理的双曲引导
机构 * Department of Computer Science(计算机科学系) ; Stony Brook University(石英布鲁克大学) ; Department of Applied Mathematics and Statistics(应用数学与统计学系) ; Yale University(耶鲁大学) ; Department of Data Science(数据科学系) ; New Jersey Institute of Technology(新泽西理工学院) ; Department of Biomedical Informatics(生物医学信息学系)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 针对多步推理中单次生成效率高但精度低、树搜索计算量大的问题,提出通过将推理进度蒸馏为双曲几何信号来引导逐步生成,利用双曲空间的距离和角度特性编码解接近度与分支区分,训练轻量头投影隐状态并微调适配器,在多个基准上取得一致提升。
学习标量奖励模型的端到端潜在推理轨迹
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。
机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) ; University of Science and Technology of China(中国科学技术大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
Journal ref Proceedings of the ACM Web Conference 2026, pp. 5568-5578
SEGRA:用于基于Gremlin的问答的结构化经验引导图推理代理
机构 * University of British Columbia(英属哥伦比亚大学) ; Amazon(亚马逊)
专题命中 复杂问题求解 :reasoning(title);chain-of-thought(abstract);分类 cs.AI
AI总结 针对企业文本到Gremlin问答难题,SEGRA引入经验引导代理,集成多种技术,包括意图路由、查询生成等。在企业IT支持基准测试中成绩出色,平均评判分数大幅提高,技能库还降低了成本,提升了企业图问答的准确性与效率。
哪些模型在继承推理中表现更好?
机构 * Paris Dauphine University(巴黎多芬纳大学) ; University of Abou Bekr Belkaïd(阿布·贝克尔·贝尔卡伊德大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 本文比较了商业和开源大语言模型在伊斯兰继承推理任务中的表现,发现商业模型在识别继承人、应用排除规则和保持推理一致性方面更优,其中Gemini 2.5 Flash表现最佳。