FrugalRAG: Less is More in RL Finetuning for Multi-Hop Question Answering
FrugalRAG: 在多跳问答中少即是多
机构 * Microsoft Research India(微软印度研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 FrugalRAG通过强化学习减少检索步骤,实现多跳问答任务的高效准确权衡。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
FrugalRAG: 在多跳问答中少即是多
机构 * Microsoft Research India(微软印度研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 FrugalRAG通过强化学习减少检索步骤,实现多跳问答任务的高效准确权衡。
行为生成代理在能源运营中的应用
机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院泰勒工程学院) ; Graduate School of Business, Stanford University(斯坦福大学商学院)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出利用生成代理模拟客户决策,揭示能源运营中消费者行为模式,提升能源管理系统设计和政策分析能力。
为拟合物体操纵的物理常识知识而引入分析概念
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出通过引入分析概念,将语义级常识知识接地到物理世界,以提升机器人对关节物体的通用精确操纵能力。
DeepEyes: 通过强化学习激励'图像思考'
机构 * Xiaohongshu Inc.(小红书公司) ; Xi’an Jiaotong University(西安交通大学)
专题命中 数学推理 :reasoning(abstract)
AI总结 DeepEyes通过强化学习实现图像引导的推理,无需预训练数据,提升多模态任务性能。
Comments Accepted by ICLR2026. Ziwei, Michael, Jack, and Chenxiao are equal-contribution. The list order is random
认知模型可以揭示语言模型中的可解释价值权衡
机构 * Kempner Institute for Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) ; Google DeepMind(谷歌DeepMind) ; Department of Psychology, Harvard University(哈佛大学心理学系)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出利用认知模型评估语言模型中的价值权衡,揭示其行为特征变化及对社会行为的影响。
Comments 10 pages, 5 figures
观察者-情境格:一种面向视角感知认知的统一基础
机构 * Computer Science Department, Al-Baha University(阿尔巴大学计算机科学系)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文提出观察者-情境格(OSL),一种统一的数学结构,用于支持面向视角的认知推理,通过两个关键算法实现信念管理和矛盾分解,提升多智能体环境中的推理效率和鲁棒性。
Comments Extended version of the AAMAS 2026 paper with the same title
Journal ref 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026, IFAAMAS, 18 pages
ATLAS:基于人工智能的威胁到断言学习用于片上系统安全验证
机构 * Department of Electrical and Computer Engineering, University of Central Florida(电子与计算机工程系,中央佛罗里达大学) ; Intel Corporation(英特尔公司)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 ATLAS通过结合人工智能和形式验证技术,实现了基于漏洞知识的自动化SoC安全验证,提高了安全设计的可靠性。
Comments Accepted at the 63rd Design Automation Conference (DAC 2026), Long Beach, CA, USA (July, 2026)
代理与架构限制:为何基于优化的系统无法回应规范
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI
AI总结 本文指出基于优化的系统无法回应规范,提出真正的代理性需要不可比较的边界和否定性回应机制,揭示了优化与规范治理的不兼容性及由此引发的收敛危机。
Comments About 10,600 words in all (includes ~1000 words of literature and ~2400 words of Appendices). Under journal review
为伦理执行而 Dial E:作为治理原语的机构 veto 权力
专题命中 代码与定理证明 :reasoning(abstract)
AI总结 本文提出机构 veto 权力作为治理原语,旨在通过正式权威阻止潜在武器化风险,推动模型去武装和伦理执行。
Comments Accepted at the AI for Peace Workshop at ICLR 2026.32 Pages and 2 Figures
Reasoning Core:一个可扩展的程序化数据生成套件,用于符号预训练和后训练
机构 * Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、中央理工大学、UMR 9189 - CRIStAL)
专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL
AI总结 Reasoning Core 提出了一种可扩展的程序化数据生成套件,用于符号预训练和后训练,通过生成多样化的符号推理数据提升语言模型的推理能力。
Comments Keywords: LLMs, NLP, Dataset, Corpus, Procedural Pre-training, Reasoning, Logic, Formal Semantics https://github.com/sileod/reasoning_core
TARSE: 通过检索技能和经验进行测试时适应以实现推理代理
机构 * University of Massachusetts Amherst, MA, USA(马萨诸塞大学阿姆赫斯特分校) ; University of Massachusetts Lowell, MA, USA(马萨诸塞大学洛厄尔分校)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 TARSE通过检索技能和经验实现测试时适应,提升医疗推理代理的可靠性。
推理还是合理化?在事实验证中的掩码扩散模型中合理化的作用
机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 研究发现,掩码扩散模型在事实验证中,早期结论易受合理化过程影响,导致准确性下降。
HardcoreLogic: 用长尾逻辑谜题游戏挑战大型推理模型
机构 * Fudan University(复旦大学) ; University of Southern California(南加州大学) ; Huawei Technologies Ltd(华为技术有限公司) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI
AI总结 HardcoreLogic通过长尾逻辑谜题挑战大型推理模型,揭示其在复杂规则和非标准变体上的局限性。
神经符号技能发现用于条件多级规划
机构 * Department of Computer Science and Technology The University of Cambridge(计算机科学与技术系 剑桥大学) ; Department of Computer Engineering Bogazici University(计算机工程系 boazici大学) ; SISREC Osaka University(Osaka大学SISREC)
专题命中 逻辑推理 :planning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种神经符号学习架构,通过少量演示获取可推广的高级符号技能,并在多级规划中实现复杂任务的执行。
Comments 18 pages, 4 figures
第一人称共驾:面向辅助第一人称AI的网页原生智能眼镜代理
机构 * Shenzhen International Graduate School Tsinghua University Shenzhen China(深圳国际研究生院清华大学深圳中国) ; Independent Researcher London United Kingdom(独立研究者伦敦英国) ; Queen Mary University of London London United Kingdom(女王玛丽大学伦敦英国) ; Imperial College London London United Kingdom(帝国理工学院伦敦英国) ; University Of Surrey Guildford United Kingdom(Surrey大学Guildford英国)
专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 Egocentric Co-Pilot通过网页原生智能眼镜代理实现第一人称AI的持续辅助,结合神经符号框架和多模态意图层,展示了在日常生活中提升可及性和情境感知的实用路径。
Comments 14 pages, 6 figures, WWW 2026
MetaMind: 多智能体系统中通过元理论思维实现通用和认知世界模型
机构 * Department of Electrical(电气工程系) ; Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工学院)
专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 MetaMind通过元理论思维框架,使多智能体系统中的智能体能够自主推理他人目标与信念,实现零样本泛化与自监督学习。
FASA: 基于频率的稀疏注意力
机构 * AMAP, Alibaba Group(阿里巴巴集团AMAP) ; UCSD(加州大学圣迭戈分校) ; UIUC(伊利诺伊大学香槟分校) ; Texas A&M University(德克萨斯农工大学)
专题命中 逻辑推理 :reasoning(abstract);CoT(abstract);分类 cs.CL
AI总结 FASA通过动态预测令牌重要性,实现基于频率块的稀疏注意力机制,在长上下文任务中表现出色,达到接近全缓存性能且显著提升效率。
Comments Accepted by ICLR 2026
评估基于大语言模型的多智能体系统中的理论心和内部信念
机构 * Warsaw University of Technology(华沙技术大学)
专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出一种整合理论心、BDI内部信念和符号求解器的多智能体架构,评估其在资源分配问题中提升协作智能的效果。
Journal ref 17th International Conference on Computational Collective Intelligence (ICCCI 2025)
LAD-RAG:面向视觉丰富文档的布局感知动态RAG
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL
AI总结 LAD-RAG通过构建布局感知的文档图和动态检索机制,提升视觉丰富文档的检索与问答性能。
VITA:通过视觉语言模型的测试时间适应实现零样本价值函数
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 VITA通过测试时间适应提升视觉语言模型的零样本价值估计能力,实现跨任务和环境的泛化,优于现有方法。
Comments International Conference on Learning Representations, 2026
面向客户端开发的生产级AI编码系统
专题命中 逻辑推理 :planning(abstract)
AI总结 本文提出了一种面向客户端开发的生产级AI编码系统,通过结构化多阶段流程整合Figma设计、PRD和领域知识,提升代码生成与产品需求的对齐性。
Comments 18 pages, 2 figures
NeuroSCA:面向智能合约混合模糊测试的神经符号约束抽象
专题命中 逻辑推理 :verifier(abstract)
AI总结 NeuroSCA通过神经符号约束抽象技术,提升智能合约混合模糊测试的效率和效果。
Comments Under Review
基于图的SDN配置代码合成
专题命中 逻辑推理 :verifier(abstract)
AI总结 GraphCue通过拓扑感知检索和约束条件生成,实现了SDN配置代码合成的高通过率和高效验证。
Comments 2 pages, 2 figures
Journal ref IEEE Consumer Communications & Networking Conference 2026
Uni-cot: 向跨文本和视觉的统一链式推理迈进
机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Fudan University(复旦大学) ; Nanyang Technological University(南洋理工大学)
专题命中 规划推理 :CoT(title,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);planning(abstract)
AI总结 Uni-CoT通过统一的链式推理框架实现跨文本和视觉的连贯多模态推理,采用宏级和微级推理范式,提升多模态推理的效率和性能。
Comments Accepted by ICLR 2026, Project Page: https://sais-fuxi.github.io/projects/uni-cot/
ASTRA-bench: 通过个人用户上下文评估工具使用代理的推理与行动规划
机构 * Apple(苹果公司)
专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI
AI总结 ASTRA-bench通过模拟真实用户情境,评估AI代理在复杂个人上下文中进行推理与多步骤计划的能力,揭示当前模型在处理高复杂度任务时的性能瓶颈。
ACPBench Hard: 关于行动、变化和规划的无约束推理
机构 * IBM Research San Jose(IBM桑 Jose 研究所) ; IBM Thomas J. Watson Research Center(IBM 托马斯·J·沃森研究中心)
专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI
AI总结 ACPBench Hard通过开放性问题测试模型在行动、变化和规划上的推理能力,发现现有模型在复杂任务上表现有限。
Comments Accepted at Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), see https://openreview.net/forum?id=WIXohR7mEo
ACPBench: 关于行动、变化和规划的推理
专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI
AI总结 ACPBench是一个用于评估规划领域推理能力的基准,包含7个推理任务和13个规划领域,评估了多种LLM和推理模型的性能差异。
Comments In Proceedings of the AAAI Conference on Artificial Intelligence (AAAI 2025)
ClinCoT:面向医学视觉语言模型的临床感知视觉推理链
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; East China Normal University(东华大学)
专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI
AI总结 ClinCoT通过引入临床感知的视觉推理链框架,提升医学视觉语言模型在临床决策中的事实性支撑与多模态推理能力。
SwiReasoning: 在潜在空间和显式空间中切换以实现帕累托更优推理的LLM
专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 SwiReasoning通过在潜在空间和显式空间之间切换,提升推理LLMs的准确率和令牌效率。
Comments ICLR 2026. Code: https://github.com/sdc17/SwiReasoning, Website: https://swireasoning.github.io/
MC-Search:基于结构化长推理链评估和增强多模态代理搜索
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta ; IBM Research(IBM研究院) ; Stony Brook University(石溪大学)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 MC-Search是首个针对代理MM-RAG的基准,通过结构化长推理链评估和增强多模态代理搜索,揭示了系统性问题并改进了模型的规划和检索能力。
Comments ICLR 2026