Virtual Force-Based Routing of Modular Agents on a Graph
基于虚拟力的模块化代理在图上的路由
专题命中 规划推理 :planning(abstract)
AI总结 本文提出了一种基于虚拟力的模块化代理路由算法,通过平衡路径最优性和模块连接成本效益,实现多目标节点的高效访问。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
基于虚拟力的模块化代理在图上的路由
专题命中 规划推理 :planning(abstract)
AI总结 本文提出了一种基于虚拟力的模块化代理路由算法,通过平衡路径最优性和模块连接成本效益,实现多目标节点的高效访问。
Hydra-Nav: 通过自适应双过程推理实现物体导航
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Peking University(北京大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)
AI总结 Hydra-Nav通过自适应双过程推理提升物体导航效率,实现高效探索与决策。
GeoGramBench: 评估现代大语言模型中的几何程序推理
机构 * Li Auto Inc.(利亚特公司)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 GeoGramBench通过评估现代大语言模型在几何程序推理中的能力,揭示了其在空间推理任务中的显著不足。
Comments Accepted to ICLR 2026
NavDreamer: 视频模型作为零样本三维导航器
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 NavDreamer利用视频模型实现零样本三维导航,通过生成视频模型作为语言指令与导航轨迹的接口,结合时空信息和物理动态,实现强大泛化能力。
Comments Work in the progress. 22 pages, 15 figures
AutoFly:面向野外无人机自主导航的视觉-语言-动作模型
机构 * Southeast University(东南大学) ; Purple Mountain Labs(紫金山实验室) ; The Chinese University of Hong Kong(香港中文大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)
AI总结 AutoFly是一种面向野外无人机自主导航的视觉-语言-动作模型,通过伪深度编码器和渐进两阶段训练策略,实现自主避障和规划,提升导航成功率。
Comments Acceped by ICLR 2026
GenSeg-R1: 通过强化学习驱动的视觉-语言接地进行细粒度指称分割
机构 * Camcom Technologies Pvt. Ltd.(Camcom技术有限公司)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 GenSeg-R1 通过强化学习驱动的视觉-语言接地方法,在细粒度指称分割任务中实现了优于基线的性能。
Free(): 学会遗忘的仅malloc推理模型
机构 * Tencent AI Lab(腾讯AI实验室) ; Nanyang Technological University(南洋理工大学)
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI
AI总结 Free()LM通过引入内在自我遗忘机制,解决推理模型中过多思考标记导致性能下降的问题,实现模型在不同规模上的性能提升,并在长周期任务中恢复性能。
Where-to-Unmask: 基于真实情况引导的去掩码顺序学习用于掩码扩散语言模型
机构 * The University of Tokyo, Tokyo, Japan(东京大学)
专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 本文提出Gt-Margin方法,通过真实标记计算去掩码顺序,提升MDLM在逻辑推理任务中的生成质量。
Comments 15 pages, 6 figures
突破预采样障碍:基于激活的难度感知自一致性
机构 * Konkuk University(韩国康克大学)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 ACTSC通过利用神经元激活信号构建轻量级难度估计探针,无需额外调用或预采样,有效降低推理成本并保持准确性。
面向推理的提示优化以对齐黑盒大语言模型
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出IAPO框架,通过联合优化提示和推理规模,提升黑盒大语言模型对齐效果。
Comments Accepted to AAAI 2026. Extended 17-page version
AnalyticsGPT: 一个基于大语言模型的科学度量问答工作流
机构 * Elsevier B.V.(埃塞尔弗斯有限公司)
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL
AI总结 AnalyticsGPT通过LLM实现科学度量问答,结合检索增强生成和代理概念,提升科学数据分析效率。
Cochain: 在LLM代理工作流中平衡不足与过度的合作
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) ; School of Urban Planning and Design, Peking University(北京大学城市规划与设计学院)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 Cochain通过整合知识图谱和提示树,有效解决业务工作流中LLM代理合作问题,优于基线模型。
Comments 35 pages, 23 figures
视频扩散器中的因果性可与去噪分离
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Adobe Research(Adobe研究院) ; Morpheus AI(Morpheus人工智能)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出可分离因果扩散模型,通过分离时间推理与多步去噪过程,提升视频生成效率并保持生成质量。
结构化事件记忆
机构 * Southeast University(东南大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; Alibaba Group(阿里巴巴集团)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 SEEM通过结构化事件记忆框架提升自主代理的叙述连贯性和逻辑一致性。
通过逐步经验回忆实现大语言模型的自引导函数调用
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) ; Nanjing University of Information Science & Technology(南京信息工程大学) ; Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院)
专题命中 复杂问题求解 :planning(abstract);分类 cs.CL
AI总结 SEER通过逐步经验回忆方法,提升大语言模型在多步骤工具使用中的准确性和效率。
Comments Accepted to EMNLP 2025
与潜在空间对话——如何将你的大语言模型转化为天文学家
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 通过融合潜在物理特征与语言模型,将大语言模型转化为可解释的科学推理工具,实现对天文学等领域的有效推理与任务执行。
为检索而思考:通过分解与解释增强查询理解
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 ReDI通过分解与解释增强查询理解,有效提升长形式复杂查询的检索性能。
评估RAG系统中的社会偏见:当外部上下文有助于而推理有害
机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
AI总结 本研究评估RAG系统中的社会偏见,发现外部上下文可减少偏见,但链式思维提示反而增加偏见,凸显了需要偏见意识推理框架的重要性。
Comments Accepted as a full paper with an oral presentation at the 30th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD 2026)
Optimus-3: 具有双粒度推理感知策略优化的双路由对齐专家混合代理
机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(计算机科学与技术学院,哈尔滨工业大学(深圳校区)) ; Pengcheng Laboratory(鹏城实验室) ; School of Information Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(信息科学与技术学院,哈尔滨工业大学(深圳校区)) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 Optimus-3通过双路由对齐专家混合架构和双粒度推理感知策略优化,实现了系统1与系统2的协同,提升了开放性任务的解决能力。
Comments 16 pages, 12 figures
量子审计:评估大语言模型在量子计算上的推理极限
机构 * Fordham University(福特汉姆大学) ; University of Michigan-Dearborn(密歇根大学-迪尔本分校) ; Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 Quantum-Audit通过2700个问题评估大语言模型在量子计算概念理解上的推理能力,发现顶级模型在专家问题上表现不如LLM生成问题,且在高级主题上准确率显著下降。
Comments 18 pages
PAN 2026概览:Voight-Kampff生成式AI检测、文本水印、多作者写作风格分析、生成式抄袭检测及推理轨迹检测
机构 * Friedrich Schiller University Jena(耶纳弗里德里希·施勒格尔大学) ; University of Applied Sciences BFI(应用科学大学BFI) ; Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学) ; University of Kassel(卡塞尔大学) ; INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) ; University of Innsbruck(因斯布鲁克大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 PAN 2026旨在通过客观评估推进计算风格学和文本取证,涵盖生成式AI检测、文本水印、多作者写作分析、抄袭检测及推理轨迹检测等五个新旧任务。
改进大型语言模型中的数据与奖励设计以提升科学推理能力
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出Dr. SCI数据集和后训练流程,通过探索扩展SFT、动态难度课程和SciRubric引导RL提升大型语言模型的科学推理能力。
Text2SQL-Flow:一种鲁棒的SQL感知数据增强框架用于文本到SQL
机构 * Peking University, Beijing, China(北京大学,北京,中国)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 Text2SQL-Flow提出了一种SQL感知的数据增强框架,通过生成高质量的文本到SQL数据集,提升大型语言模型在问题解决和检索任务中的性能。
RoboInter: 一种面向机器人操控的综合中间表示套件
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Beihang University(北航) ; Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 推理评测 :reasoning(abstract);planning(abstract)
AI总结 RoboInter通过统一的中间表示套件,提升机器人操控中视觉-语言-动作系统的泛化能力和推理能力。
Comments Published to ICLR 2026, 69 pages, 40 figures
VLM-UQBench:一种用于视觉语言模型中模态特定和跨模态不确定性的基准
机构 * Boston University(波士顿大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)
AI总结 VLM-UQBench通过评估不同UQ方法在模态特定和跨模态不确定性上的表现,揭示了现有方法在细粒度不确定性检测上的不足。
MEVER:基于图的证据检索的多模态和可解释性声明验证
机构 * University of Sheffield(谢菲尔德大学) ; University of Science and Technology Beijing(北京科技大学) ; University of California San Diego(加州大学圣地亚哥分校) ; The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 MEVER通过多模态图检索和解释生成,实现了准确且可解释的声明验证,同时创建了AI领域的科学数据集AIChartClaim。
Comments Accepted to EACL-26
SCORE:特定性、上下文利用、鲁棒性与相关性用于无参考LLM评估
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Argonne National Laboratory(阿贡国家实验室) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 推理评测 :planning(abstract);分类 cs.CL
AI总结 本文提出了一种无参考评估框架,用于评估LLM在高风险领域任务中的特定性、鲁棒性、相关性和上下文利用,通过精心编纂的数据集和人工评估验证了多指标评估的必要性。
TraceMem: 从用户对话轨迹编织叙事记忆图式
机构 * The University of Hong Kong(香港大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Nankai University(南开大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 TraceMem通过三阶段流程从用户对话轨迹中编织叙事记忆图式,提升多跳和时间推理能力。
FM SO.P: 一种具有自动评估的渐进式任务混合框架用于跨域SOP理解
机构 * Amazon(亚马逊) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 FM SO.P提出了一种渐进式任务混合框架和自动评估系统,以提升跨领域SOP理解的准确性和泛化能力。
Puda:用户主权与隐私保护的个性化AI用户数据代理
机构 * Research Institute of Advanced Technology, SoftBank Corp.(软银公司先进科技研究所) ; Turnt Up Technologies, Inc.(Turnt Up技术公司) ; TechArts Co., Ltd.(TechArts公司) ; Acutus Software, Inc.(Acutus软件公司)
专题命中 推理评测 :planning(abstract);分类 cs.AI
AI总结 Puda通过用户主权架构实现多粒度数据管理,平衡隐私保护与个性化AI的使用需求。
Comments 9 pages, 5 figures