HieraMAS: Optimizing Intra-Node LLM Mixtures and Inter-Node Topology for Multi-Agent Systems
HieraMAS: 优化多智能体系统内的节点LLM混合与节点间拓扑
专题命中 规划推理 :reasoning(abstract)
AI总结 HieraMAS通过分层协作框架结合节点内LLM混合与节点间拓扑优化,提升多智能体系统性能与成本效率。
Comments 22 pages, 13 tables
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
HieraMAS: 优化多智能体系统内的节点LLM混合与节点间拓扑
专题命中 规划推理 :reasoning(abstract)
AI总结 HieraMAS通过分层协作框架结合节点内LLM混合与节点间拓扑优化,提升多智能体系统性能与成本效率。
Comments 22 pages, 13 tables
DeLTa: 人机交互与语言引导的新透明物体操控演示
机构 * KAIST(韩国科学技术院) ; NVIDIA(英伟达) ; KIMM(韩国智能媒体实验室)
专题命中 规划推理 :planning(abstract)
AI总结 DeLTa通过整合深度估计、6D姿态估计和视觉-语言规划,实现基于自然语言指令的精确长周期透明物体操控,无需额外训练或类别先验。
Comments Project page: https://sites.google.com/view/DeLTa25/
基于LLM辅助推理的上下文感知2D绘图注释到3D CAD特征映射
机构 * Singapore Institute of Manufacturing Technology (SIMTech), A*STAR, Singapore(新加坡制造技术研究所) ; Advanced Remanufacturing and Technology Centre (ARTC), A*STAR, Singapore(先进再制造与技术中心) ; School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 本文提出一种基于LLM辅助推理的上下文感知框架,实现2D绘图注释到3D CAD特征的映射,提升制造自动化精度和可靠性。
动作推理:利用LLM进行三维空间中的机器人动作推理以实现积木堆叠
机构 * CV4DT, CSIC, Department of Engineering, University of Cambridge(CV4DT、CSIC、工程系、剑桥大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出ActionReasoning框架,利用LLM进行三维空间中的动作推理,实现稳定积木堆叠,提升机器人操作的泛化能力。
Comments 8 pages, 5 figures, accepted by the 2026 IEEE International Conference on Robotics and Automation
保持符号投影布局:用于视觉-语言模型中以物体为中心的空间推理的符号投影布局
机构 * Kyung Hee University(庆熙大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 SymPL通过将以物体为中心的空间推理转化为符号布局形式,提升视觉-语言模型在多视角场景下的推理性能和鲁棒性。
GOT-Edit:基于几何的通用目标跟踪 via 在线模型编辑
机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系) ; Academia Sinica(学术院) ; Microsoft AI(微软人工智能)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 GOT-Edit通过在线模型编辑整合几何感知线索,提升通用目标跟踪在遮挡和杂乱环境中的鲁棒性和准确性。
Comments ICLR 2026
Sim2Radar:通过VLM引导的场景重建弥合雷达仿真到现实的差距
机构 * Columbia University(哥伦比亚大学) ; University of California, Merced(加州大学默塞德分校)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 Sim2Radar通过VLM引导的场景重建,利用合成数据提升雷达感知性能,实现3D AP提升3.7个百分点。
关于视觉-语言模型在艺术史中的可解释性
机构 * Marburg University(马尔堡大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文研究了XAI方法如何使CLIP在艺术史背景下可视化推理,通过零样本定位实验和人类可解释性研究,探讨了可解释性方法的有效性依赖于类别概念稳定性和表示可用性。
DriveMamba: 以任务为中心的可扩展状态空间模型用于高效端到端自动驾驶
机构 * Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(计算机学院与人工智能学院,上海交通大学) ; SenseAuto
专题命中 视觉空间推理 :planning(abstract)
AI总结 DriveMamba通过动态任务关系建模、隐式视角对应学习和长期时间融合,提升端到端自动驾驶的效率与可扩展性。
Comments Accepted to ICLR2026
检验和解决大语言模型生成想法中的多样性障碍
机构 * Deng, Brucks, and Toubia(邓, 布鲁克斯和托比亚)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文研究了LLM生成想法的多样性问题,通过四种研究发现,通过链式推理提示和普通人物提示可分别减少固定现象和改善知识分区,从而提升想法多样性。
Actor-Curator: 通过策略改进带状机为RL后训练实现联合适应课程学习
机构 * University of Illinois Chicago(伊利诺伊大学香槟分校) ; Caltech(加州理工学院) ; RPI(罗切斯特理工学院) ; MBZUAI(澳门大学人工智能研究院) ; University of Chicago(芝加哥大学) ; NEC Laboratories America(NEC美国实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ACTOR-CURATOR通过策略改进带状机实现RL后训练的联合适应课程学习,有效提升训练稳定性和效率。
Comments 37 pages, 8 figures, 1 table. Preprint under review. Equal contribution by first two authors
并非万能一种:用于缓解幻觉的QueryBandits
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 QueryBandits通过在线学习优化查询重写策略,有效缓解闭源模型中的幻觉问题,优于传统静态策略。
递归自聚合解锁大语言模型的深度思考
机构 * Mila – Québec AI Institute(魁北克AI研究所) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; LawZero(法零) ; LLNL(劳伦斯利弗莫尔国家实验室) ; University of Edinburgh(爱丁堡大学) ; CIFAR AI Chair(CIFAR人工智能 chair) ; CIFAR Fellow
专题命中 测试时计算 :reasoning(abstract);分类 cs.LG
AI总结 递归自聚合通过结合并行与顺序缩放方法,提升大语言模型的推理能力,实验证明其在多个任务中优于传统方法。
Comments 23 pages, 10 figures. Project page: https://rsa-llm.github.io/
基于代码图的未见代码库数据合成与训练
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出UCD-Training框架,通过代码图构建和两阶段训练,提升模型对未见代码库的推理能力和数据合成效果。
RHYTHM:基于层次时间标记的人类移动推理
机构 * Northeastern University(东北大学) ; Northwestern University(西北大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 RHYTHM通过层次时间标记框架提升人类移动预测的准确性和效率,实现更高效的时空推理与预测。
Comments Advances in Neural Information Processing Systems 39 (NeurIPS) 2025
潜在思维优化:你的潜在推理语言模型秘密在潜在思维中编码了奖励信号
机构 * Department of Computer Science and Engineering, The Ohio State University, USA(计算机科学与工程系,俄亥俄州立大学) ; Department of Biomedical Informatics, The Ohio State University, USA(生物医学信息学系,俄亥俄州立大学) ; Translational Data Analytics Institute, The Ohio State University, USA(转化数据分析研究所,俄亥俄州立大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出LTO方法,通过潜在奖励模型优化LLMs的潜在推理过程,提升推理效率与准确性。
OCR-Agent: 具有能力和记忆反思的代理OCR
机构 * Southwest Minzu University(西南民族大学) ; AI Geeks
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract)
AI总结 OCR-Agent通过能力反思和记忆反思机制,提升VLMs的推理鲁棒性,实现更稳定的答案质量改进。
受通信启发的结构化图像表示分词
机构 * Computer Vision Group, University of Bern, Switzerland(伯恩大学计算机视觉组) ; VITA Lab, EPFL, Switzerland(苏黎世联邦理工学院VITA实验室)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 COMiT通过受通信启发的分词框架,学习结构化离散视觉分词序列,提升图像重建和语义理解能力。
Comments Project website: https://araachie.github.io/comit/
GLM-5:从振动编码到代理工程
机构 * GLM-5 Team(GLM-5团队) ; Zhipu AI(智谱AI) ; Tsinghua University(清华大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 GLM-5通过异步强化学习和DSA技术实现高效训练与推理,展现卓越的软件工程能力。
XMorph: 通过LLM辅助混合深度智能进行可解释性脑肿瘤分析
机构 * Department of Computer Science, Georgia State University(计算机科学系,佐治亚州立大学) ; TReNDS Center, Georgia State University(TReNDS中心,佐治亚州立大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 XMorph通过结合LLM和混合深度智能,实现了对脑肿瘤的高效可解释分类,准确率达96.0%。
Comments Accepted in ICCABS 2026: The 14th International Conference on Computational Advances in Bio and Medical Sciences
HELP: 图形节点扩展与逻辑路径引导的证据定位用于准确且高效的图RAG
机构 * Shanghai Jiao Tong University, China(上海交通大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 HELP通过HyperNode扩展和逻辑路径引导的证据定位策略,提升图RAG在准确性和效率之间的平衡,实现高效且准确的知识检索。
ID-LoRA: 基于矩阵插值分解的高效低秩适应
机构 * Tianjin University(天津大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 ID-LoRA通过基于矩阵插值分解的低秩适应方法,在减少可训练参数的同时保持模型容量,优于现有PEFT技术。
通过具身动作 grounding LLMs 在科学发现中
机构 * Tsinghua University, Beijing, China(清华大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 通过具身动作框架,LLMs在科学发现中实现更稳定的物理模拟和更高的建模准确性。
Comments 24 pages, 7 figures, 7 tables. Preprint
MCPShield: 一种用于模型上下文协议代理自适应信任校准的安全认知层
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL
AI总结 MCPShield通过元数据引导探测和历史轨迹推理,提升代理在调用MCP工具时的安全性,有效防御MCP攻击。
Comments 21 pages, 5 figures, 6 tables
SpatiaLQA: 一个评估视觉-语言模型空间逻辑推理能力的基准
机构 * Zhejiang University(浙江大学) ; The University of Sydney(悉尼大学) ; ManyCore ; State Key Laboratory of Blockchain and Security, Zhejiang University(浙江大学区块链与安全国家重点实验室) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.LG
AI总结 SpatiaLQA提出了一种评估视觉-语言模型空间逻辑推理能力的基准,通过递归场景图辅助推理方法提升模型在复杂场景中的推理能力。
Comments Accepted by CVPR 2026
通过结构化相关性图诊断视觉-语言模型中的因果推理
机构 * University of Melbourne(墨尔本大学) ; The University of Western Australia(西澳大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出ViLCaR基准,通过结构化相关性图评估视觉-语言模型的因果推理能力,发现其局限性源于结构指导不足而非推理能力不足。
UDVideoQA: 一个用于城市动态多对象时空推理的交通视频问答数据集
机构 * Arizona State University(亚利桑那州立大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 UDVideoQA是一个用于城市动态多对象时空推理的交通视频问答数据集,通过统一标注流程生成28K问题-答案对,评估视觉定位和因果推理能力。
图表去渲染、推理与修复:基于视觉-语言模型
机构 * Universidad Torcuato Di Tella(托克托迪特拉大学) ; Consejo Nacional de Investigaciones Científicas y Técnicas(国家科学与技术研究理事会) ; Facultad de Ciencias Exactas y Naturales Universidad de Buenos Aires(布宜诺斯艾利斯大学科学与自然学院)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出了一种结合图表去渲染、自动分析和迭代改进的框架,利用视觉-语言模型提供基于原则的可视化设计反馈,提升可视化质量和素养。
空间-DisE:评估视觉语言模型空间推理能力的统一基准
机构 * School of Computer Science & informatics, University of Liverpool(计算机科学与信息学系,利物浦大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出Spatial-DISE基准,用于评估视觉语言模型的空间推理能力,通过四个象限分类和大规模数据集,揭示当前模型在多步骤多视角推理上的不足。
Comments ICLR 2026 Accepted Project Page: https://shinmohuang.github.io/spatialdise_page/
从感知到行动:一个交互式基准测试用于视觉推理
机构 * Singapore University of Technology(新加坡科技设计大学) ; Singapore Management University (SMU), Singapore(新加坡管理学院) ; Nanyang Technological University (NTU), Singapore(南洋理工大学) ; University of Science(科学大学)
专题命中 推理评测 :reasoning(title)
AI总结 CHAIN基准测试通过交互式3D物理驱动环境,评估模型在动态环境中理解、规划和执行基于物理约束的结构化动作序列的能力。
Comments Work in processing. Website: https://social-ai-studio.github.io/CHAIN/