Structure-Augmented Reasoning Generation
结构增强的推理生成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视觉推理 :grounding(abstract)
AI总结 结构增强的推理生成通过显式推理结构提升多跳查询的准确性和连贯性,兼容现有RAG流程,无需定制检索器或微调。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
结构增强的推理生成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视觉推理 :grounding(abstract)
AI总结 结构增强的推理生成通过显式推理结构提升多跳查询的准确性和连贯性,兼容现有RAG流程,无需定制检索器或微调。
面向执行状态的LLM推理用于自动化漏洞证明生成
专题命中 视觉推理 :grounding(abstract)
AI总结 DrillAgent通过结合LLM语义推理与执行状态反馈,实现自动化漏洞证明生成,显著提升漏洞检测效率。
Comments Version 1.0 (13 pages, 7 figures)
UniManip: 通用目的零样本机器人操作的代理操作图
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) ; Department of Automation, Tsinghua University, China(清华大学自动化系)
专题命中 视觉推理 :grounding(abstract)
AI总结 UniManip通过双层代理操作图实现通用零样本机器人操作,结合高层任务协调与底层动态状态表示,提升无监督环境下的执行鲁棒性。
Comments 15 pages, 12 figures, 6 tables, project page: https://henryhcliu.github.io/unimanip
AudioRAG:一个用于音频推理和信息检索的挑战性基准
专题命中 视觉推理 :grounding(abstract)
AI总结 AudioRAG是一个用于评估音频推理和信息检索能力的挑战性基准,通过整合检索增强生成技术,为未来研究提供更强大的基准。
Comments Accepted by Audio-AAAI
ToMigo:可解释的设计概念图用于对齐生成式AI与创意意图
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 ToMigo通过设计概念图实现生成式AI与创意意图的对齐,提供可解释的交互方式提升用户控制力。
Comments 18 pages, 10 figures, 2 tables
ARGOS:通过属性引导的组合推理实现具身AI的自动功能安全需求合成
机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学, 深圳, 中国) ; City University of Hong Kong, Hong Kong, China(香港城市大学, 香港, 中国) ; The University of Tokyo, Tokyo, Japan(东京大学, 东京, 日本) ; Lingnan University, Hong Kong, China(岭南大学, 香港, 中国)
专题命中 视觉推理 :grounding(abstract)
AI总结 ARGOS通过属性引导的组合推理,实现具身AI自动功能安全需求生成,提升开放环境中的安全性和可靠性。
长度无偏序列策略优化:揭示和控制RLVR中的响应长度变化
机构 * Meituan(美团)
专题命中 视觉推理 :vision-language model(abstract)
AI总结 本文提出LUSPO算法,通过消除长度偏差解决RLVR中响应长度崩溃问题,并在多个任务中展示出优于现有方法的性能。
Mil-SCORE:大型语言模型中长上下文地理空间推理与规划的基准测试
机构 * University of Maryland, College Park MD, USA(马里兰大学) ; ERA Lab, University of South Florida, Tampa FL, USA(佛罗里达大学埃拉实验室) ; DEVCOM Army Research Laboratory, Aberdeen Proving Ground MD, USA(国防部陆军研究实验室) ; EEHPC Lab, Johns Hopkins University, Baltimore MD, USA(约翰霍普金斯大学EEHPC实验室)
专题命中 视觉推理 :vision-language model(abstract)
AI总结 Mil-SCORE是首个针对复杂军事规划情景的多跳问题数据集,旨在评估大型语言模型在长上下文地理空间推理与规划中的能力。
引导验证器:通过动态过程监督实现协作多模态推理
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Peking University(北京大学) ; The University of Hong Kong(香港大学)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 本文提出引导验证器框架,通过动态过程监督实现多模态推理的协作优化,提升模型性能。
等待的计数:时间反馈对下游任务表现及感知等待时间体验的影响
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 本研究探讨时间反馈对等待体验及后续任务表现的影响,发现不同反馈模式影响用户感知但未影响实际表现。
Comments To be published in ACM CHI 2026
DELTA: 基于强化学习的多智能体推理用于多模态心理辅导
机构 * Anhui University(安徽大学) ; Hefei University of Technology(合肥工业大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究所)
专题命中 视觉推理 :grounding(abstract)
AI总结 DELTA 通过强化学习和多智能体推理提升多模态心理辅导的质量与情感契合度。
他们说迷因是无害的——我们发现了那些有害的:解码笑话、符号和文化参考
机构 * Macquarie University(麦考瑞大学) ; The University of Western Australia(西澳大学) ; Stanford University(斯坦福大学) ; Institute for Clarity in Documentation(文档清晰研究所) ; Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所) ; Rajiv Gandhi University(拉贾·甘地大学) ; Tsinghua University(清华大学) ; Palmer Research Laboratories(帕勒尔研究实验室)
专题命中 视觉推理 :vision-language model(abstract)
AI总结 CROSS-ALIGN+通过三阶段框架解决迷因滥用检测中的文化盲区、边界模糊和可解释性问题,实现性能提升和决策可解释性。
Comments Accepted at the The Web Conference 2026 (Research Track)
LegalOne:一种用于可靠法律推理的基础模型家族
机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系) ; Quancheng Laboratory(清华云城实验室) ; University of Waterloo, Canada(加拿大滑铁卢大学) ; China University of Political Science and Law(中国政法大学) ; MegaTech.AI Inc(MegaTech.AI公司)
专题命中 视觉推理 :grounding(abstract)
AI总结 LegalOne通过三阶段流程提升法律推理能力,结合领域适应、代理推理蒸馏和课程强化学习,在法律任务中取得超越通用LLMs的性能。
Comments 25 pages, v1
大语言模型赋能的可视化交互现状
专题命中 视觉推理 :grounding(abstract)
AI总结 本文系统回顾了大语言模型与可视化交互的研究现状,分析了6个维度的48篇论文,突出了新兴设计模式和评估挑战,旨在指导未来LLM增强的可视化研究和系统设计。
Comments Submitted to STARs of EuroVis'26
SkySim: 一种基于ROS2的无人机群自然语言控制仿真环境
专题命中 视觉推理 :grounding(abstract)
AI总结 SkySim通过基于ROS2的仿真框架,利用大型语言模型实现无人机群的自然语言控制,结合人工势场算法确保安全执行,验证了空间推理精度和实时碰撞避免能力。
基于内部言语和持久记忆的因子推理用于证据导向的人机交互
机构 * Department of Engineering, University of Palermo(帕尔米罗大学工程系) ; TheEngineRoom, Department of Informatics Bioengineering, Robotics and System Engineering(TheEngineRoom,信息生物工程、机器人与系统工程系)
专题命中 视觉推理 :grounding(abstract)
AI总结 JANUS 通过因子推理实现证据导向的人机交互,结合内部言语和持久记忆模块,提升机器人辅助系统的可扩展性和可审计性。
VTC-R1: 视觉-文本压缩用于高效长上下文推理
机构 * Nanyang Technical University(南洋技术大学) ; Alibaba Cloud Computing(阿里巴巴云计算)
专题命中 视觉推理 :vision-language model(abstract)
AI总结 VTC-R1通过视觉-文本压缩提升长上下文推理效率,实现3.4倍token压缩和2.7倍端到端延迟提升。
Comments Code: https://github.com/w-yibo/VTC-R1
听信还是不信?评估和分析音频语言模型的趋炎附势行为 with SYAUDIO
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) ; King Abdullah University of Science and Technology(卡布斯大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉推理 :vision-language model(abstract)
AI总结 SYAUDIO是首个评估音频语言模型趋炎附势行为的基准,通过系统分析不同领域和条件下的趋炎附势现象,验证了监督微调在减少此类行为中的有效性。
MM-THEBench: 多模态大语言模型是否能合理推理?
机构 * KIRC, Institute for Artificial Intelligence, Tsinghua University, China(KIRC人工智能研究院,清华大学,中国)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 MM-THEBench旨在评估推理MLLMs在中间推理过程中的幻觉问题,通过细粒度分类和多层次评估框架,揭示思考对多模态任务中幻觉和推理能力的影响。
SymCode:通过可验证代码生成实现数学推理的神经符号方法
机构 * Portland State University(波特兰州立大学) ; ElastixAI
专题命中 视觉推理 :grounding(abstract)
AI总结 SymCode通过可验证代码生成实现数学推理,显著提升准确性并增强模型的透明度和可靠性。
Comments camera-ready EACL 2026 Findings
WildScore: 多模态符号音乐推理在现实中的基准测试
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 WildScore是首个用于评估多模态大语言模型在现实世界中符号音乐推理能力的基准测试,通过真实音乐作品和用户生成问题,系统性评估模型在音乐学分析中的表现。
用于心胸疾病胸部X光影像的RSNA大语言模型基准数据集:通过AI标签增强的放射科评估和验证(REVEAL-CXR)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 本研究通过AI辅助标注流程,创建了包含200张胸部影像的基准数据集,用于评估不同模型,同时帮助放射科医生更高效地标注影像。
RoboBrain 2.5:视觉深度,思维时间
机构 * BAAI RoboBrain Team(百度人工智能研究院RoboBrain团队)
专题命中 视觉推理 :grounding(abstract)
AI总结 RoboBrain 2.5通过提升3D空间推理和时间值估计,增强具身智能在复杂精细操作中的物理基础和执行感知能力。
Comments 37 pages, 13 figures, Technical Report
PlotGen-Bench: 评估VLMs在从多样化图表生成可视化代码的能力 across 多个库
专题命中 视觉推理 :vision-language model(abstract)
AI总结 PlotGen-Bench评估VLMs在多库场景下生成可视化代码的能力,发现开源模型在视觉和语义一致性上表现欠佳,需进一步提升。
Comments 30 pages, 27 figures
SurgGoal: 重新思考手术计划评估 via 目标满足性
机构 * Technical University of Munich, Germany(慕尼黑技术大学) ; University of Strasbourg, France(斯特拉斯堡大学) ; University of Glasgow, United Kingdom(格拉斯哥大学) ; Nanyang Technological University, Singapore(南洋理工大学) ; University of Massachusetts Boston, USA(马萨诸塞大学波士顿分校)
专题命中 视觉推理 :vision-language model(abstract)
AI总结 SurgGoal通过目标满足性度量重新评估手术计划,揭示视频大语言模型在安全关键环境中的性能问题。
MM-BRIGHT: 一种多任务多模态基准用于推理密集型检索
专题命中 视觉推理 :visual reasoning(abstract)
AI总结 MM-BRIGHT是首个用于推理密集型检索的多模态基准,通过29个技术领域中的2,803个现实世界查询,评估了多模态检索模型在文本到文本、多模态到文本等任务上的性能。
TEMPO:一个用于时间推理密集检索的多领域基准
专题命中 视觉推理 :grounding(abstract)
AI总结 TEMPO是一个结合时间推理与多领域检索的基准,通过复杂查询和多步骤检索规划,评估检索系统在时间信息处理上的挑战和性能。
PrivGemo: 保护隐私的双塔图检索用于增强LLM推理的记忆增强
机构 * University of New South Wales(新南威尔士大学) ; Data61, CSIRO(Data61,CSIRO)
专题命中 视觉推理 :grounding(abstract)
AI总结 PrivGemo通过双塔设计和隐私保护机制,实现隐私保护的图检索增强推理,提升LLM在知识密集型任务中的推理能力。
可解释的多模态基于方面的情感分析与依赖引导的大语言模型
机构 * Harbin Institute of Technology(哈尔滨工程大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; University of Science and Technology of China(中国科学技术大学)
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 本文提出了一种基于依赖引导的大语言模型的多模态情感分析方法,通过生成可解释的自然语言解释来提升情感分类的准确性。
Comments 9 pages, 3 figures
意图一目了然:通过基础模型实现的注视引导的机器人操作
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视觉推理 :vision-language model(abstract)
AI总结 GAMMA通过结合基础模型和注视技术,实现无需特定任务训练的机器人操作自主控制,提升人机交互的直观性和可扩展性。
Comments Accepted to 2025 RSS Robot Planning in the Era of Foundation Models (FM4RoboPlan) Workshop