Look Before You Leap: Unveiling the Power of GPT-4V in Robotic Vision-Language Planning
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments arXiv v2: add appendix
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments arXiv v2: add appendix
专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by AAAI 2024
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project Page: : https://vis-www.cs.umass.edu/3dllm/
专题命中 视觉定位与Grounding :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 30 pages (Accepted in ACM Computing Surveys December 2021)
视觉语言模型需要视觉变换器吗?评估状态空间模型作为视觉编码器
机构 * Stony Brook University(石英 Brook 大学)
专题命中 视觉定位与Grounding :VLM(abstract,comments);grounding(abstract);分类 cs.CV、cs.LG
AI总结 本文评估了状态空间模型作为视觉编码器在视觉语言模型中的有效性,发现其在VQA和定位任务中表现优异,并提出稳定策略提升鲁棒性。
Comments Project page: https://lab-spell.github.io/vlm-ssm-vision-encoders/ ; Code: https://github.com/raykuo18/vlm-ssm-vision-encoders
TRACE:基于多源证据锚定的智能体式商品目录丰富
机构 * DoorDash(多闸道科技(DoorDash))
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 针对电商商品目录属性稀疏问题,提出基于LLM的TRACE框架,经离线评估、生产部署及在线实验验证,可高效提升目录属性丰富的准确率、覆盖率及结账转化率。
Comments 12 pages, 2 figures
ReguSim:评估大语言模型智能体在金融合规中的规则落地
机构 * HKUST(香港科技大学) ; HKBU(香港浸会大学) ; NTU(新加坡南洋理工大学)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。
Seed2GS:通过单个参考视图定位从3D高斯溅射(3DGS)场景中进行无相机、无训练的目标提取
专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV
AI总结 Seed2GS是一种无相机、无训练的目标提取方法,通过分离目标身份与3D覆盖范围,在LERF-MASK和3D-OVS数据集上实现了高精度,且计算延迟低。
基于图支架证据锚定的个性化深度研究查询优化
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 本研究提出G-STEER方法,通过图支架证据锚定优化用户请求为个性化研究规范,在提升深度研究智能体报告个性化的同时,大幅减少向用户提问的数量。
Comments 13 pages, 4 figures
让Nemotron学习希腊语:针对专业领域现代希腊语的语料库挖掘、检索适配与生成落地
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 本研究针对现代希腊语缺失于Nemotron检索模型及主流多语言基准的问题,提出Nemotron检索栈的端到端适配方案,含语料库挖掘等步骤,推出首个希腊语RAG基准HERA,适配后的模型在多项指标上显著提升。
Comments 15 pages, 10 figures, 7 tables. Includes release of the HERA benchmark and Sophea Nemo RAG models
视听世界模型:为具身智能体奠定多感官想象的基础
机构 * Tsinghua University(清华大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV
AI总结 提出视听世界模型(AVWM)统一框架,通过条件扩散Transformer(AV-CDiT)联合预测双耳音频与视觉动态,在30小时基准AVW-4k上实现高保真多模态预测,并验证其在具身导航中的有效性。
CeQe:在语义证据中实现词汇检索
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 针对BM25的语义词汇鸿沟问题,本文提出CE-QE方法,利用交叉编码器的语义检索结果扩展BM25查询,在多个BEIR数据集上显著提升检索性能且不修改底层索引。
LabGuard:将自然语言实验室规则转化为具身实验室代理的运行时守卫
机构 * Wuhan University(武汉大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Northeastern University(东北大学)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 提出LabGuard,一种将自然语言实验室规则转化为可执行规范并部署为运行时守卫的安全套件,通过三个核心组件实现规则到监控的映射,实验表明能有效降低不安全事件。
Comments First three authors are co-first authors
损失不变性决定概念层编码的内容:超声心动图中的容积定位
机构 * Yonsei University College of Medicine(延世大学医学院) ; Research Institute of Radiologic Science(放射科学研究所)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 研究以超声心动图视频中左心室容积为概念探讨概念瓶颈模型有效性,通过训练视频变压器编码器,比较不同训练方式,发现仅概念准确性不足,可解释中间变量应依训练目标不变性结构验证。
使用基于语音的多模态大语言模型实现可泛化的认知障碍检测
机构 * Faculty of Digital Innovation, Arts \& Sciences, Saskatchewan Polytechnic, Regina SK S4S 5X1, Canada ; School of Basic Medical Sciences, Hebei University, Baoding 071000, China ; Department of Civil \& Environmental Engineering ; School of Mining \& Petroleum Engineering, University of Alberta, Edmonton AB T6G 2H5, Canada
专题命中 视觉定位与Grounding :multimodal large language model(title);分类 cs.LG
AI总结 研究针对认知障碍检测问题,提出基于开源大语言模型的多模态检测框架,整合语音音频与转录文本,提取特定模态嵌入后连接成特征向量用于分类,在相关基准数据集上评估,该框架准确率达92.4%,优于单模态基线且泛化能力强。
RLearner-LLM: 通过混合直接偏好优化平衡大语言模型中的逻辑性与流畅性
机构 * University of Auckland(奥克兰大学) ; Aalto University(阿alto大学)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 本文提出RLearner-LLM,通过融合DeBERTa-v3 NLI信号与验证器LLM评分,解决直接偏好优化在知识密集型生成中的逻辑对齐问题,实现NLI指标显著提升。
通过对视觉语言模型计算的两个视频之间的帧相似性进行分组来检测异常帧,以提取专家工人的独特动作
专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV
AI总结 针对熟练维护工人减少的问题,提出通过比较两个视频帧相似性检测异常帧来提取专家独特动作的方法,在模拟实验中对特定动作类型提取率达66.9%,比传统技术提高50个百分点,有助于技能转移和劳动力发展。
Comments 11 pages, 6 figures, 2 tables
C-GAP:类感知与在线提示改进不均衡类上的视觉语言模型
机构 * San Diego State University(圣地亚哥州立大学)
专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV
AI总结 研究针对安全关键感知系统检测小标签空间中罕见物体类别的问题,提出C-GAP框架,通过建立复合字幕基线并利用语言模型迭代细化提示,无需更新检测器权重,有效提升少数类检测精度,实验证明其成效显著。
检索增强生成必须超越事实基础以代表多样化观点
机构 * Amazon.com(亚马逊公司)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 本文指出检索增强生成系统存在系统性事实偏差,并提出需要在检索系统设计上进行范式转变,通过不确定性量化方法提出统一目标,并展示Opinion-Aware RAG架构在两个领域中的实验结果,证明其在多样性、公平性和准确性方面的提升。
Comments 18 pages, Preprint under review
用于现场检查和维护中移动操作的部分观察下语言引导抓取
机构 * Department of Mechanical Engineering, Federal University of Uberlândia(联邦大学伯南迪利亚机械工程系) ; Department of Mechanical Engineering, University of São Paulo(圣保罗大学机械工程系) ; Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) ; Faculdade Israelita de Ensino e Pesquisa Albert Einstein, Hospital Israelita Albert Einstein(艾伯特·爱因斯坦以色列教学与研究学院,艾伯特·爱因斯坦医院)
专题命中 视觉定位与Grounding :VLM(title);分类 cs.LG
AI总结 提出用于腿部移动操纵器在部分观察下的语言引导抓取流程,经多步骤处理,在四足机器人上实现并评估,相比基线提高抓取成功率,提升语言引导抓取可靠性。
COMPASS:在统一多模态模型中锚定构图意图引导
机构 * University of Edinburgh(爱丁堡大学) ; State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Ant Group(蚂蚁集团)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 提出统一框架COMPASS,通过共享专家令牌τ_c实现构图感知与生成的双向锚定,结合MoE骨干和Comp-11数据集,显著提升细粒度构图理解与可控生成能力。
PhysChoreo: 具有部分感知语义基础的物理可控视频生成
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV
AI总结 提出PhysChoreo框架,通过两阶段方法(部分感知物理属性重建与时序指导的可编辑物理模拟)从单张图像生成物理可控且逼真的视频,在多个指标上超越现有方法。
ODRL 意味着什么?UFO-L 中许可、禁止和义务的跨层次本体论基础
机构 * University of Twente, The Netherlands(特文特大学,荷兰) ; RWTH Aachen University, Aachen, Germany(亚琛工业大学,德国)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 针对 ODRL 策略评估器忽略规范立场、权威结构等问题,提出跨层次设计原则,将 ODRL 规则映射到 UFO-L 中的法律关联子,从两种扩展至八种法律立场,并在 Isabelle/HOL 中机械验证。
Comments Accepted at FOIS 2026 (16th International Conference on Formal Ontology in Information Systems), Vitória, Brazil; to appear in Frontiers in Artificial Intelligence and Applications, IOS Press. 16 pages, 1 figure, 2 tables
使用多LLM智能体模拟仇恨言论级联:实证基础、建模保真度与干预策略
机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 本研究通过多LLM智能体系统模拟在线仇恨言论传播,发现其能再现实证数据中的立场单一性和毒性同质性,并通过消融实验识别出智能体异质性为关键保真因素,提出针对密集网络的放大器干预策略。
基于XAI的语音深度伪造检测解释生成:使用免训练多模态大语言模型
机构 * Imperial College London(帝国理工学院) ; Technical University of Munich(慕尼黑工业大学) ; University of Southampton(南安普顿大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉定位与Grounding :multimodal large language model(title);分类 cs.AI
AI总结 针对语音深度伪造检测缺乏可解释性的问题,提出一种免训练框架,融合XAI证据与多模态大语言模型,生成基于证据的特定解释,在PartialSpoof数据集上内部准确率提升超45%。
Comments Accepted at Interspeech 2026
物体先于词汇:用于从儿童视角视频中语言接地学习的物体优先归纳偏置
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Weizmann Institute of Science(魏茨曼科学研究所)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV
AI总结 针对婴儿视角视频中命名参照物出现时间和位置的双重歧义,提出BabyMind方法,通过物体优先的归纳偏置、掩码区域接口和原型空间多实例对比学习,在稀疏弱监督下提升语言接地性能。
遗憾预训练:桥接先验与后验视角以增强知识基础
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 提出遗憾预训练框架,通过双视角架构利用未来信息增强因果语言模型,在OLMoE-1B-7B架构上平均准确率提升至33.9%。
通过不变性感知模型拼接实现功能相似性评估
机构 * Ioannis Athanasiadis ; Anmar Karmush ; Michael Felsberg
专题命中 视觉定位与Grounding :grounding(title);分类 cs.LG
AI总结 针对标准模型拼接忽略不变性导致功能相似性误判的问题,提出前向-后向兼容性要求下的不变性感知模型拼接方法,揭示隐藏的功能差异。
图对齐拓扑作为接地检测的归纳偏置
机构 * Department of Pediatrics, University of Illinois College of Medicine Peoria(伊利诺伊大学皮奥里亚医学院儿科部) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机与数据科学学院) ; Carle Illinois College of Medicine, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校卡莱医学院)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI
AI总结 提出利用图对齐拓扑作为归纳偏置,通过构建参考信息与LLM输出之间的对齐二分图并训练图神经网络建模对齐结构,在幻觉检测和问答任务上取得最先进结果。
生存或崩溃:自我博弈强化学习中数据门控与奖励基础的不对称作用
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) ; Cisco Research(思科研究)
专题命中 视觉定位与Grounding :grounding(title);分类 cs.LG
AI总结 本文研究了自我博弈强化学习中数据门控和奖励基础的不对称作用,发现数据门控是维持稳定的关键因素,而奖励信号在门控移除后无法单独保证稳定性,揭示了'基础提出者悖论'。