Weakly-Supervised HOI Detection from Interaction Labels Only and Language/Vision-Language Priors
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments 8 pages, 3 figures and 5 tables
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments 8 pages, 3 figures and 5 tables
机构 * NC AI
专题命中 视觉定位与Grounding :VLM(abstract,comments);vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments 19 pages, 1 figure, 14 tables. Technical report for VARCO-VISION-2.0, a Korean-English bilingual VLM in 14B and 1.7B variants. Key features: multi-image understanding, OCR with text localization, improved Korean capabilities
SHROOM-Visions 2026概览:大型视觉语言模型幻觉检测共享任务
机构 * University of Helsinki(赫尔辛基大学) ; Politecnico di Torino(都灵理工大学) ; Université Bretagne Sud(南布列塔尼大学) ; University of Copenhagen(哥本哈根大学) ; University Grenoble Alpes(格勒诺布尔阿尔卑斯大学) ; University of Lorraine(洛林大学)
专题命中 视觉定位与Grounding :vision-language model(title,abstract)
AI总结 本文介绍了2026年在EMNLP 2026同期举办的SHROOM-Visions共享任务,该任务针对大型视觉语言模型的幻觉检测,依托SHEEP数据集开展,吸引27支团队提交600余个系统,最优系统较基线提升30-40个百分点。
Comments To appear at UncertaiNLP 2026 @ EMNLP 2026
ARGUS:基于心理理论(Theory-of-Mind)的论证生成,结合策略感知规划与知识接地
机构 * InspireOmni AI ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 该研究提出基于智能体的Argus框架,结合心理理论推理、策略感知规划等,在三个基准上优于基线,可有效改变抗拒受众立场。
前向-反向脱节:神经计算中的状态动力学、信用分配与生物学基础
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 本文指出神经计算中前向计算已多样化但训练方法仍集中于梯度类误差传播机制的前向-反向脱节问题,提出涵盖状态动力学等三要素的分类法,强调需对齐三者以弥合该脱节。
通过检索增强的视觉语言模型实现机器人在训练数据中的泛化
机构 * Stanford University(斯坦福大学) ; Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学)
专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract)
AI总结 本文提出RADAR框架,通过检索和视觉语言模型分析,评估机器人策略在不同场景下的泛化能力,验证了其在大规模数据集中的有效性。
Comments IEEE Robotics and Automation Letters (RA-L)
CogChat:结合知识图谱与异构图变换器的对话式人工智能,用于设计生成中的认知接地
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 本研究提出结合异构图变换器的CogChat框架,以设计师专属动态知识图谱为基础,提升设计对话的上下文保留度与意图解读效果,降低认知负荷,为LLM交互的长期上下文管理提供新方法。
BavGround:巴伐利亚区域文化接地与方言能力基准
机构 * Stanford University(斯坦福大学) ; Freie Universität Berlin(柏林自由大学) ; Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Leibniz Supercomputing Centre (LRZ)(莱布尼茨超级计算中心)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 该研究推出BavGround基准,评估LLM的巴伐利亚区域文化接地与方言能力,发现多语言模型在巴伐利亚语及源接地问题上表现欠佳,且评估协议会显著影响结论。
XR中的视觉到触觉增强:一种用于多模态交互感知接地的可穿戴手套
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 该研究针对XR系统触觉感知利用不足的问题,提出一款可穿戴手套及视觉到触觉映射算法,经20人实验验证,其触觉增强可提升XR交互的真实感与沉浸感,为多模态XR系统提供感知增强层。
Comments 11 pages, 4 figures. Published in the Proceedings of the 1st Workshop on Shaping Future Human Connection: Social Augmentation through XR Technologies (SAXR 2026), April 13, 2026, Barcelona, Spain
Journal ref Proceedings of the 1st Workshop on Shaping Future Human Connection: Social Augmentation through XR Technologies (SAXR 2026), CEUR Workshop Proceedings, Vol. 4226, pp. 252-262, 2026
SpotSound: 通过细粒度时间定位增强大音频-语言模型
机构 * Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; SAI, Shanghai Jiao Tong University(上海交通大学人工智能院)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 SpotSound通过引入新的训练目标和挑战性基准,提升了大音频-语言模型在时间定位任务中的性能,同时保持了通用任务的鲁棒性。
语言的作用与证据支持:具身智能体中语言接地的功能角色分类与证据审查
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 本研究提出具身智能体中语言的五种功能角色,构建框架审查现有文献,发现语言功能使用与证据支持存在差距,以角色主张为单位可合理比较不同具身智能体。
Comments 19 pages, 3 figures, 11 tables
事件接地图:从机器人观测中统一的时空场景图
机构 * School of Electrical Engineering, Aalto University(艾尔沃斯大学电气工程学院)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 本文提出事件接地图(EGG)框架,通过统一时空场景图实现机器人对复杂时空查询的感知与响应。
Comments Accepted to RA-L
Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 5, pp. 5286-5293, May 2026
GEAR:通过几何定位和外观还原重建古典绘画
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 研究旨在解决从单幅古典绘画重建3D场景的难题,提出免训练的GEAR框架,先通过几何定位增强3D高斯重建稳定性,再在空间约束下恢复外观,经实验验证其在多方面优于基线,还构建了相关基准。
Comments Accepted by ACM MM 2026
像双语婴儿一样:视觉基础双语语言模型的优势
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; University of South Florida(南佛罗里达大学) ; Carleton University(卡尔顿大学)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 研究旨在探讨视觉基础对双语语言模型的影响,通过在英西双语图像及字幕上训练LSTM模型,发现视觉基础能提升模型对语义相似性的理解及降低困惑度,为视觉基础语言模型优势提供证据,指出需更多自然语言数据。
Comments Preprint, 7 pages, 2 tables, 1 figure
Veritas:一种语义导向的代理框架,用于二进制中的内存破坏漏洞检测
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 Veritas通过结合静态切片、双视角LLM检测器和多代理验证器,利用语义基础和运行时证据检测二进制中的内存破坏漏洞,实现了90%的召回率,并在实际应用中发现了一个未知的Apple漏洞。
用于接触丰富的机器人操作的表示对齐触觉基础
机构 * Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院智能信息处理上海市重点实验室) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; Lenovo CTO Organization(联想首席技术官组织) ; Nanyang Technological University(南洋理工大学) ; TeleAl, China Telecom(中国电信天翼人工智能公司)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 研究接触丰富的机器人操作中,针对VLA策略不同表示作用下触觉监督应用位置不明的问题,通过线性探针分析找到可预测未来触觉状态的中间动作专家特征,引入LTP,实验证明表示对齐的触觉基础效果更佳。
DS@GT ARC参加LongEval:科学问答中的引用完整性和事实基础
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 研究在科学问答中传统评估指标与引用完整性的差异,通过Corrective RAG和CiteFix构建纠正管道,对比前沿模型,发现前沿模型答案生成不依赖文档上下文,而纠正管道提升了引用忠实度和答案基础,提出需奖励严格答案基础的评估指标。
Comments 12 pages, 4 figures. Accepted to the CLEF 2026 LongEval Lab Working Notes
EntSQL:一个将Text-to-SQL置于长上下文企业知识中的基准
机构 * HKUST (GZ)(香港科技大学(广州)) ; Alibaba Group(阿里巴巴集团) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 提出EntSQL基准,通过包含1066个跨五个业务领域的中英文对齐示例,评估LLM在长上下文企业文档中基于私有业务知识生成SQL的能力,最佳系统仅达15.9%准确率。
TagSpeech:基于细粒度时间定位的端到端多说话人自动语音识别与说话人分离
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 研究提出TagSpeech框架,利用时间锚点定位技术联合多说话人ASR与说话人分离。通过关键设计解决细粒度对齐挑战,端到端建模“谁在何时说了什么”。实验显示其在DER上优于基线,采用参数高效训练范式,低计算成本获强性能。
Comments Accepted to ACL2026 Main Oral; v2: added overlap analysis in Section 5.2
拖拽、推断、重投影:通过空间交互为图像聚类的LLM基础
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 提出CriterionSI方法,利用大语言模型从用户拖拽交互中推断聚类标准,并引导重投影,实现渐进式标准对齐的图像聚类布局。
解耦语义与几何基础:面向语言条件模仿学习的空间视觉提示
机构 * Tsinghua University(清华大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; National University of Singapore(新加坡国立大学)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 提出SVP-IL解耦架构,通过视觉语言基础模型将指令解析为零样本几何掩码,生成空间视觉提示并注入连续动作生成器,在低数据条件下显著提升语言条件模仿学习的成功率。
超越声学前缀:基于序列化声学记忆的持久接地用于基于LLM的多说话人语音识别
机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 针对LLM在多说话人ASR中性能下降的问题,提出持久接地于序列化声学记忆的方法,通过解纠缠说话人表征和门控残差交叉注意力,显著提升三说话人混合场景的识别效果。
MarkIt: 免训练视觉标记用于精确视频时间定位
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 提出免训练框架MarkIt,通过无标注查询到掩码桥接生成标记视频,增强视频语言大模型的时间定位能力,在多个基准上取得最优结果。
GIVE:在视觉-语言-动作模型中接地人类手势
机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 针对VLA模型忽略手势导致意图理解不准的问题,提出GIVE方法,通过视觉和语义双路径增强手势理解,在真实HRI实验中目标识别准确率提升40%,任务成功率提升80%。
Comments Project page: https://luis-cloud-sg.github.io/GIVE-project/
音频大语言模型中多事件音频定位的敏感性分析
机构 * Sogang University(ソンガン大学)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 通过大规模评估,发现音频大语言模型在复杂声学场景中事件数量增加会导致真阳性率下降和假阳性率上升,提示词则引入权衡,模型对多事件音频更不确定。
Comments 6 pages, Accepted to Interspeech 2026
瞬态条件下磁活性接地电极的动态建模
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 针对瞬态条件下接地系统的非线性行为,提出一种考虑电磁耦合、电热效应和电离机制的磁活性接地电极非线性动态模型,并在MATLAB/Simulink中验证其动态阻抗特性。
RoboSemanticBench: 诊断 VLA 模型在动作预测中的语义基础
机构 * HIT(哈尔滨工业大学) ; ZGCA(中钢集团人工智能研究院) ; ZGCI(中钢集团智能计算研究所) ; WHU(武汉大学) ; HUST(华中科技大学) ; HKUST(GZ)(香港科技大学(广州)) ; BUAA(北京航空航天大学) ; ECNU(华东师范大学) ; DeepCybo
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 提出 RoboSemanticBench 基准,通过多选问答任务评估 VLA 模型是否利用指令语义选择正确物体,发现模型在语义正确选择上接近随机,揭示语义理解与动作预测之间的差距。
Comments GitHub: https://github.com/ZGC-EmbodyAI/RoboSemanticBench
超越航点:双热图接地用于跨具身语义导航
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; JD AI Research(京东人工智能研究院)
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 本文提出一种统一的视觉-语言框架,通过双热图表示替代单点回归,以解决语义指令与物理可达性之间的差距,从而提升跨具身语义导航的鲁棒性和性能。
基于代理推理和时间定位的开放式视频游戏漏洞检测
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 本文提出VideoGlitchBench基准和GliDe框架,通过代理推理和时间定位检测视频游戏中的漏洞,提升语义理解和时间定位能力。
Comments 16 pages, 10 figures, under review
FSAG: 通过扩散模型增强人对灵巧手手指特定 affordance 的 grounding
专题命中 视觉定位与Grounding :grounding(title,abstract)
AI总结 本文提出FSAG框架,通过扩散模型提取语义affordance,实现稳定多接触抓取,无需硬件特定数据集,且单模态深度信息即可实现高性能抓取合成。