arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-05 至 2025-12-05 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 5 篇

2512.04231 2025-12-05 cs.RO cs.AI 79%

CRAFT-E: A Neuro-Symbolic Framework for Embodied Affordance Grounding

CRAFT-E:一种用于具身赋能力量接地的神经符号框架

Zhou Chen, Joe Lin, Carson Bulgin, Sathyanarayanan N. Aakur

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 CRAFT-E通过结合神经符号方法和具身感知,提供了一种可解释且可定制的框架,用于辅助机器人系统中基于赋能力量的物体选择。

Comments 20 pages. 3 figures, 4 tables. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13247 2025-12-05 cs.CL 78%

Grounding LLM Reasoning with Knowledge Graphs

通过知识图谱 grounding 大语言模型的推理

Alfonso Amayuelas, Joy Sain, Simerjot Kaur, Charese Smiley

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) JP Morgan AI Research(摩根大通人工智能研究)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 通过知识图谱 grounding 大语言模型的推理,提升推理的准确性和可解释性

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04728 2025-12-05 cs.CV cs.AI 73%

Measuring the Unspoken: A Disentanglement Model and Benchmark for Psychological Analysis in the Wild

测量未言之: 一种解耦模型和基准用于野外心理分析

Yigui Feng, Qinglin Wang, Haotian Mo, Yang Liu, Ke Liu, Gencheng Liu, Xinhai Chen, Siqi Shen, Songzhu Mei, Jie Liu

机构 * College of Computer Science, National University of Defense Technology(计算机科学学院,国防科技大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MIND模型和PRISM基准,通过解耦算法和专家标注数据提升野外对话心理分析的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04599 2025-12-05 cs.CV 70%

Malicious Image Analysis via Vision-Language Segmentation Fusion: Detection, Element, and Location in One-shot

通过视觉-语言分割融合进行恶意图像分析:一次检测、元素识别与定位

Sheng Hang, Chaoxiang He, Hongsheng Hu, Hanqing Hu, Bin Benjamin Zhu, Shi-Feng Sun, Dawu Gu, Shuo Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Microsoft Corporation(微软公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种零样本方法,通过视觉-语言分割融合实现恶意图像的检测、元素识别与定位,提升细粒度审核的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05060 2025-12-05 cs.CV 57%

4DLangVGGT: 4D Language-Visual Geometry Grounded Transformer

4DLangVGGT: 4D语言-视觉几何 grounded Transformer

Xianfeng Wu, Yajing Bai, Minghan Li, Xianzu Wu, Xueqi Zhao, Zhongyuan Lai, Wenyu Liu, Xinggang Wang

机构 * State Key Laboratory of Precision Blasting, Jianghan University(江汉大学精密爆破重点实验室) Harvard AI and Robotics Lab, Harvard University(哈佛大学AI与机器人实验室) School of EIC, Huazhong University of Science and Technology(华中科技大学电子信息学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) School of Mathematics and Statistics, Hubei University of Education(湖北省教育学院数学与统计学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 4DLangVGGT是一种基于Transformer的统一框架,用于4D语言 grounding,通过整合几何感知和语言对齐,提升4D场景理解的泛化能力和部署效率。

Comments Code: https://github.com/hustvl/4DLangVGGT, Webpage: https://hustvl.github.io/4DLangVGGT

详情

展开后加载摘要…

URL PDF HTML 收藏