arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-25 至 2025-12-25 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 8 篇

2412.06244 2025-12-25 cs.CV 70%

Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction

无偏区域-语言对齐用于开放词汇密集预测

Yunheng Li, Yuxuan Li, Quansheng Zeng, Wenhai Wang, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) NKIARI, Shenzhen Futian(深圳福田国家信息研究院) OpenGVLab, Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 DenseVLM通过无偏区域-语言对齐提升开放词汇密集预测性能

Comments Accepted at ICCV 2025. The code is available at https://github.com/HVision-NKU/DenseVLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21099 2025-12-25 cs.GR cs.AI cs.CV 62%

TexAvatars : Hybrid Texel-3D Representations for Stable Rigging of Photorealistic Gaussian Head Avatars

TexAvatars : 混合的texel-3D表示用于稳定驱动的逼真高斯头avatars

Jaeseong Lee, Junyeong Ahn, Taewoong Kang, Jaegul Choo

机构 * KAIST(韩国科学技术院) Hanyang University(翰阳大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 TexAvatars通过混合texel-3D表示,结合分析rigging的几何基础与texel空间的连续性,实现逼真头avatars的稳定驱动和高保真表达。

Comments 3DV 2026, Project page with videos: https://summertight.github.io/TexAvatars/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21237 2025-12-25 cs.CV 57%

SegMo: Segment-aligned Text to 3D Human Motion Generation

SegMo:基于段落的文本到3D人体运动生成

Bowen Dang, Lin Wu, Xiaohang Yang, Zheng Yuan, Zhixiang Chen

机构 * University of Sheffield(谢菲尔德大学) University of Glasgow(格拉斯哥大学) Queen Mary University of London(伦敦大学Queen Mary)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SegMo通过段落对齐实现文本与3D人体运动的精细生成与对齐,提升生成效果并拓展应用范围。

Comments The IEEE/CVF Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21150 2025-12-25 cs.CV 57%

ORCA: Object Recognition and Comprehension for Archiving Marine Species

ORCA:面向档案化海洋物种的对象识别与理解

Yuk-Kwan Wong, Haixin Liang, Zeyu Ma, Yiwei Chen, Ziqiang Zheng, Rinaldi Gotama, Pascal Sebastian, Lauren D. Sparks, Sai-Kit Yeung

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Electronic Science and Technology of China(电子科学与技术大学) Indo Ocean Foundation Project(印度洋基金会项目)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 ORCA提出一个多模态基准数据集,用于提升海洋物种识别与理解的研究水平,通过细粒度视觉和文本注释推动领域内方法学进展。

Comments Accepted by The IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21065 2025-12-25 cs.RO cs.CV 57%

Language-Guided Grasp Detection with Coarse-to-Fine Learning for Robotic Manipulation

基于粗到细学习的语言引导抓取检测用于机器人操作

Zebin Jiang, Tianle Jin, Xiangtong Yao, Alois Knoll, Hu Cao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出基于粗到细学习的语言引导抓取检测方法,通过跨模态融合和动态卷积头提升抓取精度与鲁棒性,实验证明其在复杂环境中的有效性。

Comments Submitted to IEEE Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20714 2025-12-25 cs.AI cs.CY cs.HC 57%

From Pilots to Practices: A Scoping Review of GenAI-Enabled Personalization in Computer Science Education

从飞行员到实践:关于生成式AI在计算机科学教育中实现个性化的一次范围综述

Iman Reihanian, Yunfei Hou, Qingquan Sun

机构 * School of Computer Science and Engineering, California State University, San Bernardino, CA 92407 , USA(计算机科学与工程学院,加州州立大学,桑 bernardino,CA 92407,美国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过综述32项研究,探讨生成式AI在计算机科学教育中的个性化应用,提出探索优先的采用框架,强调试点和证据驱动的扩展,以提升学习效果并应对相关风险。

Comments Review article. 23 pages, 7 figures, 8 tables. Published in AI (MDPI), 2026

Journal ref AI 2026, 7(1), Article 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11718 2025-12-25 cs.HC cs.AI 57%

Interaction, Process, Infrastructure: A Unified Framework for Human-Agent Collaboration

交互、过程、基础设施:人机协作的统一框架

Yun Wang, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种统一框架,通过整合交互、过程和基础设施,解决人机协作中结构表示和适应性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11953 2025-12-25 cs.CV 57%

SPOC: Spatially-Progressing Object State Change Segmentation in Video

SPOC: 视频中空间性推进的对象状态变化分割

Priyanka Mandikal, Tushar Nagarajan, Alex Stoken, Zihui Xue, Kristen Grauman

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 SPOC提出空间性推进的对象状态变化分割任务,通过伪标签和动态约束方法,解决视频中对象变化位置和速度的精确定位问题。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏