arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-29 至 2025-12-29 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 4 篇

2512.21402 2025-12-29 cs.CV 85%

Understanding Virality: A Rubric based Vision-Language Model Framework for Short-Form Edutainment Evaluation

理解病毒性:一种基于Rubric的视觉-语言模型框架用于短形式教育娱乐内容评估

Arnav Gupta, Gurekas Singh Sahney, Hardik Rathi, Abhishek Chandwani, Ishaan Gupta, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,比里尼)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出基于Rubric的视觉-语言模型框架,用于评估短形式教育娱乐视频的病毒性,通过提取音频视觉特征并训练回归评估器,实现可解释且可扩展的参与度预测。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21641 2025-12-29 cs.CV cs.AI 81%

TrackTeller: Temporal Multimodal 3D Grounding for Behavior-Dependent Object References

TrackTeller: 基于时间的多模态3D定位用于行为依赖的对象引用

Jiahong Yu, Ziqi Wang, Hailiang Zhao, Wei Zhai, Xueqiang Yan, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 TrackTeller通过融合LiDAR图像、语言条件解码和时间推理,提升动态3D场景中基于语言的物体定位与跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21670 2025-12-29 cs.CV cs.LG 62%

The Deepfake Detective: Interpreting Neural Forensics Through Sparse Features and Manifolds

深度伪造侦探:通过稀疏特征和流形进行神经取证解释

Subramanyam Sahoo, Jared Junkin

机构 * Berkeley AI Safety Initiative (BASIS) University of California, Berkeley(伯克利人工智能安全倡议(BASIS)大学伯克利) Department of Electrical and Computer Engineering Johns Hopkins University(电气与计算机工程系约翰霍普金斯大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一种通过稀疏特征和流形分析来解释深度伪造检测模型的框架,揭示了模型内部特征的使用规律和几何属性变化,以提升模型的可解释性和鲁棒性。

Comments 10 pages, 5 figures, Initial Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21347 2025-12-29 cs.SE 50%

Understanding the Role of Large Language Models in Software Engineering: Evidence from an Industry Survey

理解大型语言模型在软件工程中的作用:来自行业调查的证据

Vítor Mateus de Brito, Kleinner Farias

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过行业调查揭示大型语言模型在软件工程中的应用现状与影响,探讨其积极效果与潜在风险,提出需批判性使用LLM工具以提升开发效率与安全性。

Comments 4 Figures, 8 Tables, Text in Portuguese

详情

展开后加载摘要…

URL PDF HTML 收藏