arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-05 至 2025-12-05 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 3 篇

2409.18541 2025-12-05 cs.AI 83%

Align$^2$LLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curation

Align$^2$LLaVA: 多模态指令编纂的级联人类与大语言模型偏好对齐

Hongzhe Huang, Jiang Liu, Zhewen Yu, Li Cai, Dian Jiao, Wenqiao Zhang, Siliang Tang, Juncheng Li, Hao Jiang, Haoyuan Li, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba(阿里巴巴)

专题命中 VLM训练与架构 :LLaVA(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 Align$^2$LLaVA通过级联人类与LLM偏好对齐方法,有效压缩多模态指令数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04058 2025-12-05 cs.CV 79%

EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models

EVE:基于视觉-语言模型的端到端视频字幕提取

Haiyang Yu, Mengyang Zhao, Jinghui Lu, Ke Niu, Yanjie Wang, Weijie Yin, Weitao Jia, Teng Fu, Yang Liu, Jun Liu, Hong Chen

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ByteDance Inc.(字节跳动公司) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Computing and Communications, Lancaster University(兰卡斯特大学计算机与通讯学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 EVE提出了一种基于视觉-语言模型的端到端视频字幕提取框架,通过双分支模块高效提取字幕及时间戳,并构建了首个大规模视频字幕数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02514 2025-12-05 cs.RO cs.AI cs.LG 62%

The Autonomy-Alignment Problem in Open-Ended Learning Robots: Formalising the Purpose Framework

开放性学习机器人中的自主性-对齐问题:目的框架的正式化

Gianluca Baldassarre, Richard J. Duro, Emilio Cartoni, Mehdi Khamassi, Alejandro Romero, Vieri Giuliano Santucci

机构 * Institute of Cognitive Sciences and Technologies, National Research Council(认知科学与技术研究所,国家研究理事会) Integrated Group for Engineering Research, CITIC, Universidade da Coruña(工程研究联合组,CITIC,科鲁纳大学) Institute of Intelligent Systems and Robotics, Sorbonne University / CNRS(智能系统与机器人研究所,索邦大学 / CNRS)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种用于开放性学习机器人的计算框架,通过定义'目的'来平衡自主性与人类控制,解决自主性-对齐问题。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏