arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-21 至 2026-01-21 共收录 102 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 22 篇

2601.12174 2026-01-21 eess.IV 67%

A multitask framework for automated interpretation of multi-frame right upper quadrant ultrasound in clinical decision support

多任务框架用于临床决策支持中多帧右上象限超声自动解读

Haiman Guo, Cheng-Yi Li, Yuli Wang, Robin Wang, Yuwei Dai, Qinghai Peng, Danming Cao, Zhusi Zhong, Thao Vu, Linmei Zhao, Chengzhang Zhu, Christopher Tan, Jacob Schick, Stephen Kwak, Farzad Sedaghat, Javad Azadi, James Facciola, Jonathan Feng, Dilek Oncel, Ulrike Hamper, Alex Zhu, Tej Mehta, Melissa Leimkuehler, Cheng Ting Lin, Zhicheng Jiao, Ihab Kamel, Jing Wu, Li Yang, Harrison Bai

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出多任务视觉-语言模型,用于提升右上象限超声波解读的诊断准确性与手术决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20941 2026-01-21 cs.LG cs.AI physics.flu-dyn 62%

A Multi-fidelity Double-Delta Wing Dataset and Empirical Scaling Laws for GNN-based Aerodynamic Field Surrogate

多保真度双三角翼数据集及基于GNN的气动场替代模型的实证标度定律

Yiren Shen, Juan J. Alonso

机构 * Department of Aeronautics and Astronautics(航空与宇航系)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一个多保真度双三角翼数据集及基于GNN的气动场替代模型的实证标度定律,通过实验发现数据量与预测精度呈幂律关系,提出最优采样密度为每个维度八个样本。

Journal ref AIAA SCITECH 2026 Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10378 2026-01-21 cs.CV cs.AI 62%

Global Context Compression with Interleaved Vision-Text Transformation

全局上下文压缩与交错视觉-文本转换

Dian Jiao, Jiaxin Duan, Shuai Zhao, Jiabing Leng, Yiran Zhang, Feng Huang

机构 * China Electronics Cloud Technology Co Ltd.(中国电子云科技有限公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VIST2模型,通过交错视觉与文本信息实现全局上下文压缩,提升长写任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17853 2026-01-21 cs.RO cs.AI 57%

AnyTask: an Automated Task and Data Generation Framework for Advancing Sim-to-Real Policy Learning

AnyTask: 一种用于推进仿真到现实策略学习的任务和数据生成框架

Ran Gong, Xiaohan Zhang, Jinghuan Shang, Maria Vittoria Minniti, Jigarkumar Patel, Valerio Pepe, Riedana Yan, Ahmet Gundogdu, Ivan Kapelyukh, Ali Abbas, Xiaoqiang Yan, Harsh Patel, Laura Herlant, Karl Schmeckpeper

机构 * Robotics and AI Institute(机器人与人工智能研究所)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI

AI总结 AnyTask通过自动化框架结合GPU仿真与基础模型,生成多样化任务和机器人数据,提升仿真到现实策略学习的效率与效果。

Comments 28 pages, 25 figures. The first four authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13143 2026-01-21 cs.LG 57%

FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference

FastAV: 面向音频视觉大语言模型推理的高效令牌修剪

Chaeyoung Jung, Youngjoon Jang, Seungwoo Lee, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 FastAV通过两阶段令牌修剪策略,针对音频视觉大语言模型实现高效推理,减少FLOPs超过40%并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12303 2026-01-21 cs.CV 57%

Concepts from Representations: Post-hoc Concept Bottleneck Models via Sparse Decomposition of Visual Representations

表示法中的概念:通过视觉表示的稀疏分解实现事后概念瓶颈模型

Shizhan Gong, Xiaofan Zhang, Qi Dou

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出PCBM-ReD,通过视觉表示的稀疏分解,实现对预训练模型的可解释性增强,提升图像分类任务的准确性和可解释性。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14121 2026-01-21 cs.CL 50%

NewsRECON: News article REtrieval for image CONtextualization

NewsRECON: 用于图像上下文化的新闻文章检索

Jonathan Tonglet, Iryna Gurevych, Tinne Tuytelaars, Marie-Francine Moens

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(通用知识处理实验室(UKP实验室)、计算机科学系、图恩大学(TU Darmstadt)和应用网络安全国家研究中心ATHENE) Department of Electrical Engineering, KU Leuven(电气工程系、鲁汶大学) Department of Computer Science, KU Leuven(计算机科学系、鲁汶大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 NewsRECON通过链接图像与相关新闻文章,利用元数据推断图像日期和位置,优于现有方法并结合多模态大语言模型实现新的SOTA结果。

Comments Preprint under review. Code available at https://github.com/jtonglet/arxiv2025-newsrecon

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13995 2026-01-21 cs.CL 50%

From Tags to Trees: Structuring Fine-Grained Knowledge for Controllable Data Selection in LLM Instruction Tuning

从标签到树:为LLM指令微调中的可控数据选择构建细粒度知识

Zihan Niu, Wenping Hu, Junmin Chen, Xiyue Wang, Tong Xu, Ruiming Tang

机构 * University of Science and Technology of China(中国科学技术大学) Klear Team, Kuaishou Technology(快手科技Klear团队)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 TAGS通过构建细粒度知识树,实现LLM指令微调中可控数据选择的高效采样与知识对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13384 2026-01-21 cs.SE cs.CL 50%

From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning

从补全到编辑:通过搜索和替换指令微调解锁上下文感知的代码填充

Jiajun Zhang, Zeyu Cui, Jiaxi Yang, Lei Zhang, Yuheng Jing, Zeyao Ma, Tianyi Bai, Zilei Wang, Qiang Liu, Liang Wang, Binyuan Hui, Junyang Lin

机构 * USTC(University of Science and Technology of China) Alibaba Group(阿里巴巴集团) CASIA(Chinese Academy of Sciences Institute of Automation) SIAT(Institute of Automation, Chinese Academy of Sciences)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 通过搜索和替换指令微调,SRI框架实现了上下文感知的代码填充,提升了补全性能并保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03648 2026-01-21 cs.CL 50%

ELO: Efficient Layer-Specific Optimization for Continual Pretraining of Multilingual LLMs

ELO:面向多语言大语言模型持续预训练的高效分层优化

HanGyeol Yoo, ChangSu Choi, Minjun Kim, Seohyun Song, SeungWoo Song, Inho Won, Jongyoul Park, Cheoneum Park, KyungTae Lim

机构 * Seoul National University of Science and Technology(首尔科学技术大学) LG CNS Korea Advanced Institute of Science and Technology(韩国科学技术院) Hanbat National University(汉 bat 国立大学)

专题命中 VLM训练与架构 :MLLM(abstract)

AI总结 ELO通过分层优化提升多语言大模型持续预训练效率,实现6.46倍加速和6.2%性能提升。

Comments 12 pages, Accepted to EACL 2026 (Industrial Track)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 2 篇

2503.09949 2026-01-21 cs.CV 70%

UVE: Are MLLMs Unified Evaluators for AI-Generated Videos?

UVE: MLLMs是否能作为AI生成视频的统一评估器?

Yuanxin Liu, Rui Zhu, Shuhuai Ren, Jiacong Wang, Haoyuan Guo, Xu Sun, Lu Jiang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ByteDance Seed(字节跳动种子) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文探讨使用多模态大语言模型作为AI生成视频的统一评估器的可行性,并通过UVE-Bench基准测试评估了18种MLLMs的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13133 2026-01-21 cs.CV 57%

CLIP-Guided Adaptable Self-Supervised Learning for Human-Centric Visual Tasks

面向人类的视觉任务的CLIP引导自监督学习

Mingshuang Luo, Ruibing Hou, Bo Chao, Hong Chang, Zimo Liu, Yaowei Wang, Shiguang Shan

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS), and University of Chinese Academy of Sciences(智能信息处理重点实验室,计算技术研究所(ICT),中国科学院(CAS)及中国科学院大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 CLASP通过CLIP生成多级语义伪标签,并结合Prompt-Controlled MoE模块提升迁移性,实现人类中心视觉任务的高效预训练。

Comments Accepted by TMM (IEEE Transactions on Multimedia), 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏