arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-16 至 2026-02-16 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 5 篇

2602.12641 2026-02-16 cs.NI cs.AI cs.HC cs.MM 83%

Artic: AI-oriented Real-time Communication for MLLM Video Assistant

Artic: 面向AI的实时通信用于多模态大语言模型视频助手

Jiangkai Wu, Zhiyuan Ren, Junquan Zhong, Liming Liu, Xinggong Zhang

机构 * Peking University(北京大学)

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 Artic提出了一种面向AI的实时通信框架,通过自适应比特率、上下文感知流式传输和退化视频理解基准提升多模态大语言模型视频助手的准确性和降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01091 2026-02-16 cs.CV cs.AI 81%

Any-to-Any Vision-Language Model for Multimodal X-ray Imaging and Radiological Report Generation

任意到任意的视觉-语言模型用于多模态X射线成像与放射学报告生成

Daniele Molino, Francesco di Feola, Linlin Shen, Paolo Soda, Valerio Guarrasi

机构 * Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入部门,生物医学工程与放射物理,乌梅大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种任意到任意的视觉-语言模型,用于多模态X射线成像和放射学报告生成,通过生成高质量图像和语义连贯的报告,提升了医疗领域生成模型的临床应用价值。

Comments arXiv admin note: substantial text overlap with arXiv:2501.04614

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12533 2026-02-16 cs.LG 57%

AMPS: Adaptive Modality Preference Steering via Functional Entropy

AMPS: 通过功能熵实现自适应模态偏好引导

Zihan Huang, Xintong Li, Rohan Surana, Tong Yu, Rui Wang, Julian McAuley, Jingbo Shang, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

AI总结 AMPS通过实例感知的诊断度量和可学习模块,实现对多模态大语言模型模态偏好的自适应引导,有效调节偏好并降低生成错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12302 2026-02-16 cs.CL cs.CV 57%

Grandes Modelos de Linguagem Multimodais (MLLMs): Da Teoria à Prática

大规模多模态语言模型(MLLMs):从理论到实践

Neemias da Silva, Júlio C. W. Scholz, John Harrison, Marina Borges, Paulo Ávila, Frances A Santos, Myriam Delgado, Rodrigo Minetto, Thiago H Silva

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文介绍了多模态大语言模型(MLLMs)的理论基础和实践方法,探讨了预处理、提示工程及多模态管道构建技术,并提供了补充材料供进一步研究。

Comments in Portuguese language. Accepted book chapter - Webmedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12942 2026-02-16 eess.SP 50%

HoRAMA: Holistic Reconstruction with Automated Material Assignment for Ray Tracing using NYURay

基于NYURay的Holistic Reconstruction with Automated Material Assignment用于射线追踪的全面重建

Mingjun Ying, Guanyue Qian, Xinquan Wang, Peijie Ma, Dipankar Shakya, Theodore S. Rappaport

专题命中 其他VLM :vision language model(abstract)

AI总结 HoRAMA通过结合MASt3R-SLAM和视觉语言模型实现快速生成RT兼容的3D模型,提升无线传播预测精度并缩短重建时间。

Comments 7 pages, 4 figures, 2 tables, accepted by 2026 IEEE International Conference on Communications (ICC)

详情

展开后加载摘要…

URL PDF HTML 收藏