arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-16 至 2026-02-16 共收录 40 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 11 篇

2509.21370 2026-02-16 cs.RO cs.CV 70%

Language-in-the-Loop Culvert Inspection on the Erie Canal

Erie运河的循环检测

Yash Turkar, Yashom Dighe, Karthik Dantu

机构 * Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 VISION通过结合视觉-语言模型和受限视角规划,实现Erie运河涵洞的自主检测,生成高分辨率图像并提升专家评估一致性。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12205 2026-02-16 cs.CV cs.AI 62%

DeepGen 1.0: A Lightweight Unified Multimodal Model for Advancing Image Generation and Editing

DeepGen 1.0: 一种轻量级统一多模态模型,用于推进图像生成与编辑

Dianyi Wang, Ruihang Li, Feng Han, Chaofan Ma, Wei Song, Siyuan Wang, Yibin Wang, Yi Xin, Hongjian Liu, Zhixiong Zhang, Shengyuan Ding, Tianhang Wang, Zhenglin Cheng, Tao Lin, Cheng Jin, Kaicheng Yu, Jingjing Chen, Wenjie Wang, Zhongyu Wei, Jiaqi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Nanjing University(南京大学) University of Southern California(南加州大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 DeepGen 1.0通过轻量级统一多模态模型在图像生成与编辑领域实现高性能,采用SCB框架和数据驱动训练策略,超越大参数模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04884 2026-02-16 cs.CL cs.CV cs.LG 62%

Reinforced Attention Learning

强化注意力学习

Bangzheng Li, Jianmo Ni, Chen Qu, Ian Miao, Liu Yang, Xingyu Fu, Muhao Chen, Derek Zhiyuan Cheng

机构 * UC Davis(加州大学戴维斯分校) Google(谷歌) DeepMind(深Mind) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 强化注意力学习通过优化内部注意力分布提升多模态模型的感知能力,实验显示其在多模态后期训练中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12936 2026-02-16 cs.CV 57%

Unleashing MLLMs on the Edge: A Unified Framework for Cross-Modal ReID via Adaptive SVD Distillation

在边缘侧释放MLLMs:通过自适应SVD蒸馏实现跨模态重识别的统一框架

Hongbo Jiang, Jie Li, Xinqi Cai, Tianyu Xie, Yunhang Shen, Pingyang Dai, Liujuan Cao

机构 * Tencent Youtu Lab, Shanghai, China(腾讯优图实验室,上海,中国) Xiamen University, Media Analytics(厦门大学,媒体分析) Computing Lab, Department of Artificial Intelligence, School of Informatics, Xiamen, China(计算实验室,人工智能系,信息学院,厦门,中国)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 本文提出MLLMEmbed-ReID框架,通过自适应SVD蒸馏实现跨模态重识别的统一部署,结合云-边缘架构提升性能与效率。

Comments Equal contribution by Jie Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12311 2026-02-16 cs.SE cs.AI 57%

Perceptual Self-Reflection in Agentic Physics Simulation Code Generation

感知性自我反思在代理物理模拟代码生成中的应用

Prashant Shende, Bradley Camburn

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种多代理框架,通过感知性自我反思机制提升物理模拟代码生成的准确性与稳定性,验证了视觉反馈在物理模拟任务中的有效性。

Comments 15 pages, 2 figures, 2 tables. Introduces a multi-agent architecture for physics simulation code generation with perceptual self-reflection via vision-based validation. Includes qualitative evaluation across multiple physics domains

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 5 篇

2602.12641 2026-02-16 cs.NI cs.AI cs.HC cs.MM 83%

Artic: AI-oriented Real-time Communication for MLLM Video Assistant

Artic: 面向AI的实时通信用于多模态大语言模型视频助手

Jiangkai Wu, Zhiyuan Ren, Junquan Zhong, Liming Liu, Xinggong Zhang

机构 * Peking University(北京大学)

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 Artic提出了一种面向AI的实时通信框架,通过自适应比特率、上下文感知流式传输和退化视频理解基准提升多模态大语言模型视频助手的准确性和降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01091 2026-02-16 cs.CV cs.AI 81%

Any-to-Any Vision-Language Model for Multimodal X-ray Imaging and Radiological Report Generation

任意到任意的视觉-语言模型用于多模态X射线成像与放射学报告生成

Daniele Molino, Francesco di Feola, Linlin Shen, Paolo Soda, Valerio Guarrasi

机构 * Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入部门,生物医学工程与放射物理,乌梅大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种任意到任意的视觉-语言模型,用于多模态X射线成像和放射学报告生成,通过生成高质量图像和语义连贯的报告,提升了医疗领域生成模型的临床应用价值。

Comments arXiv admin note: substantial text overlap with arXiv:2501.04614

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12533 2026-02-16 cs.LG 57%

AMPS: Adaptive Modality Preference Steering via Functional Entropy

AMPS: 通过功能熵实现自适应模态偏好引导

Zihan Huang, Xintong Li, Rohan Surana, Tong Yu, Rui Wang, Julian McAuley, Jingbo Shang, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

AI总结 AMPS通过实例感知的诊断度量和可学习模块,实现对多模态大语言模型模态偏好的自适应引导,有效调节偏好并降低生成错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12302 2026-02-16 cs.CL cs.CV 57%

Grandes Modelos de Linguagem Multimodais (MLLMs): Da Teoria à Prática

大规模多模态语言模型(MLLMs):从理论到实践

Neemias da Silva, Júlio C. W. Scholz, John Harrison, Marina Borges, Paulo Ávila, Frances A Santos, Myriam Delgado, Rodrigo Minetto, Thiago H Silva

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文介绍了多模态大语言模型(MLLMs)的理论基础和实践方法,探讨了预处理、提示工程及多模态管道构建技术,并提供了补充材料供进一步研究。

Comments in Portuguese language. Accepted book chapter - Webmedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12942 2026-02-16 eess.SP 50%

HoRAMA: Holistic Reconstruction with Automated Material Assignment for Ray Tracing using NYURay

基于NYURay的Holistic Reconstruction with Automated Material Assignment用于射线追踪的全面重建

Mingjun Ying, Guanyue Qian, Xinquan Wang, Peijie Ma, Dipankar Shakya, Theodore S. Rappaport

专题命中 其他VLM :vision language model(abstract)

AI总结 HoRAMA通过结合MASt3R-SLAM和视觉语言模型实现快速生成RT兼容的3D模型,提升无线传播预测精度并缩短重建时间。

Comments 7 pages, 4 figures, 2 tables, accepted by 2026 IEEE International Conference on Communications (ICC)

详情

展开后加载摘要…

URL PDF HTML 收藏