arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-04 至 2025-12-04 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 4 篇

2512.03542 2025-12-04 cs.CV cs.AI 84%

V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention

V-ITI: 通过视觉推理时间干预缓解多模态大语言模型中的幻觉

Nan Sun, Zhenyu Zhang, Xixun Lin, Kun Wang, Yanmin Shang, Naibin Gu, Shuohuan Wang, Yu Sun, Hua Wu, Haifeng Wang, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 V-ITI通过视觉推理时间干预框架,有效缓解多模态大语言模型中的视觉相关幻觉问题,同时保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03623 2025-12-04 cs.LG cs.AI physics.ao-ph 81%

The promising potential of vision language models for the generation of textual weather forecasts

视觉语言模型在生成文本天气预报中的巨大潜力

Edward C. C. Steele, Dinesh Mane, Emilio Monti, Luis Orus, Rebecca Chantrill-Cheyette, Matthew Couch, Kirstine I. Dale, Simon Eaton, Govindarajan Rangarajan, Amir Majlesi, Steven Ramsdale, Michael Sharpe, Craig Smith, Jonathan Smith, Rebecca Yates, Holly Ellis, Charles Ewen

机构 * Met Office(英国气象局) Amazon Web Services(亚马逊网络服务) University of East Anglia(东安格利亚大学)

专题命中 其他VLM :vision language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在直接生成文本天气预报中的潜力,通过视频编码的格网天气数据提升气象服务的生产效率与创新。

Comments 7 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23315 2025-12-04 cs.AI cs.CE cs.LG 62%

AI Agents in Engineering Design: A Multi-Agent Framework for Aesthetic and Aerodynamic Car Design

工程设计中的AI代理:一种用于汽车外观和空气动力学设计的多代理框架

Mohamed Elrefaie, Janet Qian, Raina Wu, Qian Chen, Angela Dai, Faez Ahmed

机构 * Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院机械工程系) Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院电气工程与计算机科学系) Department of Computer Science, Technical University of Munich, Munich, Germany(慕尼黑技术大学计算机科学系)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种多代理框架,利用AI代理提升汽车设计的美学和空气动力学性能,通过自动化任务加速设计流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05127 2025-12-04 eess.IV cs.CV q-bio.QM 57%

PixCell: A generative foundation model for digital histopathology images

PixCell:数字病理图像的生成基础模型

Srikar Yellapragada, Alexandros Graikos, Zilinghan Li, Kostas Triaridis, Varun Belagali, Tarak Nath Nandi, Karen Bai, Beatrice S. Knudsen, Tahsin Kurc, Rajarsi R. Gupta, Prateek Prasanna, Ravi K Madduri, Joel Saltz, Dimitris Samaras

机构 * Stony Brook University(石溪大学) Argonne National Laboratory(阿贡国家实验室) The University of Chicago(芝加哥大学) University of Utah(犹他大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 PixCell是首个针对数字病理图像的生成基础模型,通过扩散模型在大规模数据集上训练,实现隐私保护的数据生成和虚拟染色任务,提升病理学研究效率。

Comments Project page - https://histodiffusion.github.io/docs/projects/pixcell

详情

展开后加载摘要…

URL PDF HTML 收藏