arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-08 至 2025-12-08 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2511.16334 2025-12-08 cs.AI cs.CL 81%

OpenMMReasoner: Pushing the Frontiers for Multimodal Reasoning with an Open and General Recipe

OpenMMReasoner: 推动多模态推理的前沿研究:一个开放且通用的配方

Kaichen Zhang, Keming Wu, Zuhao Yang, Bo Li, Kairui Hu, Bin Wang, Ziwei Liu, Xingxuan Li, Lidong Bing

机构 * MiroMind AI Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) LMMs-Lab Team(多模态实验室团队)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 OpenMMReasoner提出了一种开放且通用的多模态推理训练配方,通过两阶段方法提升推理性能,实现在多个基准测试中超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05930 2025-12-08 cs.AI 79%

PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation

PRiSM:一种基于Python基础评估的科学推理多模态基准

Shima Imani, Seungwhan Moon, Adel Ahmadyan, Lu Zhang, Kirmani Ahmed, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 PRiSM通过基于Python代码的动态多模态基准,评估科学推理能力,揭示VLMs在科学领域中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02738 2025-12-08 cs.CV 79%

Open-PMC-18M: A High-Fidelity Large Scale Medical Dataset for Multimodal Representation Learning

Open-PMC-18M: 一种高保真大规模医学数据集用于多模态表示学习

Negin Baghbanzadeh, Mohammed Saidul Islam, Sajad Ashkezari, Elham Dolatabadi, Arash Afkanpour

机构 * Vector Institute(Vector研究所) York University(约克大学) University of Waterloo(滑铁卢大学)

专题命中 多模态评测 :multimodal(title);image-text(abstract);分类 cs.CV

AI总结 Open-PMC-18M通过高保真医学数据集提升多模态表示学习性能,实现子图提取与上下文丰富化,支持多种视觉-语言任务。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20454 2025-12-08 eess.IV cs.CV 79%

LymphAtlas- A Unified Multimodal Lymphoma Imaging Repository Delivering AI-Enhanced Diagnostic Insight

LymphAtlas- 一种统一的多模态淋巴瘤影像存储库,提供人工智能增强的诊断洞察

Jiajun Ding, Beiyao Zhu, Xiaosheng Liu, Lishen Zhang, Zhao Liu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 LymphAtlas通过整合PET与CT数据,构建高质量多模态数据集,提升淋巴瘤分割精度与临床应用价值。

Comments 12 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05119 2025-12-08 cs.IR cs.AI cs.CL 73%

RAG-IGBench: Innovative Evaluation for RAG-based Interleaved Generation in Open-domain Question Answering

RAG-IGBench: 用于开放领域问答中基于检索增强生成的交错生成的创新评估

Rongyang Zhang, Yuqing Huang, Chengqiang Lu, Qimeng Wang, Yan Gao, Yi Wu, Yao Hu, Yin Xu, Wei Wang, Hao Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Xiaohongshu Inc.(小红书公司) Xi’an Jiaotong University(西安交通大学)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 RAG-IGBench通过创新的评估指标和多模态数据,评估基于检索增强生成的交错生成任务,验证了模型在开放领域问答中的性能提升。

Comments 26 pages, 6 figures, NeurIPS 2025 D&B Track poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05557 2025-12-08 cs.CV cs.AI 62%

2K-Characters-10K-Stories: A Quality-Gated Stylized Narrative Dataset with Disentangled Control and Sequence Consistency

2K角色-10K故事:一个具有解耦控制和序列一致性的质量门控风格化叙事数据集

Xingxi Yin, Yicheng Li, Gong Yan, Chenglin Li, Jian Zhao, Cong Huang, Yue Deng, Yin Zhang

机构 * Zhejiang University(浙江大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出2K-Characters-10K-Stories数据集,通过解耦控制和质量门控机制,实现高质量的风格化叙事生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05950 2025-12-08 cs.LG cs.AI 57%

Impugan: Learning Conditional Generative Models for Robust Data Imputation

Impugan:用于鲁棒数据填补的条件生成模型

Zalish Mahmud, Anantaa Kotal, Aritran Piplai

机构 * Computer Science(计算机科学) The University of Texas at El Paso(德克萨斯理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 Impugan通过条件生成对抗网络实现鲁棒的数据填补与异质数据集整合,有效处理复杂数据中的缺失值问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05122 2025-12-08 cs.AI 57%

Documenting SME Processes with Conversational AI: From Tacit Knowledge to BPMN

用对话式AI记录中小企业流程:从隐性知识到BPMN

Unnikrishnan Radhakrishnan

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的对话助手,通过访谈式对话将中小企业隐性知识转化为BPMN图表,实现流程文档化,降低文档化门槛,提升运营透明度。

Comments Presented at 2025 International Workshop on Low-Cost Digital Solutions for Industrial Automation (LODISA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15747 2025-12-08 cs.CV eess.IV 57%

A Strong View-Free Baseline Approach for Single-View Image Guided Point Cloud Completion

一种强视图无关的单视图图像引导点云补全基线方法

Fangzhou Lin, Zilin Dai, Rigved Sanku, Songlin Hou, Kazunori D Yamada, Haichong K. Zhang, Ziming Zhang

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute(机器人工程系,沃斯特理工学院) Dell Technologies(戴尔技术) Graduate School of Information Sciences, Tohoku University(信息科学研究生院,东北大学) Department of Computer Science, Worcester Polytechnic Institute(计算机科学系,沃斯特理工学院) Harvard Kenneth C. Griffin Graduate School of Arts and Sciences(哈佛肯尼斯·C·格里芬艺术与科学研究生院) Department of Biomedical Engineering, Worcester Polytechnic Institute(生物医学工程系,沃斯特理工学院) Department of Electrical & Computer Engineering, Worcester Polytechnic Institute(电气与计算机工程系,沃斯特理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种视图无关的单视图图像引导点云补全基线方法,通过多分支编码器-解码器网络和层次自融合机制,有效提升点云补全性能。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15436 2025-12-08 cs.CV 57%

Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs

基于动态视觉搜索和缩放的自适应聚焦推理方法用于高效VLMs

Xintong Zhang, Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaowen Zhang, Yang Liu, Tao Yuan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li

机构 * organization= School of Computer Science \& Technology, Beijing Institute of Technology , city= Beijing , country= China organization= State Key Laboratory of General Artificial Intelligence, BIGAI , city= Beijing , country= China organization= School of Intelligence Science Technology, Peking University , city= Beijing , country= China organization= Guangdong Laboratory of Machine Perception Intelligent Computing, Shenzhen MSU--BIT University , city= Shenzhen , country= China organization= Department of Automation, Tsinghua University , city= Beijing , country= China

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于动态视觉搜索和缩放的自适应聚焦推理方法,提升VLMs的多模态推理效率和实际应用效果。

Comments https://github.com/xtong-zhang/Chain-of-Focus

详情

展开后加载摘要…

URL PDF HTML 收藏