arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-23 至 2026-01-23 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2601.15487 2026-01-23 cs.AI cs.CL cs.MA 81%

MiRAGE: A Multiagent Framework for Generating Multimodal Multihop Question-Answer Dataset for RAG Evaluation

MiRAGE:一种多智能体框架,用于生成多模态多跳问题-答案数据集以评估RAG系统

Chandan Kumar Sahu, Premith Kumar Chilukuri, Matthew Hetrich

机构 * ABB Inc(ABB公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 MiRAGE通过多智能体框架生成多模态多跳问题-答案数据集,提升RAG系统评估的准确性和复杂性。

Comments 12 pages, 2 figures, Submitted to ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21143 2026-01-23 cs.CL cs.CV 81%

The Percept-V Challenge: Can Multimodal LLMs Crack Simple Perception Problems?

感知挑战:多模态大语言模型能否解决简单感知问题?

Samrajnee Ghosh, Naman Agarwal, Hemanshu Garg, Chinmay Mittal, Mausam, Parag Singla

机构 * IIT Delhi(德里印度理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 Percept-V挑战通过简单感知任务测试多模态大语言模型的表现,发现其在基本感知任务上远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10883 2026-01-23 cs.AI cs.CL 81%

Chat-TS: Enhancing Multi-Modal Reasoning Over Time-Series and Natural Language Data

Chat-TS: 提升时间序列与自然语言数据的多模态推理能力

Paul Quinlan, Qingguo Li, Xiaodan Zhu

机构 * Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程学院) Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程学院) Ingenuity Labs Research Institute, Queen’s University(皇后大学创新实验室研究 institute)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 Chat-TS通过整合时间序列标记提升多模态推理能力,提供新数据集和训练策略,在保持自然语言能力的同时增强时间序列推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15406 2026-01-23 cs.CV 79%

Evaluating Multimodal Large Language Models for Heterogeneous Face Recognition

评估多模态大语言模型用于异构人脸识别

Hatef Otroshi Shahreza, Anjith George, Sébastien Marcel

机构 * Idiap Research Institute(日内瓦研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文评估了多模态大语言模型在异构人脸识别中的性能,发现其在跨模态条件下表现欠佳,凸显了当前模型的局限性及生物识别评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05577 2026-01-23 cs.LG cs.AI 79%

PyTDC: A multimodal machine learning training, evaluation, and inference platform for biomedical foundation models

PyTDC: 一种用于生物医学基础模型的多模态机器学习训练、评估和推理平台

Alejandro Velez-Arce, Jesus Caraballo, Marinka Zitnik

机构 * arcellai(ArcellAI公司) calculus(The Residency公司) mit(麻省理工学院) hms(哈佛医学院生物医学信息学系) broad(MIT与哈佛大学Broad研究所) harvard-ds(哈佛大学数据科学倡议) kempner(哈佛大学Kempner研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 PyTDC是一种多模态机器学习平台,旨在提升生物医学基础模型的训练、评估和推理能力,通过统一数据源和模型权重,促进多模态、上下文感知的研究。

Comments Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11558 2026-01-23 cs.DB 78%

Bridging Radiology and Pathology: A DICOM-Based Framework for Multimodal Mapping and Integrated Visualization

连接放射学与病理科:基于DICOM的多模态映射与集成可视化框架

Nilesh P. Rijhwani, Titus J. Brinker, Peter Neher, Marco Nolden, Klaus Maier-Hein, Maximilian Fischer, Christoph Wies

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究提出一种基于DICOM的跨学科工具,通过多模态映射和集成可视化,促进放射学与病理科的协同分析与研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18457 2026-01-23 cs.LG cs.CV 74%

Radiation-Preserving Selective Imaging for Pediatric Hip Dysplasia: A Cross-Modal Ultrasound-Xray Policy with Limited Labels

辐射保护的儿童髋关节发育不良选择性成像:一种跨模态超声-X射线策略(有限标注)

Duncan Stothers, Ben Stothers, Emily Schaeffer, Kishore Mulpuri

专题命中 多模态评测 :cross-modal(title);分类 cs.CV

AI总结 本文提出了一种跨模态超声-X光策略,通过有限标注实现儿童髋关节发育不良的可解释测量和选择性成像。

Comments Accepted (with oral presentation) to the AAAI 2026 AI for Medicine and Healthcare Bridge Program Awarded Best Paper Runner-Up at the AAAI 2026 AI for Medicine and Healthcare Bridge Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15711 2026-01-23 cs.CV 57%

Zero-Shot Product Attribute Labeling with Vision-Language Models: A Three-Tier Evaluation Framework

基于视觉-语言模型的零样本产品属性标注:一种三级评估框架

Shubham Shukla, Kunal Sonalkar

机构 * Nordstrom(诺德斯特拉姆)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种三级评估框架,评估视觉-语言模型在多属性服装任务中的零样本属性标注性能,发现高效模型在成本较低时能实现接近旗舰级性能,揭示了属性适用性检测是关键瓶颈。

Comments Accepted to WACV 2026 Workshop on Physical Retail AI (PRAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15385 2026-01-23 cs.HC cs.CL 57%

VegaChat: A Robust Framework for LLM-Based Chart Generation and Assessment

VegaChat: 一种基于大语言模型的图表生成与评估稳健框架

Marko Hostnik, Rauf Kurbanov, Yaroslav Sokolov, Artem Trofimov

机构 * JetBrains

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 VegaChat通过引入Spec Score和Vision Score两个指标,解决了LLM基于自然语言生成可视化中的评估难题,实现了高准确率的图表生成与评估。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15211 2026-01-23 cs.AI stat.AP 57%

Embracing Ambiguity: Bayesian Nonparametrics and Stakeholder Participation for Ambiguity-Aware Safety Evaluation

拥抱模糊性:基于贝叶斯非参数方法和利益相关者参与的模糊性感知安全评估

Yanan Long

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种基于贝叶斯非参数方法和利益相关者参与的框架,用于模糊性感知的安全评估,通过量化尾部风险和整合利益相关者偏好提升生成模型的可信度。

Comments AAAI 2026 workshop MURE

详情

展开后加载摘要…

URL PDF HTML 收藏