arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-05 至 2025-12-05 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 13 篇

2512.03783 2025-12-05 cs.AI cs.SD 83%

Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning

Omni-AutoThink: 通过强化学习实现自适应多模态推理

Dongchao Yang, Songxiang Liu, Disong Wang, Yuanyuan Wang, Guanglu Wan, Helen Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Meituan(美团)

专题命中 多模态评测 :multimodal(title,abstract);audio-visual(abstract);分类 cs.AI

AI总结 Omni-AutoThink通过强化学习实现自适应多模态推理,提升模型在不同任务难度下的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17773 2025-12-05 cs.CV cs.AI cs.CL cs.LG 82%

KiVA: Kid-inspired Visual Analogies for Testing Large Multimodal Models

KiVA:儿童启发的视觉类比用于测试大多模态模型

Eunice Yiu, Maan Qraitem, Anisa Noor Majhi, Charlie Wong, Yutong Bai, Shiry Ginosar, Alison Gopnik, Kate Saenko

机构 * University of California, Berkeley(加州大学伯克利分校) Boston University(波士顿大学) Google DeepMind(谷歌DeepMind) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 KiVA通过4300个日常物体视觉转换测试大模型的类比推理能力,发现儿童和成人表现优于现有模型,尤其在复杂任务上存在显著差距。

Comments 10 pages. Project website: https://ey242.github.io/kiva.github.io/. Benchmark and code: https://github.com/ey242/KiVA

Journal ref The Thirteenth International Conference on Learning Representations (ICLR), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01424 2025-12-05 cs.CV 79%

ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models

ViRectify:一种用于多模态大语言模型视频推理纠错的挑战性基准

Xusen Hei, Jiali Chen, Jinyu Yang, Mengchen Zhao, Yi Cai

机构 * South China University of Technology(华南理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 ViRectify是一个用于评估多模态大语言模型视频推理纠错能力的挑战性基准,通过构建大规模数据集和提出轨迹证据驱动的纠正框架,验证了模型在纠错任务中的性能差异。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09321 2025-12-05 cs.CV cs.AI cs.LG 73%

DAVE: Diagnostic benchmark for Audio Visual Evaluation

DAVE: 音频视觉评估诊断基准

Gorjan Radevski, Teodora Popordanoska, Matthew B. Blaschko, Tinne Tuytelaars

机构 * KU Leuven(卢森堡大学)

专题命中 多模态评测 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 DAVE提出一个诊断基准,通过确保两种模态必要性及分解评估子类,解决多模态模型评估中的视觉偏见问题,提供更精准的模型诊断与改进指导。

Comments First two authors contributed equally

Journal ref NeurIPS 2025 Datasets & Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09080 2025-12-05 cs.AI 70%

BioAnalyst: A Foundation Model for Biodiversity

BioAnalyst: 一种用于生物多样性的基础模型

Athanasios Trantas, Martino Mensio, Stylianos Stasinos, Sebastian Gribincea, Taimur Khan, Damian Podareanu, Aliene van der Veen

机构 * Nederlandse Organisatie voor Toegepast Natuurwetenschappelijk Onderzoek – TNO(荷兰应用自然科学研究院 – TNO) Eindhoven University of Technology(埃因霍温理工大学) Amazon(亚马逊) University of Groningen(格罗宁根大学) Helmholtz Center for Environmental Research – UFZ(环境研究赫尔姆霍茨中心 – UFZ) SURF

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 BioAnalyst是一种针对生物多样性分析和保护规划的多模态基础模型,通过预训练和微调实现物种分布建模和生态预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05091 2025-12-05 cs.CV 57%

Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark

视觉推理追踪器:对象级 grounded 推理基准

Haobo Yuan, Yueyi Sun, Yanwei Li, Tao Zhang, Xueqing Deng, Henghui Ding, Lu Qi, Anran Wang, Xiangtai Li, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) PKU(北京大学) NTU(国立台湾大学) CUHK(香港中文大学) WHU(武汉大学) FDU(福建大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出视觉推理追踪器任务,通过对象级 grounded 推理基准评估模型的推理路径生成能力,并引入了新的评估指标和大规模数据集提升模型推理表现。

Comments Technical Report; Project Page: https://harboryuan.github.io/visual-reasoning-tracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04660 2025-12-05 cs.CV 57%

I2I-Bench: A Comprehensive Benchmark Suite for Image-to-Image Editing Models

I2I-Bench: 一种全面的图像到图像编辑模型评估套件

Juntong Wang, Jiarui Wang, Huiyu Duan, Jiaxiang Kang, Guangtao Zhai, Xiongkuo Min

机构 * Institute of Image Communication and Network Engineering(图像通信与网络工程研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 I2I-Bench 提出了一种全面的图像到图像编辑模型评估套件,通过多样化的任务、全面的评估维度和严格的对齐验证,评估主流图像编辑模型的性能和权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04105 2025-12-05 cs.CY cs.AI cs.HC 57%

LegalWebAgent: Empowering Access to Justice via LLM-Based Web Agents

LegalWebAgent:通过基于大语言模型的网络代理赋能正义获取

Jinzhe Tan, Karim Benyekhlef

机构 * Cyberjustice Laboratory, Faculty of Law, University of Montreal, Canada(法律正义实验室,法学院,蒙特利尔大学,加拿大)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 LegalWebAgent通过多模态大语言模型实现网络代理,解决普通公民在法律问题中的获取障碍,实现从查询到行动的全流程自动化,实验结果显示其在复杂场景中的高自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04479 2025-12-05 cs.CL 57%

ThaiOCRBench: A Task-Diverse Benchmark for Vision-Language Understanding in Thai

ThaiOCRBench: 一种任务多样化的泰语视觉-语言理解基准

Surapon Nonesung, Teetouch Jaknamon, Sirinya Chaiophat, Natapong Nitarach, Chanakan Wittayasakpan, Warit Sirichotedumrong, Adisai Na-Thalang, Kunat Pipatanakul

机构 * SCB 10X R&D(SCB 10X研发部) SCB 10X SCBX Group(SCBX集团)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 ThaiOCRBench是一个针对泰语视觉-语言理解任务的多样化基准,通过人工标注的数据集评估了多种VLMs,揭示了专有模型在性能上的优势及开源模型在细粒度文本识别中的挑战。

Comments Accepted at IJCNLP-AACL 2025 (Main). This version includes the corrected Table 2 and an updated conclusion regarding the deletion count of the Gemma model

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04125 2025-12-05 cs.LG 56%

ASCIIBench: Evaluating Language-Model-Based Understanding of Visually-Oriented Text

ASCIIBench: 评估基于语言模型的视觉文本理解

Kerry Luo, Michael Fu, Joshua Peguero, Husnain Malik, Anvay Patil, Joyce Lin, Megan Van Overborg, Ryan Sarmiento, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 多模态评测 :multimodal(abstract,comments)

AI总结 ASCIIBench通过评估LLM生成ASCII艺术的性能,揭示了多模态表示的局限性,并推动了针对符号视觉模态的新方法发展。

Comments Accepted to The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025): LLM Evaluation Workshop & Multimodal Algorithmic Reasoning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05080 2025-12-05 cs.LG 50%

OMTRA: A Multi-Task Generative Model for Structure-Based Drug Design

OMTRA: 一种基于结构的药物设计多任务生成模型

Ian Dunn, Liv Toft, Tyler Katz, Juhi Gupta, Riya Shah, Ramith Hettiarachchi, David R. Koes

机构 * Department of Computational and Systems Biology, School of Medicine, University of Pittsburgh(计算生物学系,医学院,匹兹堡大学) Ray and Stephanie Lane Computational Biology Department, School of Computer Science, Carnegie Mellon University(Ray和Stephanie Lane计算生物学系,计算机科学学院,卡内基梅隆大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 OMTRA是一种多任务生成模型,用于基于结构的药物设计,通过多模态流匹配模型实现多种相关任务的统一框架,提升了从头设计和对接性能。

Comments Presented at the Machine Learning for Structural Biology Workshop, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21584 2025-12-05 stat.ML cs.LG 50%

IndiSeek learns information-guided disentangled representations

IndiSeek 学习信息引导的解耦表示

Yu Gui, Cong Ma, Zongming Ma

机构 * Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计与数据科学系) Department of Statistics, University of Chicago(芝加哥大学统计系) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 IndiSeek通过结合独立性强制目标和高效重建损失,有效学习信息引导的解耦表示,提升多模态学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16702 2025-12-05 cs.HC 50%

Truth and Trust: Fake News Detection via Biosignals

真实与信任:通过生物信号进行假新闻检测

Gennie Nguyen, Lei Wang, Yangxueqing Jiang, Tom Gedeon

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究通过分析EDA和PPG信号,探讨了生物信号在假新闻检测中的应用,发现EDA在检测真实性方面表现更优,但联合信念与真实性的分类任务面临挑战。

Comments Research report

Journal ref International Journal of Information Technology (BJIT), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏