arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-15 至 2025-12-15 共收录 42 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 8 篇

2512.11323 2025-12-15 cs.AI 57%

CAPTURE: A Benchmark and Evaluation for LVLMs in CAPTCHA Resolving

CAPTURE:一个用于LVLM在CAPTCHA解决中的基准和评估

Jianyi Zhang, Ziyin Zhou, Xu Ji, Shizhao Liu, Zhangchi Zhao

机构 * Beijing Electric Science and Technology Institute(北京电子科技研究所)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 CAPTURE是一个专为LVLM设计的CAPTCHA基准,涵盖4种主要类型和25种子类型,旨在全面评估LVLM在解决CAPTCHA任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10257 2025-12-15 cs.HC 50%

Reject or Not?: A Benchmark for Voice Assistant Query Rejection in Smart Home Scenario and an Improved Method Based on LLMs

拒绝或不?:智能家庭场景下的语音助手查询拒绝基准及基于LLM的改进方法

Huichao Men, Yizhen Hu, Yingyang He, Yu Gao, Xiaofeng Mou, Yi Xu

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出面向智能家庭场景的语音助手查询拒绝基准及基于LLM的改进方法,通过构建多模态数据集和三级协作架构提升拒绝准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 3 篇

2512.10975 2025-12-15 cs.LG cs.AI cs.HC cs.MA 79%

Agent-Based Modular Learning for Multimodal Emotion Recognition in Human-Agent Systems

基于代理的模块化学习:人类-代理系统中多模态情感识别

Matvey Nepomnyaschiy, Oleg Pereziabov, Anvar Tliamov, Stanislav Mikhailov, Ilya Afanasyev

机构 * Research Center of the Artificial Intelligence Institute, Innopolis University(人工智能研究所研究中心,因诺波利斯大学) ITMO University(ITMO大学) Saint Petersburg Electrotechnical University ``LETI''(圣彼得堡电工大学『LETI』)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于代理的模块化学习框架,用于多模态情感识别,通过自主代理协调实现灵活、高效的训练和维护。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07410 2025-12-15 cs.CV 57%

InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs

InterAgent:基于物理的多智能体命令执行通过交互图上的扩散

Bin Li, Ruichi Zhang, Han Liang, Jingyan Zhang, Juze Zhang, Xin Chen, Lan Xu, Jingyi Yu, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) University of Pennsylvania(宾夕法尼亚大学) ByteDance(字节跳动) Stanford University(斯坦福大学) InstAdapt

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

AI总结 InterAgent通过交互图上的扩散模型实现了基于物理的多智能体协调控制,能够从文本提示中生成连贯且物理合理的多代理行为。

Comments Project page: https://binlee26.github.io/InterAgent-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11620 2025-12-15 cs.RO cs.SY eess.SY 50%

Architecting Large Action Models for Human-in-the-Loop Intelligent Robots

为具有人类在环的智能机器人构建大型动作模型

Kanisorn Sangchai, Methasit Boonpun, Withawin Kraipetchara, Paulo Garcia

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文提出通过整合符号方法与现成模型构建可验证的神经符号智能机器人动作模型,以提升可靠性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 5 篇

2409.13115 2025-12-15 eess.IV cs.AI cs.CV 84%

Multimodal Learning for Scalable Representation of High-Dimensional Medical Data

多模态学习用于高维医学数据的可扩展表示

Areej Alsaafin, Abubakr Shafique, Saghir Alfasly, Krishna R. Kalari, H. R. Tizhoosh

机构 * Kimia Lab, Dept. of Artificial Intelligence & Informatics, Mayo Clinic, Rochester, MN, USA(Kimia实验室,人工智能与信息学系,梅奥诊所,罗切斯特,MN,美国) Division of Computational Biology, Dept. of Quantitative Health Sciences, Mayo Clinic, Rochester, MN, USA(计算生物学部门,定量健康科学系,梅奥诊所,罗切斯特,MN,美国)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MarbliX通过多模态学习实现高维医学数据的可扩展表示,提升癌症诊断的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19312 2025-12-15 eess.SP cs.AI cs.IT cs.LG math.IT 83%

E2E Learning Massive MIMO for Multimodal Semantic Non-Orthogonal Transmission and Fusion

端到端学习大规模MIMO用于多模态语义非正交传输与融合

Minghui Wu, Zhen Gao

机构 * School of Information and Electronics, Beijing Institute of Technology (BIT)(信息与电子学院,北京理工大学) State Key Laboratory of Environment Characteristics and Effects for Near-space, Beijing(临近空间环境特征与效应国家重点实验室,北京) State Key Laboratory of CNS/ATM, Beijing(CNS/ATM国家重点实验室,北京) MIIT Key Laboratory of Complex-Field Intelligent Sensing, Beijing(工信部复杂场智能感知重点实验室,北京) BIT, Zhuhai(珠海北京理工大学) Advanced Technology Research Institute, BIT, Jinan(北京理工大学济南先进技术研究院) Yangtze Delta Region Academy, BIT, Jiaxing(长江三角洲地区学院,北京理工大学嘉兴)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出了一种端到端学习的多模态语义非正交传输与融合框架,通过联合优化物理层和应用层任务提升大规模MIMO的频谱效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11738 2025-12-15 q-bio.NC 50%

Multiscale Causal Geometric Deep Learning for Modeling Brain Structure

多尺度因果几何深度学习用于建模大脑结构

Chengzhi Xia, Jianwei Chen, Yixuan Jiang, Qi Yan, Chao Li

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出一种多尺度因果几何深度学习方法,通过多模态MRI整合与谱图理论实现大脑结构建模,提升模型的可解释性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11334 2025-12-15 cs.LG 50%

Spectral entropy prior-guided deep feature fusion architecture for magnetic core loss

基于谱熵先验的深度特征融合架构用于磁铁损耗

Cong Yao, Chunye Gong, Jin Zhang

机构 * Changsha University of Science and Technology(长沙理工大学) National University of Defense Technology(国防科技大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出SEPI-TFPNet混合模型,结合经验模型与深度学习,通过谱熵判别机制和多模态特征融合提升磁铁损耗建模的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11251 2025-12-15 cs.LG 50%

Insight Miner: A Time Series Analysis Dataset for Cross-Domain Alignment with Natural Language

Insight Miner: 一个用于跨领域对齐的时间序列分析数据集与自然语言

Yunkai Zhang, Yawen Zhang, Ming Zheng, Kezhen Chen, Chongyang Gao, Ruian Ge, Siyuan Teng, Amine Jelloul, Jinmeng Rao, Xiaoyuan Guo, Chiang-Wei Fang, Zeyu Zheng, Jie Yang

机构 * UC Berkeley(加州大学伯克利分校) Mineral(矿石) Northwestern University(西北大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 Insight Miner 是一个大规模多模态模型,通过代理工作流生成高质量时间序列描述,提升跨领域时间序列分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 2 篇

2512.11067 2025-12-15 cs.DB cs.AI 79%

KathDB: Explainable Multimodal Database Management System with Human-AI Collaboration

KathDB:具有人机协作的可解释多模数据库管理系统

Guorui Xiao, Enhao Zhang, Nicole Sullivan, Will Hansen, Magdalena Balazinska

机构 * University of Washington(华盛顿大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 KathDB是一种结合关系语义和基础模型推理能力的多模数据库管理系统,通过人机协作实现查询解析、执行和结果解释的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11099 2025-12-15 cs.CV 70%

VGent: Visual Grounding via Modular Design for Disentangling Reasoning and Prediction

VGent: 通过模块化设计实现视觉 grounding 的解耦推理与预测

Weitai Kang, Jason Kuen, Mengwei Ren, Zijun Wei, Yan Yan, Kangning Liu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Adobe(Adobe公司)

专题命中 其他多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 VGent 通过模块化设计实现视觉 grounding 的解耦推理与预测,利用冻结 MLLM 和解码器交叉注意力机制,提升多目标识别性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏