arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-03 至 2025-12-03 共收录 50 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2512.02719 2025-12-03 cs.CL cs.AI cs.CV cs.LG q-bio.NC 67%

Emergent Bayesian Behaviour and Optimal Cue Combination in LLMs

涌现的贝叶斯行为与LLMs中的最优线索整合

Julian Ma, Jun Wang, Zafeirios Fountas

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究揭示LLMs在多模态整合中表现出贝叶斯策略,但准确性不等于鲁棒性,提出贝叶斯一致性分数以评估不确定性处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11275 2025-12-03 cs.MM cs.AI cs.CY 62%

TCC-Bench: Benchmarking the Traditional Chinese Culture Understanding Capabilities of MLLMs

TCC-Bench:评估多模态大语言模型对传统中国文化理解能力的基准测试

Pengju Xu, Yan Wang, Shuyuan Zhang, Xuan Zhou, Xin Li, Yue Yuan, Fengzhao Li, Shunyuan Zhou, Xingyu Wang, Yi Zhang, Haiying Zhao

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 TCC-Bench通过双语视觉问答基准评估多模态大语言模型对传统中国文化理解能力,揭示其在文化相关视觉内容推理上的挑战。

Comments There are issues with the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15690 2025-12-03 cs.AI cs.LG cs.MM 62%

GRAFT: GRaPH and Table Reasoning for Textual Alignment -- A Benchmark for Structured Instruction Following and Visual Reasoning

GRAFT:用于文本对齐的图和表推理——一个结构化指令遵循和视觉推理的基准

Abhigya Verma, Sriram Puttagunta, Seganrasan Subramanian, Sravan Ramachandran

机构 * ServiceNow

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 GRAFT基准通过结构化图表和表格及多步骤问题,评估大语言模型在视觉文本对齐、指令遵循和视觉推理方面的综合能力。

Comments 25 pages, 10 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02867 2025-12-03 cs.CV 57%

MICCAI STSR 2025 Challenge: Semi-Supervised Teeth and Pulp Segmentation and CBCT-IOS Registration

MICCAI STSR 2025挑战:半监督牙齿和牙髓分割及CBCT-IOS配准

Yaqi Wang, Zhi Li, Chengyu Wu, Jun Liu, Yifan Zhang, Jialuo Chen, Jiaxue Ni, Qian Luo, Jin Liu, Can Han, Changkai Ji, Zhi Qin Tan, Ajo Babu George, Liangyu Chen, Qianni Zhang, Dahong Qian, Shuai Wang, Huiyu Zhou

机构 * Innovation Center for Electronic Design Automation Technology(电子设计自动化技术创新中心) School of Cyberspace(网络空间学院) Hangzhou Dianzi University(杭州电子科技大学) Hangzhou Geriatric Stomatology Hospital(杭州老年牙科医院) Shenzhen University(深圳大学) Queen Mary University of London(伦敦女王大学) Shandong University(山东大学) School of Automation and Intelligent Sensing(自动化与智能感知学院) King’s College London(伦敦国王学院) College of Information Engineering(信息工程学院) University of Leicester(莱斯特大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 STSR 2025挑战通过半监督学习方法解决CBCT和IOS的牙齿分割与配准问题,采用深度学习模型提升分割和配准精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02790 2025-12-03 cs.CV 57%

UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits

UnicEdit-10M: 一个通过统一验证打破规模-质量壁垒的数据集和基准

Keming Ye, Zhipeng Huang, Canmiao Fu, Qingyang Liu, Jiani Cai, Zheqi Lv, Chen Li, Jing Lyu, Zhou Zhao, Shengyu Zhang

机构 * Zhejiang University(浙江大学) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 UnicEdit-10M通过统一验证方法构建大规模高质量数据集和基准,解决图像编辑中规模与质量的矛盾,评估模型在空间和知识推理中的表现。

Comments 31 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02624 2025-12-03 cs.CV 57%

PPTBench: Towards Holistic Evaluation of Large Language Models for PowerPoint Layout and Design Understanding

PPTBench: 向大语言模型在PowerPoint布局和设计理解的全面评估迈进

Zheng Huang, Xukai Liu, Tianyu Hu, Kai Zhang, Ye Liu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 PPTBench通过全面评估大语言模型在PowerPoint布局和设计理解上的能力,揭示了当前模型在视觉布局推理和生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12498 2025-12-03 cs.AI 57%

Artificial Intelligence Virtual Cells: From Measurements to Decisions across Modality, Scale, Dynamics, and Evaluation

人工智能虚拟细胞:从多模态、多尺度测量到决策的跨模态、跨尺度、动态和评估

Chengpeng Hu, Calvin Yu-Chian Chen

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种模型无关的细胞状态潜在视角,通过操作符语法组织学习,旨在跨模态、跨尺度、上下文和干预实现决策对齐的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 6 篇

2512.02405 2025-12-03 cs.CV cs.AI cs.LG 84%

WISE: Weighted Iterative Society-of-Experts for Robust Multimodal Multi-Agent Debate

WISE: 加权迭代专家社会用于鲁棒多模态多智能体辩论

Anoop Cherian, River Doyle, Eyal Ben-Dov, Suhas Lohit, Kuan-Chuan Peng

机构 * Mitsubishi Electric Research Labs(三菱电机研究实验室) Cambridge Rindge and Latin School(剑桥林恩和拉丁学校)

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出WISE框架,通过多模态多智能体辩论提升视觉语言推理任务的准确性,实验显示在多个数据集上提升了2-7%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02981 2025-12-03 cs.CV 83%

InEx: Hallucination Mitigation via Introspection and Cross-Modal Multi-Agent Collaboration

InEx:通过内省与跨模态多智能体协作缓解幻觉

Zhongyu Yang, Yingfang Yuan, Xuanming Jiang, Baoyi An, Wei Pang

专题命中 多模态Agent :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 InEx通过内省推理和跨模态多智能体协作,自主缓解大型语言模型的幻觉问题,实验表明其在多个基准上表现优异。

Comments Published in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02777 2025-12-03 cs.RO cs.MA 78%

CogDrive: Cognition-Driven Multimodal Prediction-Planning Fusion for Safe Autonomy

CogDrive: 基于认知的多模态预测-规划融合用于安全自主性

Heye Huang, Yibin Yang, Mingfeng Fan, Haoran Wang, Xiaocong Zhao, Jianqiang Wang

机构 * Singapore-MIT Alliance for Research and Technology (SMART), Singapore(新加坡-麻省理工联合研究技术联盟) Department of Urban Studies and Planning, Massachusetts Institute of Technology, USA(麻省理工学院城市研究与规划系) School of Vehicle and Mobility, Tsinghua University, China(清华大学车辆与移动系统学院) Department of Mechanical Engineering, National University of Singapore, Singapore(新加坡国立大学机械工程系) Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University, China(同济大学交通工程重点实验室)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 CogDrive通过结合认知多模态预测与安全导向规划,实现了在复杂交通中的安全自主性,提升了轨迹预测和适应性行为。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02280 2025-12-03 cs.AI cs.CV 62%

Bridging the Gap: Toward Cognitive Autonomy in Artificial Intelligence

弥合差距:迈向人工智能的认知自主性

Noorbakhsh Amiri Golilarz, Sindhuja Penchala, Shahram Rahimi

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了人工智能在自我监控、自我纠正和自主调节方面的能力不足,并提出基于神经认知原理的架构以实现认知自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02533 2025-12-03 cs.MM 57%

PopSim: Social Network Simulation for Social Media Popularity Prediction

PopSim: 基于社交网络的社交媒体流行度预测仿真

Yijun Liu, Wu Liu, Xiaoyan Gu, Allen He, Weiping Wang, Yongdong Zhang

专题命中 多模态Agent :multimodal(abstract);分类 cs.MM

AI总结 PopSim通过基于大语言模型的多智能体仿真,有效模拟UGC传播动态,提升社交媒体流行度预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01167 2025-12-03 cs.LG cs.AI cs.SY eess.SY 57%

A TinyML Reinforcement Learning Approach for Energy-Efficient Light Control in Low-Cost Greenhouse Systems

为低成本温室系统设计一种 TinyML 强化学习方法以实现节能照明控制

Mohamed Abdallah Salem, Manuel Cuevas Perez, Ahmed Harb Rabia

机构 * North Dakota State University(北达科他州立大学) Biosystems Engineering(生物系统工程)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种基于 TinyML 的强化学习方法,用于低成本温室系统的节能照明控制,通过 Q 学习算法实现动态亮度调节,有效稳定不同光照水平。

Comments Copyright 2025 IEEE. This is the author's version of the work that has been accepted for publication in Proceedings of the 5. Interdisciplinary Conference on Electrics and Computer (INTCEC 2025) 15-16 September 2025, Chicago-USA. The final version of record is available at: https://doi.org/10.1109/INTCEC65580.2025.11256135

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 7 篇

2512.02558 2025-12-03 cs.AI 83%

Empathy Level Prediction in Multi-Modal Scenario with Supervisory Documentation Assistance

多模态场景中基于监督文档辅助的共情水平预测

Yufei Xiao, Shangfei Wang

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出一种结合视频、音频和文本信息的多模态共情预测方法,通过监督文档辅助训练提升文本特征提取,实验证明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02055 2025-12-03 cs.CV cs.AI 81%

Leveraging AI multimodal geospatial foundation models for improved near-real-time flood mapping at a global scale

利用AI多模态地理空间基础模型实现全球范围内的改进型实时洪水制图

Mirela G. Tulbure, Julio Caineta, Mark Broich, Mollie D. Gaines, Philippe Rufin, Leon-Friedrich Thomas, Hamed Alemohammad, Jan Hemmerling, Patrick Hostert

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究利用AI多模态地理空间基础模型提升全球实时洪水制图能力,通过微调TerraMind模型并对比不同配置,展示多模态数据整合在洪水检测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15272 2025-12-03 cs.CV cs.AI cs.CL 75%

CT-GLIP: 3D Grounded Language-Image Pretraining with CT Scans and Radiology Reports for Full-Body Scenarios

CT-GLIP:基于CT扫描和放射报告的3D grounded语言-图像预训练,用于全身场景

Jingyang Lin, Yingda Xia, Jianpeng Zhang, Ke Yan, Kai Cao, Le Lu, Jiebo Luo, Ling Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) University of Rochester(罗切斯特大学) Hupan Lab, \postcode 10587, \state Hangzhou, \country China(华普实验室,浙江省杭州市,中国) Department of Radiology, Shanghai Institution of Pancreatic Disease, \state Shanghai, \country China(胰腺疾病研究所放射科,上海市,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 CT-GLIP通过构建细粒度CT报告对,提升3D grounded语言-图像预训练,实现更精确的跨模态对齐,从而在零样本任务中提升器官识别和肿瘤检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02972 2025-12-03 cs.CV cs.RO 74%

BEVDilation: LiDAR-Centric Multi-Modal Fusion for 3D Object Detection

BEVDilation:以LiDAR为中心的多模态融合用于3D目标检测

Guowen Zhang, Chenhang He, Liyi Chen, Lei Zhang

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

AI总结 BEVDilation提出以LiDAR为中心的多模态融合方法,通过稀疏体素扩张和语义引导BEV扩张模块提升3D目标检测性能,有效缓解深度误差带来的空间错位问题。

Comments Accept by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02715 2025-12-03 cs.CV 70%

GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding

GeoViS: 基于地理奖励的视觉搜索用于遥感视觉定位

Peirong Zhang, Yidan Zhang, Luxiao Xu, Jinliang Lin, Zonghao Guo, Fengxiang Wang, Xue Yang, Kaiwen Wei, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) National University of Defense Technology(国防科技大学) Shanghai Jiao Tong University(上海交通大学) Chongqing University(重庆大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 GeoViS通过地理奖励机制,实现了遥感影像中的细粒度视觉定位,通过逐步搜索和推理提升小目标检测精度与跨领域泛化能力。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02563 2025-12-03 eess.SP 50%

Predictive Beamforming in Low-Altitude Wireless Networks: A Cross-Attention Approach

低空无线网络中的预测波束成形:一种交叉注意力方法

Xiaotong Zhao, Yuanhao Cui, Weijie Yuan, Ziye Jia, Heng Liu, Chengwen Xing

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出一种基于交叉注意力融合机制的多模态预测波束成形方法,通过联合利用视觉和结构化传感器数据,提升动态低空无线网络中波束预测的准确性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02462 2025-12-03 eess.SP 50%

Bayesian Probability Fusion for Multi-AP Collaborative Sensing in Mobile Networks

基于贝叶斯概率融合的多接入点协同感知移动网络

Shengheng Liu, Xingkang Li, Yongming Huang, Yuan Fang, Qingji Jiang, Dazhuan Xu, Ziguo Zhong, Dongming Wang, Xiaohu You

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出基于贝叶斯概率融合的多接入点协同感知框架,通过正交频分复用波形实现目标参数估计,提升通信效率与感知精度。

Comments 16 pages, 10 figures, submitted to Science China Information Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏