arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-04 至 2025-12-04 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2512.03064 2025-12-04 cs.SI 89%

Demographic Inference from Social Media Data with Multimodal Foundation Models: Strategies, Evaluation, and Benchmarking

从社交媒体数据中推断人口特征:多模态基础模型的策略、评估与基准测试

Hao Yang, Angela Yao, Eric Chang, Hexiang Wang

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract)

AI总结 本研究利用GPT-5多模态基础模型,从社交媒体资料中推断年龄、性别和种族,展示了其在提高人口特征推断准确性、公平性和可扩展性方面的潜力。

Comments 21 pages, 10 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03464 2025-12-04 cs.LG 88%

Multi-Modal Opinion Integration for Financial Sentiment Analysis using Cross-Modal Attention

多模态意见整合用于金融情绪分析的跨模态注意力

Yujing Liu, Chen Yang

机构 * College of Computing Georgia Institute of Technology Atlanta, USA(计算学院 佐治亚理工学院 美国亚特兰大) College of Engineering University of Pennsylvania Philadelphia, USA(工程学院 宾夕法尼亚大学 美国费城)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(title);multimodal(abstract)

AI总结 本文提出了一种多模态注意力机制,用于整合金融意见的时效和流行度模态,以提高金融情绪分析的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18980 2025-12-04 cs.CL cs.AI cs.CV 82%

IW-Bench: Evaluating Large Multimodal Models for Converting Image-to-Web

IW-Bench: 评估大规模多模态模型的图像到网页转换能力

Hongcheng Guo, Wei Zhang, Junhao Chen, Yaonan Gu, Jian Yang, Junjia Du, Shaosheng Cao, Binyuan Hui, Tianyu Liu, Jianxin Ma, Chang Zhou, Zhoujun Li

机构 * Beihang University(北京航空航天大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 IW-Bench提出了一种新的基准,用于评估大规模多模态模型在图像到网页转换中的性能,通过元素准确率和布局准确率以及五跳提示方法来提升评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03369 2025-12-04 cs.CV cs.AI 81%

FireSentry: A Multi-Modal Spatio-temporal Benchmark Dataset for Fine-Grained Wildfire Spread Forecasting

FireSentry: 一种多模态时空基准数据集用于细粒度野火蔓延预测

Nan Zhou, Huandong Wang, Jiahao Li, Han Li, Yali Song, Qiuhua Wang, Yong Li, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) College of Soil and Water Conservation, Southwest Forestry University(西南林业大学水土保持学院) College of Civil Engineering, Southwest Forestry University(西南林业大学土木工程学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 FireSentry提出了一种多模态野火数据集和FiReDiff双模态范式,用于细粒度野火预测和动态灾害模拟,显著提升了视频和火斑掩膜的预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03000 2025-12-04 cs.CV 79%

DynamicVerse: A Physically-Aware Multimodal Framework for 4D World Modeling

DynamicVerse: 一种具有物理意识的多模态框架用于4D世界建模

Kairun Wen, Yuzhi Huang, Runyu Chen, Hui Zheng, Yunlong Lin, Panwang Pan, Chenxin Li, Wenyan Cong, Jian Zhang, Junbin Lu, Chenguo Lin, Dilin Wang, Zhicheng Yan, Hongyu Xu, Justin Theiss, Yue Huang, Xinghao Ding, Rakesh Ranjan, Zhiwen Fan

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 DynamicVerse提出了一种多模态框架,通过整合大规模视觉、几何和多模态模型,实现动态现实世界视频的4D世界建模,提升了对物理尺度测量的全局准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07850 2025-12-04 cs.AI 79%

GAMA: A Neural Neighborhood Search Method with Graph-aware Multi-modal Attention for Vehicle Routing Problem

GAMA:一种具有图感知多模态注意力的神经邻域搜索方法用于车辆路径问题

Xiangling Chen, Yi Mei, Mengjie Zhang

机构 * Centre for Data Science and Artificial Intelligence(数据科学与人工智能中心) School of Engineering and Computer Science(工程与计算机科学学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 GAMA通过图感知多模态注意力机制和门控融合设计,提升车辆路径问题的神经邻域搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19582 2025-12-04 cs.CV 70%

Guard Me If You Know Me: Protecting Specific Face-Identity from Deepfakes

Kaiqing Lin, Zhiyuan Yan, Ke-Yue Zhang, Li Hao, Yue Zhou, Yuzhen Lin, Weixiang Li, Taiping Yao, Shouhong Ding, Bin Li

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) SZU-AFS Joint Innovation Center for AI Technology(深圳大学-腾讯优图联合创新中心) Shenzhen University(深圳大学) School of Electronic and Computer Engineering(电子与计算机工程学院) Peking Univerisity(北京大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03746 2025-12-04 cs.CV cs.CL 62%

Thinking with Programming Vision: Towards a Unified View for Thinking with Images

通过编程视觉思考:迈向图像思考的统一视角

Zirun Guo, Minjie Hong, Feng Zhang, Kai Jia, Tao Jin

机构 * Zhejiang University(浙江大学) ByteDance BandAI(字节跳动BandAI)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 CodeVision提出一种灵活的代码作为工具框架,通过两阶段训练提升模型对图像变化和多工具推理的鲁棒性,实验显示显著提升性能并促进新兴能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03838 2025-12-04 cs.CL 57%

Training and Evaluation of Guideline-Based Medical Reasoning in LLMs

在LLM中训练和评估基于指南的医学推理

Michael Staniek, Artem Sokolov, Stefan Riezler

机构 * Computational Linguistics &(计算语言学) IWR, Heidelberg University(海德堡大学IWR部门) Google DeepMind, Berlin, Germany(谷歌DeepMind,柏林,德国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文通过训练LLM遵循医学共识指南,提升其推理和预测的正确性与价值正确性,改进未来临床变量的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09997 2025-12-04 cs.CV 57%

GT23D-Bench: A Comprehensive General Text-to-3D Generation Benchmark

GT23D-Bench:一个全面的通用文本到3D生成基准

Xiao Cai, Sitong Su, Jingkuan Song, Pengpeng Zeng, Ji Zhang, Qinhong Du, Mengqi Li, Heng Tao Shen, Lianli Gao

机构 * University of Electronic Science and Technology of China(电子科技大学) Tongji University(同济大学) Southwest Jiaotong University(西南交通大学)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV

AI总结 GT23D-Bench通过构建高质量数据集和全面评估体系,解决通用文本到3D生成中的数据与评估难题,推动研究进展。

详情

展开后加载摘要…

URL PDF HTML 收藏