arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-22 至 2026-01-22 共收录 48 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2502.09598 2026-01-22 cs.CV 85%

GAIA: A Global, Multi-modal, Multi-scale Vision-Language Dataset for Remote Sensing Image Analysis

GAIA: 一个全球性的多模态、多尺度遥感图像分析数据集

Angelos Zavras, Dimitrios Michail, Xiao Xiang Zhu, Begüm Demir, Ioannis Papoutsis

机构 * Orion Lab, School of Rural, Surveying and Geoinformatics Engineering, National Technical University of Athens(奥里昂实验室,农村测绘与地理信息工程学院,希腊雅典国家技术大学) Institute of Astronomy, Astrophysics, Space Applications and Remote Sensing, National Observatory of Athens(天文、天体物理、空间应用与遥感研究所,希腊雅典国家天文台) Department of Informatics and Telematics, Harokopio University of Athens(信息与电信技术系,雅典霍罗科皮欧大学) Chair of Data Science in Earth Observation, Technical University of Munich(地球观测数据科学教授职位,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Faculty of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 GAIA是一个全球性的多模态遥感图像分析数据集,通过精心构建的图像-文本对提升遥感任务的性能。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14757 2026-01-22 cs.CV 79%

ReinPath: A Multimodal Reinforcement Learning Approach for Pathology

ReinPath:一种用于病理学的多模态强化学习方法

Kangcheng Zhou, Jun Jiang, Qing Zhang, Shuang Zheng, Qingli Li, Shugong Xu

机构 * East China Normal University(华东师范大学) Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 ReinPath提出了一种多模态强化学习方法,通过构建高质量病理学VQA数据集,结合语义奖励策略和群体相对策略优化,提升了病理图像和文本的多模态推理能力,并在零样本分类任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15287 2026-01-22 cs.CV 57%

Towards Understanding Best Practices for Quantization of Vision-Language Models

朝着理解视觉-语言模型量化最佳实践

Gautom Das, Vincent La, Ethan Lau, Abhinav Shrivastava, Matthew Gwilliam

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究探讨了视觉-语言模型量化方法对多模态流水线性能的影响,发现LLM低位量化在减少bpw时仍保持高精度,为高效部署MLLMs提供实践指导。

Comments 15 pages, 12 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14921 2026-01-22 cs.RO cs.AI 57%

Vision-Language Models on the Edge for Real-Time Robotic Perception

边缘计算上的视觉-语言模型用于实时机器人感知

Sarat Ahmad, Maryam Hafeez, Syed Ali Raza Zaidi

机构 * School of Electronic and Electrical Engineering(电子与电气工程学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了在边缘计算平台上部署视觉-语言模型以提高机器人感知的实时性与准确性,通过实验对比边缘与云部署的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17160 2026-01-22 cs.CV 57%

Can Synthetic Images Serve as Effective and Efficient Class Prototypes?

合成图像能否作为有效的高效类别原型?

Dianxing Shi, Dingjie Fu, Yuqiao Liu, Jun Wang

机构 * Beijing Research Institute of Uranium Geology(铀矿北京研究机构) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Great Bay University(大湾大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 LGCLIP通过大语言模型生成类别特定提示,利用扩散模型合成参考图像,以实现高效的零样本分类。

Comments Accepted by IEEE ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04343 2026-01-22 cs.AI 57%

Adaptive Task Balancing for Visual Instruction Tuning via Inter-Task Contribution and Intra-Task Difficulty

面向视觉指令微调的自适应任务平衡:通过跨任务贡献和内在任务难度

Yanqi Dai, Yong Wang, Zebin You, Dong Jing, Xiangxiang Chu, Zhiwu Lu

机构 * Renmin University of China(中国人民大学) AMAP, Alibaba Group(阿里妈妈集团)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出VisATB方法,通过跨任务贡献和内在任务难度实现视觉指令微调的自适应任务平衡,提升整体性能并缓解不平衡问题。

Comments Accepted for the ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2601.14259 2026-01-22 cs.CV cs.AI cs.HC cs.LG cs.SD eess.AS 85%

A Cloud-Based Cross-Modal Transformer for Emotion Recognition and Adaptive Human-Computer Interaction

基于云的跨模态Transformer用于情绪识别和自适应人机交互

Ziwen Zhong, Zhitao Shu, Yue Zhao

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 本文提出基于云的跨模态Transformer框架,通过整合多模态信号提升情绪识别的鲁棒性和泛化能力,实现高效、实时的自适应人机交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15278 2026-01-22 cs.MM 83%

Interpreting Multimodal Communication at Scale in Short-Form Video: Visual, Audio, and Textual Mental Health Discourse on TikTok

在短视频中大规模解读多模态交流:TikTok上的视觉、音频和文本心理健康 discourse

Mingyue Zha, Ho-Chun Herbert Chang

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本研究提出了一种结合自动多模态特征提取与Shapley值的框架,分析TikTok上关于社交焦虑障碍的视频中视觉、音频和文本如何共同影响观众参与度,揭示了跨模态协同效应的阈值依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14651 2026-01-22 cs.CV cs.MM cs.SD 81%

READ-Net: Clarifying Emotional Ambiguity via Adaptive Feature Recalibration for Audio-Visual Depression Detection

READ-Net:通过自适应特征重校准澄清情绪歧义以实现音频-视觉抑郁症检测

Chenglizhao Chen, Boze Li, Mengke Song, Dehao Feng, Xinyu Liu, Shanchen Pang, Jufeng Yang, Hui Yu

机构 * College of Computer Science and Technology, China University of Petroleum (East China)(中国石油大学(华东)计算机科学与技术学院) College of Computer Science, Nankai University(南开大学计算机科学学院) School of Computing Science, University of Glasgow(格拉斯哥大学计算科学学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 READ-Net通过自适应特征重校准解决音频-视觉抑郁症检测中的情绪歧义问题,提升检测准确率与F1分数。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14620 2026-01-22 eess.AS cs.AI cs.LG cs.SD 62%

Scaling Ambiguity: Augmenting Human Annotation in Speech Emotion Recognition with Audio-Language Models

缩放歧义:通过音频-语言模型增强语音情感识别中的人工标注

Wenda Zhang, Hongyu Jin, Siyi Wang, Zhiqiang Wei, Ting Dang

机构 * University of Melbourne(墨尔本大学) Xi'an Jiaotong University(西安交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文通过音频-语言模型生成合成标注,提升语音情感识别中模糊情感的真实分布可靠性,实验表明合成标注在低歧义区域效果显著,但高歧义情况需进一步优化。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12534 2026-01-22 cs.CV cs.AI 62%

Encoding Emotion Through Self-Supervised Eye Movement Reconstruction

通过自监督眼动重建编码情感

Marcus Ma, Jordan Prescott, Emily Zhou, Tiantian Feng, Kleanthis Avramidis, Gabor Mihaly Toth, Shrikanth Narayanan

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种自监督眼动重建模型,用于从自然主义低分辨率视频中预测情绪表达的多模态标记,通过微调两个下游任务验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08422 2026-01-22 cs.RO 50%

Teaching Robots Like Dogs: Learning Agile Navigation from Luring, Gesture, and Speech

教机器人像教狗一样:从诱饵、手势和言语中学习敏捷导航

Taerim Yoon, Dongho Kang, Jin Cheng, Fatemeh Zargarbashi, Yijiang Huang, Minsung Ahn, Stelian Coros, Sungjoon Choi

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学) Department of Computer Science, ETH Zurich(计算机科学系,苏黎世联邦理工学院) Department of Mechanical and Aerospace Engineering, UCLA(机械与航空航天工程系,加州大学洛杉矶分校)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本研究提出了一种人机协同框架,通过手势、言语和诱饵等多模态输入,使机器人高效学习敏捷导航,实验显示在少于1小时的数据下任务成功率高达97.15%。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 7 篇

2601.14799 2026-01-22 cs.CV 83%

UBATrack: Spatio-Temporal State Space Model for General Multi-Modal Tracking

UBATrack: 一种用于通用多模态跟踪的时空状态空间模型

Qihua Liang, Liang Chen, Yaozong Zheng, Jian Nong, Zhiyi Mo, Bineng Zhong

机构 * Key Laboratory of Education Blockchain and Intelligent Technology, Ministry of Education, Guangxi Normal University(教育区块链与智能技术重点实验室,教育部,广西师范大学) Guangxi Key Laboratory of Multi-Source Information Mining and Security, Guangxi Normal University(广西多源信息挖掘与安全重点实验室,广西师范大学) University Engineering Research Center of Educational Intelligent Technology, Guangxi Normal University(教育智能技术大学工程研究中心,广西师范大学) Guangxi Key Laboratory of Machine Vision and Intelligent Control, Wuzhou University(广西机器视觉与智能控制重点实验室,梧州大学)

专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 UBATrack提出基于mamba状态空间模型的多模态跟踪框架,通过时空Mamba适配器和动态多模态特征混合器提升跟踪鲁棒性,有效捕捉时空线索并提高训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14777 2026-01-22 cs.CV cs.AI 79%

FunCineForge: A Unified Dataset Toolkit and Model for Zero-Shot Movie Dubbing in Diverse Cinematic Scenes

FunCineForge: 一个统一的数据集工具包和模型,用于多样的影视场景零样本配音

Jiaxuan Liu, Yang Xiang, Han Zhao, Xiangang Li, Zhenhua Ling

机构 * Alibaba Group(阿里巴巴集团) Tongyi Lab(通义实验室)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 FunCineForge提出了一种统一的数据集工具包和模型,用于多样的影视场景零样本配音,通过构建大规模数据集和基于大规模语言模型的模型,提升了音频质量、唇形同步和情绪表达性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14550 2026-01-22 cs.RO 78%

TacUMI: A Multi-Modal Universal Manipulation Interface for Contact-Rich Tasks

TacUMI: 一种多模态通用操控接口用于接触密集型任务

Tailai Cheng, Kejia Chen, Lingyun Chen, Liding Zhang, Yue Zhang, Yao Ling, Mahdi Hamad, Zhenshan Bing, Fan Wu, Karan Sharma, Alois Knoll

机构 * School of Computation, Information and Technology, Technical University of Munich(技术大学慕尼黑计算、信息与技术学院) Agile Robots SE(敏捷机器人公司) State Key Laboratory for Novel Software Technology and the School of Science and Technology, Nanjing University (Suzhou Campus)(南京大学软件新技术国家重点实验室及科学与技术学院(苏州校区)) Shanghai University(上海大学)

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 TacUMI通过整合多种传感器,提供了一种多模态数据采集系统,用于提高接触密集型任务中多模态演示的分割和收集效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22661 2026-01-22 cs.IR cs.AI 74%

Next Point-of-interest (POI) Recommendation Model Based on Multi-modal Spatio-temporal Context Feature Embedding

基于多模态时空上下文特征嵌入的下一个兴趣点(POI)推荐模型

Lingyu Zhang, Pengfei Xu, Rui Ban, Zhenchao Zhang, Songtao Liu, Yan Wang, Yunhai Wang

机构 * Institute of Trustworthy Autonomous Systems, Southern University of Science and Technology(SUSTech)(可信自主系统研究院,南方科技大学) School of Information Sciences and Technology, Northwest University(信息科学与技术学院,西北大学) China Information Technology Designing & Consulting Institute Co., Ltd.(中国信息科技设计与咨询研究院有限公司) Renmin University of China(中国人民大学)

专题命中 视频多模态 :multi-modal(title);分类 cs.AI

AI总结 本文提出基于多模态时空上下文特征嵌入的POI推荐模型,通过双流时空注意力机制有效区分长期习惯与短期意图,提升个性化出行预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14875 2026-01-22 cs.CV cs.AI 62%

GAT-NeRF: Geometry-Aware-Transformer Enhanced Neural Radiance Fields for High-Fidelity 4D Facial Avatars

GAT-NeRF:基于几何感知的Transformer增强神经辐射场用于高保真的4D面部虚拟人物

Zhe Chang, Haodong Jin, Ying Sun, Yan Song, Hui Yu

机构 * Department of Control Science and Engineering, University of Shanghai for Science and Technology(控制科学与工程系,上海科学技术大学) Business School, University of Shanghai for Science and Technology(商学院,上海科学技术大学) School of Psychology and Neuroscience, University of Glasgow(心理学与神经科学学院,格拉斯哥大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 GAT-NeRF通过整合Transformer机制与几何感知模块,提升从单目视频重建高保真4D动态面部虚拟人物的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15115 2026-01-22 cs.CV 57%

Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial Reasoning

无需训练的多阶段对抗推理 hateful 视频检测

Shuonan Yang, Yuchen Zhang, Zeyu Fu

机构 * Multimodal Intelligence Lab, Department of Computer Science, University of Exeter, United Kingdom(埃克塞特大学计算机科学系多模态智能实验室) Institute for Analytics and Data Science, University of Essex, United Kingdom(埃塞克斯大学分析与数据科学研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MARS通过多阶段对抗推理框架实现无需训练的可解释仇恨视频检测,提升检测可靠性与透明度。

Comments Accepted at ICASSP 2026. \c{opyright} 2026 IEEE. This is the author accepted manuscript. The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14917 2026-01-22 cs.LG cs.AI 57%

Tailoring Adverse Event Prediction in Type 1 Diabetes with Patient-Specific Deep Learning Models

为1型糖尿病定制不良事件预测的患者特异性深度学习模型

Giorgia Rigamonti, Mirko Paolo Barbato, Davide Marelli, Paolo Napoletano

机构 * Department of Informatics, Systems and Communication(信息学、系统与通信系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于深度学习的个性化血糖预测方法,利用患者特定数据提高预测准确性,以改善1型糖尿病的管理。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2601.10096 2026-01-22 cs.LG 82%

Multilingual-To-Multimodal (M2M): Unlocking New Languages with Monolingual Text

多语言到多模态(M2M):通过单语文本解锁新语言

Piyush Singh Pasi

机构 * Amazon(亚马逊)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract)

AI总结 M2M通过单语文本学习多语言多模态对齐,实现多语言文本到图像检索的零样本迁移

Comments EACL 2026 Findings accepted. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14714 2026-01-22 cs.IR 78%

Unified Multimodal and Multilingual Retrieval via Multi-Task Learning with NLU Integration

通过多任务学习与NLU集成实现统一的多模态和多语言检索

Xinyuan Zhang, Lina Zhang, Lisung Chen, Guangyao Liu, Shuai Nie, Jiaming Xu, Runyu Shi, Ying Huang, Guoquan Zhang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出通过多任务学习与NLU集成实现统一的多模态和多语言检索,提升跨语言和跨模态的检索效率与准确性。

Comments 4 pages, 2 figures, submitted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14607 2026-01-22 physics.geo-ph 67%

SeisBind: Physics-Aware Tri-Modal Representation Binding for Seismic Data via Contrastive Learning

SeisBind:通过对比学习实现地震数据的物理感知三模态表示绑定

Chaohua Liang, Jun Matsushima

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract)

AI总结 SeisBind通过对比学习将地震数据与物理描述符结合,实现更可解释的地下速度模型构建。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2512.20362 2026-01-22 cs.CV 79%

CRAFT: Continuous Reasoning and Agentic Feedback Tuning for Multimodal Text-to-Image Generation

CRAFT:连续推理与代理反馈调优用于多模态文本到图像生成

V. Kovalev, A. Kuvshinov, A. Buzovkin, D. Pokidov, D. Timonin

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 CRAFT通过显式推理和反馈调优提升多模态生成模型的可靠性,实现可控且高效的文本到图像生成。

Comments 37 pages, 42 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02900 2026-01-22 cs.CV cs.AI cs.GR cs.HC cs.MM 78%

Advancing Talking Head Generation: A Comprehensive Survey of Multi-Modal Methodologies, Datasets, Evaluation Metrics, and Loss Functions

推进说话头生成:多模态方法、数据集、评估指标和损失函数的全面综述

Vineet Kumar Rakesh, Soumya Mazumdar, Research Pratim Maity, Sarbajit Pal, Amitabha Das, Tapas Samanta

机构 * Engineering Sciences, Homi Bhabha National Institute Training School Complex(工程科学,霍米·巴赫瓦全国研究所培训学校) Computer and Informatics Group, VECC 1/AF(计算机与信息组,VECC 1/AF)

专题命中 多模态生成 :multi-modal(title);分类 cs.CV、cs.AI、cs.MM

AI总结 本文全面综述了说话头生成的多模态方法、数据集、评估指标和损失函数,探讨了技术挑战与未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19774 2026-01-22 cs.LG cs.AI eess.SP 74%

PPGFlowECG: Latent Rectified Flow with Cross-Modal Encoding for PPG-Guided ECG Generation and Cardiovascular Disease Detection

PPGFlowECG: 基于跨模态编码的潜在修正流用于PPG引导的ECG生成和心血管疾病检测

Xiaocheng Fang, Jiarui Jin, Haoyu Wang, Che Liu, Jieyi Cai, Yujie Xiao, Guangkun Nie, Bo Liu, Shun Huang, Hongyan Li, Shenda Hong

机构 * National Institute of Health Data Science, Peking University, China(北京大学国家健康数据科学研究院) School of Intelligence Science and Technology, Peking University, China(北京大学智能科学与技术学院) Data Science Institute, Imperial College London, UK(伦敦帝国理工学院数据科学研究院) University of Chinese Academy of Sciences, China(中国科学院大学)

专题命中 多模态生成 :cross-modal(title);分类 cs.AI

AI总结 PPGFlowECG通过跨模态编码和潜在修正流,实现PPG引导的ECG生成,提升心血管疾病检测的可扩展性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04339 2026-01-22 cs.CV cs.AI 73%

Unified Text-Image Generation with Weakness-Targeted Post-Training

通过弱项针对性后训练实现统一的文本图像生成

Jiahui Chen, Philippe Hansen-Estruch, Xiaochuang Han, Yushi Hu, Emily Dinan, Amita Kamath, Michal Drozdzal, Reyhane Askari-Hemmat, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta(Meta旗下的FAIR) University of Texas, Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过针对性后训练实现统一文本图像生成,提升多模态生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05665 2026-01-22 cs.CL cs.CV 62%

Interleaved Latent Visual Reasoning with Selective Perceptual Modeling

交错的潜在视觉推理与选择性感知建模

Shuai Dong, Siyuan Wang, Xingyu Liu, Chenglin Li, Haowen Hou, Zhongyu Wei

机构 * China University of Geosciences, Wuhan(中国地质大学(武汉)) Shanghai Innovation Institute(上海创新研究院) University of Southern California(南加州大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 ILVR通过交错潜在视觉表示与文本生成,实现动态状态演变与精确感知建模的统一,提升多模态推理性能。

Comments 18 pages, 11 figures. Code available at https://github.com/XD111ds/ILVR

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 9 篇

2510.21182 2026-01-22 cs.CV cs.CL 84%

KBE-DME: Dynamic Multimodal Evaluation via Knowledge Enhanced Benchmark Evolution

KBE-DME: 通过知识增强的基准进化实现动态多模态评估

Junzhe Zhang, Huixuan Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology(王轩计算机技术研究所) Peking University(北京大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 KBE-DME通过整合多模态知识和动态基准进化,实现对多模态大语言模型能力的更全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14261 2026-01-22 cs.CV cs.HC cs.LG 83%

Intelligent Power Grid Design Review via Active Perception-Enabled Multimodal Large Language Models

通过主动感知多模态大语言模型实现智能电网设计审查

Taoliang Tan, Chengwei Ma, Zhen Tian, Zhao Lin, Dongdong Li, Si Shi

机构 * Yangjiang Yangxi Power Supply Bureau, Guangdong Power Grid Co., Ltd., Yangjiang, China(阳江阳西供电局,广东电网公司) Guangdong Laboratory of Artificial Intelligence(广东人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出基于主动感知多模态大语言模型的智能电网设计审查方法,通过三阶段框架提升对设计错误的识别准确性和审查可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11932 2026-01-22 cs.CV 79%

Hyperphantasia: A Benchmark for Evaluating the Mental Visualization Capabilities of Multimodal LLMs

Hyperphantasia: 一个多模态大语言模型心理可视化能力评估基准

Mohammad Shahab Sepehri, Berk Tinaz, Zalan Fabian, Mahdi Soltanolkotabi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 Hyperphantasia是一个评估多模态大语言模型心理可视化能力的合成基准,通过四个精心设计的谜题揭示了人类与当前模型之间的性能差距,并探索了强化学习在提升视觉模拟能力上的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏