arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9204 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9204 篇

2510.07143 2026-04-21 cs.CV 77%

Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods

我们是否在使用正确的基准:视觉令牌压缩方法的评估框架

Chenfei Liao, Wensong Wang, Zichen Wen, Xu Zheng, Yiyu Wang, Haocong He, Yuanhuiyi Lyu, Lutao Jiang, Xin Zou, Yuqian Fu, Bin Ren, Linfeng Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) MBZUAI

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文通过实验证明现有基准含大量无关样本, downsampling能有效过滤样本,提出VTC-Bench框架以更公平评估视觉令牌压缩方法。

Comments Accepted by ACL2026 Main. Code: https://github.com/Chenfei-Liao/VTC-Bench; Project Page: https://chenfei-liao.github.io/VTC-Bench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02763 2026-03-24 cs.CV 77%

ClearAIR: A Human-Visual-Perception-Inspired All-in-One Image Restoration

ClearAIR: 一种受人类视觉感知启发的全能图像修复框架

Xu Zhang, Huan Zhang, Guoli Wang, Qian Zhang, Lefei Zhang

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出ClearAIR,受人类视觉感知启发,采用分层粗到细的修复策略,通过多模态大语言模型进行整体评估,并引入区域意识和任务识别流程,提升图像修复精度与细节恢复能力。

Comments Accepted to AAAI 2026. Project page: https://github.com/House-yuyu/ClearAIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19217 2026-03-20 cs.CV 77%

LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs

LVOmniBench:开创性长音频视频理解评估用于多模态大语言模型

Keda Tao, Yuhua Zheng, Jia Xu, Wenjie Du, Kele Shao, Hesong Wang, Xueyi Chen, Xin Jin, Junhan Zhu, Bohan Yu, Weiqiang Wang, Jian Liu, Can Qin, Yulun Zhang, Ming-Hsuan Yang, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of California Merced(加州大学默塞德分校)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 LVOmniBench旨在评估多模态大语言模型在长音频视频中的跨模态理解能力,通过275个10至90分钟的高质量视频和1014个问题-答案对,揭示当前模型在处理长形式输入时的挑战。

Comments Project page: https://kd-tao.github.io/LVOmniBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08008 2026-03-11 cs.CV 77%

A Survey on Wi-Fi Sensing Generalizability: Taxonomy, Techniques, Datasets, and Future Research Prospects

关于Wi-Fi感知通用性的综述:分类、技术、数据集与未来研究前景

Fei Wang, Tingting Zhang, Wei Xi, Han Ding, Ge Wang, Di Zhang, Yuanhao Cui, Fan Liu, Jinsong Han, Jie Xu, Tony Xiao Han

机构 * School of Software Engineering and the State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(软件工程学院和人机混合增强智能国家重点实验室,西安交通大学) School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) Information and Communication Engineering,Beijing University of Posts and Telecommunications(信息与通信工程,北京邮电大学) School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文综述了Wi-Fi感知通用性研究,涵盖技术分类、数据集及未来方向,旨在提升系统在不同环境下的适应能力。

Comments Accepted for publication in IEEE Communications Surveys & Tutorials 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00264 2026-01-05 cs.CV 77%

S1-MMAlign: A Large-Scale, Multi-Disciplinary Dataset for Scientific Figure-Text Understanding

S1-MMAlign: 一个大规模、跨学科的数据集用于科学图像-文本理解

He Wang, Longteng Guo, Pengkang Huo, Xuanxu Lin, Yichen Yuan, Jie Jiang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 S1-MMAlign是一个大规模跨学科数据集,通过语义增强提升科学图像与文本的对齐质量,推动AI在科学领域的应用。

Comments 12 pages, 5 figures. Dataset available at https://huggingface.co/datasets/ScienceOne-AI/S1-MMAlign

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19836 2025-11-26 cs.CV 77%

4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models

4DWorldBench: 一种用于3D/4D世界生成模型的综合评估框架

Yiting Lu, Wei Luo, Peiyan Tu, Haoran Li, Hanxin Zhu, Zihao Yu, Xingrui Wang, Xinyi Chen, Xinge Peng, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Beijing Zhongguancun Academy(北京中关村学院)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 4DWorldBench提出了一种用于评估3D/4D世界生成模型的综合框架,通过四个维度评估模型的感知质量、条件对齐、物理真实性和一致性,支持多模态输入并整合多种评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12795 2025-09-30 cs.AI cs.LG 77%

FRABench and UFEval: Unified Fine-grained Evaluation with Task and Aspect Generalization

Shibo Hong, Jiahao Ying, Haiyuan Liang, Mengdi Zhang, Jun Kuang, Jiazheng Zhang, Yixin Cao

机构 * School of Computer Science, Fudan University(复旦大学计算机学院) Meituan Group(美团集团) School of Computer Science, Singapore Management University(新加坡管理学院)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16517 2025-09-23 cs.CV cs.AI cs.CL cs.MM 77%

Seeing Culture: A Benchmark for Visual Reasoning and Grounding

Burak Satar, Zhixin Ma, Patrick A. Irawan, Wilfried A. Mulyawan, Jing Jiang, Ee-Peng Lim, Chong-Wah Ngo

机构 * Singapore Management University(新加坡管理大学) Bandung Institute of Technology(班达理工大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Main Conference, https://seeingculture-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14728 2025-05-22 cs.CV cs.AI cs.CL cs.CY cs.MM 77%

MORALISE: A Structured Benchmark for Moral Alignment in Visual Language Models

Xiao Lin, Zhining Liu, Ze Yang, Gaotang Li, Ruizhong Qiu, Shuke Wang, Hui Liu, Haotian Li, Sumit Keswani, Vishwa Pardeshi, Huijun Zhao, Wei Fan, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Fidelity Investments(富达投资)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 21 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10638 2025-03-20 cs.CV 77%

Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly

Yexin Liu, Zhengyang Liang, Yueze Wang, Xianfeng Wu, Feilong Tang, Muyang He, Jian Li, Zheng Liu, Harry Yang, Sernam Lim, Bo Zhao

机构 * Hong Kong University of Science and Technology(香港科技大学) School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Everlyn AI Youtu Lab, Tencent(腾讯优图实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Central Florida(中佛罗里达大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02044 2024-12-06 eess.IV cs.CV 77%

ASANet: Asymmetric Semantic Aligning Network for RGB and SAR image land cover classification

Pan Zhang, Baochai Peng, Chaoran Lu, Quanjin Huang

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12195 2024-11-20 cs.CV 77%

A Survey of Medical Vision-and-Language Applications and Their Techniques

Qi Chen, Ruoshan Zhao, Sinuo Wang, Vu Minh Hieu Phan, Anton van den Hengel, Johan Verjans, Zhibin Liao, Minh-Son To, Yong Xia, Jian Chen, Yutong Xie, Qi Wu

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16136 2024-10-22 cs.CV cs.AI cs.CL cs.MM 77%

HA-FGOVD: Highlighting Fine-grained Attributes via Explicit Linear Composition for Open-Vocabulary Object Detection

Yuqi Ma, Mengyin Liu, Chao Zhu, Xu-Cheng Yin

专题命中 多模态评测 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03695 2024-08-08 cs.CV 77%

Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling

Zilyu Ye, Jinxiu Liu, Ruotian Peng, Jinjin Cao, Zhiyang Chen, Yiyang Zhang, Ziwei Xuan, Mingyuan Zhou, Xiaoqian Shen, Mohamed Elhoseiny, Qi Liu, Guo-Jun Qi

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14867 2024-06-04 cs.CV cs.AI cs.CL cs.MM 77%

VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation

Max Ku, Dongfu Jiang, Cong Wei, Xiang Yue, Wenhu Chen

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted to ACL2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03248 2025-11-11 cs.CR 76%

Auditing M-LLMs for Privacy Risks: A Synthetic Benchmark and Evaluation Framework

Junhao Li, Jiahao Chen, Zhou Feng, Chunyi Zhou

专题命中 多模态评测 :multimodal(abstract,comments);multi-modal(abstract);cross-modal(abstract)

Comments 14 pages, 3 figures; Accepted by MMM 2026; Complete version in progress. Dataset available at https://huggingface.co/datasets/xaddh/multimodal-privacy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23803 2026-08-26 cs.CV cs.AI cs.LG 新提交 76%

LUCAID: Agentic Multimodal AI for Lung Cancer Precision Pathology

LUCAID:用于肺癌精准病理学的智能体多模态AI

Marie-Lisa Eich, Kai Standvoss, Timo Milbich, Alexander Möllers, Miriam Hägele, Philipp Anders, Lars Tharun, Hanna Kontradiuk, Sebastian Kons, Nader Aldoj, Recepcan Adigüzel, Adam Narai, Lukas Hönig, Jonathan Striebel, Binru Yang, Mihnea P. Dragomir, Marvin Sextro, Philipp Keyl, Philipp Jurmeister, Rosemarie Krupar, Evelyn Ramberger, James Wells, Julika Ribbat-Idel, Andreas Kunft, Hussam Shuaib, Christian Grohé, Reinhard Büttner, David Horst, Klaus-Robert Müller, Lukas Ruff, Maximilian Alber, Frederick Klauschen, Simon Schallenberg

机构 * Institute of Pathology, Charité – Universitätsmedizin Berlin(柏林夏里特医学院病理学研究所) Freie Universität Berlin(柏林自由大学) Humboldt-Universität zu Berlin(柏林洪堡大学) Berlin Institute of Health at Charité – Universitätsmedizin Berlin(柏林夏里特医学院柏林卫生研究所) Aignostics GmbH(Aignostics有限公司) Machine Learning Group, Technical University of Berlin(柏林工业大学机器学习组) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD——柏林学习与数据基础研究所) MVZ HPH Institut für Pathologie und Hämatopathologie GmbH(HPH病理及血液病理诊断中心有限公司)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 该研究开发并临床验证了LUCAID智能体多模态AI系统,其覆盖肺癌病理全流程任务,前瞻性验证中临床决策一致性达93.0%,优于经验丰富的胸病理学家,解决了现有AI工具的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14741 2026-08-18 cs.CV cs.AI 新提交 76%

PolyComp: A Polycube-based Benchmark for Compositional 3D Spatial Reasoning in Multimodal Models

PolyComp:面向多模态模型组合式3D空间推理的基于多立方体(polycube)的基准测试集

Siddharth Patel

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 该研究推出PolyComp基准测试集,考察多模态模型的组合式3D空间推理能力,测试了GPT-5.6 Sol等模型的准确率与成本,并发布了120个问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10706 2026-08-18 cs.CV cs.MM 版本更新 76%

MMArt: A Multi-Perspective Multimodal Dataset for Visual Art Understanding

MMArt:用于视觉艺术理解的多视角多模态数据集

Shuai Wang, Wangyuan Ding, Yixian Shen, Jia-Hong Huang, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.MM

AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10240 2026-07-14 cs.CV cs.MM 新提交 76%

What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks

你的简答题VQA分数实际衡量的是什么?多模态简答题基准中依赖评估者的不稳定性

Guanhua Ye, Niu Jingbin, Yan Li, Meiyu Liang, Zhe Xue, Yingxia Shao, Yawen Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.MM

AI总结 研究简答题VQA基准中模型答案语义正确性与和评估者期望表面形式匹配度被混淆的问题,通过人工验证语义判断等方法研究六个视觉语言模型和六个基准,发现答案类型影响不稳定性,提出官方分数应伴有语义审计和答案类型诊断以保持可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09880 2026-07-14 cs.CL cs.AI 新提交 76%

CLIR-Bench: Benchmarking Multimodal Question Answering over Irregular Clinical Time Series

CLIR-Bench:针对不规则临床时间序列的多模态问答基准测试

Frank Nie, Ethan B. Liu, Yuan Zhu, Loe Yan, Wei Fan, Jindong Han

机构 * Shandong University(山东大学) University of Auckland(奥克兰大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

AI总结 研究针对临床时间序列稀疏、不规则等问题,引入CLIR-Bench基准,通过四阶段流程构建,含6600个问答实例。实验发现现有通用模型处理稀疏临床证据困难,强调需更强不规则时间序列推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17294 2026-07-01 cs.CL cs.AI cs.LG 版本更新 76%

From Multimodal Perception to Strategic Reasoning: A Survey on AI-Generated Game Commentary

从多模态感知到策略推理:AI生成游戏评论综述

Qirui Zheng, Xingbo Wang, Keyuan Cheng, Yunlong Lu, Muhammad Asif Ali, Lingfeng Li, Yongyi Wang, Wenxin Li

机构 * Peking University(北京大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

AI总结 本文提出统一框架,将AI生成游戏评论分为描述性、分析性和背景性三类,综述方法、数据集和评估指标,并指出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12106 2026-06-11 cs.CV cs.AI 新提交 76%

MSUE: Multi-Modal Soccer Understanding Expert

MSUE:多模态足球理解专家

Litao Li, Yibo Yu, Yufeng Hu, Zhuo Yang, Jiali Wen, Yixin Chen, Yixi Zhou

机构 * South China University of Technology(华南理工大学) Johns Hopkins University(约翰霍普金斯大学) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI

AI总结 提出MSUE多专家问答架构,结合VLM数据合成管道与LLM动态调度文本、图像、视频专家,在SoccerNet VQA挑战中达到0.95准确率,获第三名。

Comments 6 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07645 2026-06-09 cs.CV cs.AI 新提交 76%

FineGen: A VLM-based Multi-Agent Framework for Fine-Grained Image-Text Dataset Construction

FineGen:基于VLM的多智能体框架用于细粒度图像-文本数据集构建

Chang Kong, Yuebing Li, Peng Mo, Haigang Zhang, Qiuming Luo

机构 * Shenzhen Polytechnic University(深圳职业技术大学) Institute of Applied Artificial Intelligence of the Guangdong-Hong Kong Macao Greater Bay Area(粤港澳大湾区应用人工智能研究所) Shenzhen University(深圳大学)

专题命中 多模态评测 :image-text(title);分类 cs.CV、cs.AI

AI总结 提出FineGen框架,通过生成-验证-校正流水线和闭环反馈机制自动构建含硬负样本的细粒度数据集,在ImageNet上构建FineGen-100K,硬样本准确率提升14.4%。

Comments 15 pages, 2 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02857 2026-05-28 cs.CV cs.AI cs.CY 76%

Deepfake-Eval-2024: A Multi-Modal In-the-Wild Benchmark of Deepfakes Circulated in 2024

Deepfake-Eval-2024:2024年传播的深度伪造多模态野外基准

Nuria Alina Chandra, Hannah Lee, Ryan Murtfeldt, Lin Qiu, Arnab Karmakar, Emmanuel Tanumihardja, Kevin Farhat, Ben Caffee, Changyeon Lee, Jongwook Choi, Sejin Paik, Aerin Kim, Oren Etzioni

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) University of Maryland(马里兰大学) Chung-Ang University(Chung-Ang 大学) Georgetown University(乔治城大学) Miraflow AI

专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI

AI总结 针对现有学术基准过时且不反映真实深度伪造的问题,提出包含2024年社交媒体和用户提交的多模态深度伪造基准Deepfake-Eval-2024,评估发现开源模型性能大幅下降,而商业模型和微调模型表现更优但未达到专家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21796 2026-05-22 cs.CV cs.CL 76%

MM-Conv: A Multimodal Dataset and Benchmark for Context-Aware Grounding in 3D Dialogue

MM-Conv: 一种多模态数据集和基准,用于上下文感知的3D对话中指代解析

Anna Deichler, Jim O'Regan, Fethiye Irmak Dogan, Lubos Marcinek, Anna Klezovich, Iolanda Leite, Jonas Beskow

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL

AI总结 本文提出了一种多模态数据集和基准,用于在动态3D环境中实现上下文感知的指代解析,通过引入包含6.7小时第一人称VR交互的同步语音、动作、注视和3D场景几何数据的基准,以及一个两阶段的指代解析流水线,改进了对话中的指代解析性能。

Comments Extended version of the paper published at LREC 2026 (Palma de Mallorca, Spain), with expanded VLM baselines and inter-annotator agreement analysis

Journal ref Proceedings of the 15th Language Resources and Evaluation Conference (LREC 2026), Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26382 2026-04-30 cs.CL cs.AI cs.IR 76%

Benchmarking Complex Multimodal Document Processing Pipelines: A Unified Evaluation Framework for Enterprise AI

复杂多模态文档处理流水线评估:面向企业AI的统一评估框架

Saurabh K. Singh, Sachin Raj

机构 * Oracle(Oracle公司) Independent(独立)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

AI总结 本文提出EnterpriseDocBench评估框架,评估企业文档AI流水线的各阶段性能,发现混合检索优于BM25,但生成质量不足,揭示了各阶段间弱相关性及实际部署中准确性与完整性之间的差距。

Comments 16 pages, 4 tables. Code, metrics, and pilot data to be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21102 2026-04-24 cs.CV cs.AI 76%

Leveraging Multimodal LLMs for Built Environment and Housing Attribute Assessment from Street-View Imagery

利用多模态大语言模型进行基于街景图像的建筑环境和住房属性评估

Siyuan Yao, Siavash Ghorbany, Kuangshi Ai, Arnav Cherukuthota, Meghan Forstchen, Alexis Korotasz, Matthew Sisk, Ming Hu, Chaoli Wang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本文提出利用大语言模型和谷歌街景图像自动评估美国全国建筑状况,通过微调Gemma 3 27B模型并结合知识蒸馏,实现高效准确的建筑评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05005 2026-04-14 cs.CY cs.AI cs.CL 76%

EduIllustrate: Towards Scalable Automated Generation Of Multimodal Educational Content

EduIllustrate:迈向可扩展的自动多模态教育内容生成

Shuzhen Bi, Mingzi Zhang, Zhuoxuan Li, Xiaolong Wang, Keqian Li, Aimin Zhou

机构 * Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

AI总结 本文提出EduIllustrate基准,用于评估LLM在K-12 STEM问题中生成图文结合解释的能力,通过230道题和8维度评估标准,揭示LLM在视觉一致性与成本效率上的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03774 2026-04-07 cs.CV cs.AI 76%

When Does Multimodal AI Help? Diagnostic Complementarity of Vision-Language Models and CNNs for Spectrum Management in Satellite-Terrestrial Networks

何时多模态AI有所帮助?视觉-语言模型与CNN在卫星-地面网络中的频谱管理中的诊断互补性

Yuanhang Li

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本文研究了视觉-语言模型与CNN在频谱管理中的互补性,提出SpectrumQA基准测试,并发现CNN在空间定位任务中表现优异,而VLM在语义推理任务中具有独特优势,通过任务类型路由器可提升整体性能。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏