arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-07 至 2026-01-07 共收录 47 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2510.10069 2026-01-07 cs.AI cs.MM 84%

SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation

SyncLipMAE:用于音频视觉谈话面部表示的对比掩码预训练

Zeyu Ling, Xiaodong Gu, Jiangnan Tang, Changqing Zou

机构 * State Key Laboratory of CAD&CG(CAD与CG国家重点实验室) ByteDance(字节跳动)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 SyncLipMAE通过对比掩码预训练实现音频视觉谈话面部的同步感知表示,适用于多下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03233 2026-01-07 cs.CV 74%

LTX-2: Efficient Joint Audio-Visual Foundation Model

LTX-2:高效的音频-视觉联合基础模型

Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, Eitan Richardson, Guy Shiran, Itay Chachy, Jonathan Chetboun, Michael Finkelson, Michael Kupchick, Nir Zabari, Nitzan Guetta, Noa Kotler, Ofir Bibi, Ori Gordon, Poriya Panet, Roi Benita, Shahar Armon, Victor Kulikov, Yaron Inger, Yonatan Shiftan, Zeev Melumian, Zeev Farbman

机构 * Lightricks(利光科技)

专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV

AI总结 LTX-2是一种高效的音频-视觉联合基础模型,通过统一的双流变压器架构生成高质量的音频视觉内容,支持多语言提示和模态感知的可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02753 2026-01-07 eess.AS 70%

Vclip: Face-based Speaker Generation by Face-voice Association Learning

基于面部的语音生成:通过面部-语音关联学习

Yao Shi, Yunfei Xu, Hongbin Suo, Yulong Wan, Haifeng Liu

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 Vclip通过面部-语音关联学习实现基于面部的语音生成,利用CLIP编码器和检索策略提升语音合成质量。

Comments work done in 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02624 2026-01-07 cs.HC 67%

EgoLog: Ego-Centric Fine-Grained Daily Log with Ubiquitous Wearables

EgoLog:基于普及式可穿戴设备的以自我为中心的细粒度日常日志

Lixing He, Bufang Yang, Di Duan, Zhenyu Yan, Guoliang Xing

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 EgoLog通过融合音频与IMU数据及LLM推理,实现了基于普及式可穿戴设备的细粒度日常日志识别,提升了场景和活动识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频多模态 4 篇

2601.02968 2026-01-07 cs.AI 79%

Rationale-Grounded In-Context Learning for Time Series Reasoning with Multimodal Large Language Models

基于理由的上下文学习用于多模态大语言模型的时间序列推理

Qingxiang Liu, Zhiqing Cui, Xiaoliang Luo, Yuqian Wu, Zhuoyang Jiang, Huaiyu Wan, Sheng Sun, Lvchun Wang, Wei Yu, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) China Mobile (Jiangxi) Virtual Reality Technology Co., Ltd.(中国移动(江西)虚拟现实技术有限公司) School of Computer and Information Technology, Beijing Jiaotong University(北京交通大学计算机与信息学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出RationaleTS方法,通过基于理由的上下文学习提升多模态大语言模型在时间序列推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19542 2026-01-07 cs.CV 79%

CVBench: Benchmarking Cross-Video Synergies for Complex Multimodal Reasoning

CVBench: 多视频协同推理的基准测试

Nannan Zhu, Yonghao Dong, Teng Wang, Xueqian Li, Shengjun Deng, Yijia Wang, Zheng Hong, Tiantian Geng, Guo Niu, Hanyan Huang, Xiongfei Yao, Shuaiwei Jiao

机构 * Sun Yat-sen University(中山大学) University of Hong Kong(香港大学) Foshan University(佛山大学) University of Birmingham(伯明翰大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 CVBench通过跨视频关系推理基准测试,揭示多模态大语言模型在跨视频时空推理中的性能差距及架构瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02908 2026-01-07 cs.CV cs.AI cs.LG 62%

TA-Prompting: Enhancing Video Large Language Models for Dense Video Captioning via Temporal Anchors

TA-Prompting: 通过时间锚点增强视频大语言模型以实现密集视频描述

Wei-Yuan Cheng, Kai-Po Chang, Chi-Pin Huang, Fu-En Yang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国家交通大学通信工程研究所) NVIDIA(NVIDIA公司)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 TA-Prompting通过引入时间锚点提升视频大语言模型的密集视频描述能力,有效解决时间边界识别问题,提升时间感知视频事件理解性能。

Comments 8 pages for main paper (exclude citation pages), 6 pages for appendix, totally 10 figures 7 tables and 2 algorithms. The paper is accepted by WACV 2026

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02777 2026-01-07 cs.RO 50%

M-SEVIQ: A Multi-band Stereo Event Visual-Inertial Quadruped-based Dataset for Perception under Rapid Motion and Challenging Illumination

M-SEVIQ:一种多波段立体事件视觉-惯性四足机器人数据集,用于快速运动和恶劣光照下的感知

Jingcheng Cao, Chaoran Xiong, Jianmin Song, Shang Yan, Jiachen Liu, Ling Pei

机构 * Shanghai Key Laboratory of Navigation & Location Based Services, Shanghai Jiao Tong University(上海导航与基于位置的服务关键实验室,上海交通大学) Beijing Aerospace Microsystem and Information Technology Research Institute(北京航天微系统与信息技术研究所)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 M-SEVIQ是一种多波段立体事件视觉-惯性四足机器人数据集,用于快速运动和恶劣光照下的感知研究。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 跨模态检索 5 篇

2601.02365 2026-01-07 cs.IR cs.AI cs.CL cs.LG 82%

FUSE : Failure-aware Usage of Subagent Evidence for MultiModal Search and Recommendation

FUSE : 多模态搜索与推荐中子代理证据的故障感知使用

Tushar Vatsa, Vibha Belavadi, Priya Shanmugasundaram, Suhas Suresha, Dewang Sultania

机构 * Adobe Inc.(Adobe公司)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 FUSE通过上下文压缩策略提升多模态搜索与推荐性能,实现93.3%的意图准确率和99.4%的召回率。

Comments ICDM MMSR 2025: Workshop on Multimodal Search and Recommendations

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15201 2026-01-07 cs.CV cs.MM 82%

Towards Unbiased Cross-Modal Representation Learning for Food Image-to-Recipe Retrieval

迈向食品图像到食谱检索的无偏跨模态表示学习

Qing Wang, Chong-Wah Ngo, Ee-Peng Lim

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文通过因果理论解决食品图像到食谱检索中的偏见问题,提出因果干预方法和多标签分类器,提升检索性能。

Comments Code link: https://github.com/GZWQ/Towards-Unbiased-Cross-Modal-Representation-Learning-for-Food-Image-to-Recipe-Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18867 2026-01-07 cs.AI 79%

Topological Perspectives on Optimal Multimodal Embedding Spaces

拓扑视角下的最优多模态嵌入空间

Abdul Aziz A. B, A. B Abdul Rahim

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文通过拓扑数据分析比较CLIP和CLOOB的嵌入空间,揭示其模态差距驱动因素和维度坍缩的影响,为多模态模型优化提供新视角。

Comments This manuscript contains substantive technical inaccuracies and an incomplete treatment of the stated topic. Subsequent developments and a reassessment of the problem indicate that the scope and framing of the work do not adequately reflect the current state of research, and the analysis is therefore incomplete and outdated

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21121 2026-01-07 cs.IR cs.AI 57%

Beyond Patch Aggregation: 3-Pass Pyramid Indexing for Vision-Enhanced Document Retrieval

超越补丁聚合:面向视觉增强文档检索的三阶段金字塔索引

Anup Roy, Rishabh Gyanendra Upadhyay, Animesh Rameshbhai Panara, Robin Mills, Aidan Millar

机构 * Inception AI Mubadala

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 VisionRAG是一种无OCR、模型无关的多模态检索系统,通过三阶段金字塔索引提升文档检索效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02807 2026-01-07 cs.IR cs.LG 50%

COFFEE: COdesign Framework for Feature Enriched Embeddings in Ads-Ranking Systems

COFFEE:广告排序系统中特征增强嵌入的协同设计框架

Sohini Roychowdhury, Doris Wang, Qian Ge, Joy Mu, Srihari Reddy

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 COFFEE框架通过整合多样化事件源、延长用户历史和多模态嵌入,提升广告排序系统中用户-广告表示的准确性和规模效应。

Comments 4 pages, 5 figures, 1 table

Journal ref WSDM, Web and Graph Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态生成 7 篇

2601.03250 2026-01-07 cs.CV 79%

A Versatile Multimodal Agent for Multimedia Content Generation

多功能多模态代理用于多媒体内容生成

Daoan Zhang, Wenlin Yao, Xiaoyang Wang, Yebowen Hu, Jiebo Luo, Dong Yu

机构 * University of Rochester(罗切斯特大学) Tencent AI Lab, Bellevue(腾讯AI实验室) University of Central Florida(中央佛罗里达大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种多功能多模态代理,通过技能获取理论和两阶段相关策略,实现复杂多媒体内容生成任务的自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02766 2026-01-07 cs.RO cs.AR 78%

Advancing Assistive Robotics: Multi-Modal Navigation and Biophysical Monitoring for Next-Generation Wheelchairs

推动辅助机器人:多模态导航与生物物理监测用于下一代轮椅

Md. Anowar Hossain, Mohd. Ehsanul Hoque

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出了一种多模态轮椅控制系统,结合多种输入接口与生物物理监测,提升患者独立性并实现护理人员实时监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02771 2026-01-07 cs.CV 77%

AbductiveMLLM: Boosting Visual Abductive Reasoning Within MLLMs

AbductiveMLLM: 提升多模态大语言模型中的视觉归纳推理

Boyu Chang, Qi Wang, Xi Guo, Zhixiong Nan, Yazhou Yao, Tianfei Zhou

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 AbductiveMLLM通过结合REASONER和IMAGINER组件,提升多模态大语言模型在视觉归纳推理中的性能。

Comments Accepted by AAAI 2026 as Oral. Code:https://github.com/ChangPtR/AbdMLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02683 2026-01-07 cs.AI 70%

Learning from Prompt itself: the Hierarchical Attribution Prompt Optimization

从提示本身学习:层次归因提示优化

Dongyu Chen, Jian Ma, Xianpeng Zhang, Lei Zhang, Haonan Lu, Chen Chen, Chuangchuang Wang, Kai Tang

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.AI

AI总结 HAPO框架通过动态归因机制、语义单元优化和多模态支持,提升提示优化效率,适用于多任务场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10963 2026-01-07 cs.CV cs.CL 62%

MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning

MMMG:大规模、跨学科、多层级的文本到图像推理生成基准

Yuxuan Luo, Yuhui Yuan, Junwen Chen, Haonan Cai, Ziyi Yue, Yuwei Yang, Fatima Zohra Daha, Ji Li, Zhouhui Lian

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出MMMG基准,用于评估文本到图像生成模型的推理能力,揭示现有模型在知识图像生成中的不足,并发布FLUX-Reason作为开放基线。

Comments 85 pages, 70 figures, code: https://github.com/MMMGBench/MMMG, project page: https://mmmgbench.github.io/

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025) Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17103 2026-01-07 cs.CL cs.AI 62%

Forging Time Series with Language: A Large Language Model Approach to Synthetic Data Generation

用语言锻造时间序列:一种基于大语言模型的合成数据生成方法

Cécile Rousseau, Tobia Boschi, Giandomenico Cornacchia, Dhaval Salwala, Alessandra Pascale, Juan Bernabe Moreno

机构 * IBM Research Europe(IBM欧洲研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 SDForger通过大语言模型生成高质量多变量时间序列,利用文本条件化实现高效合成数据生成及多模态建模。

Journal ref NeurIPS 2025, https://openreview.net/forum?id=A2pmvkqOgp

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15002 2026-01-07 cs.CV 57%

How Many Images Does It Take? Estimating Imitation Thresholds in Text-to-Image Models

需要多少张图片?文本到图像模型中模仿阈值的估计

Sahil Verma, Royi Rassin, Arnav Das, Gantavya Bhatt, Preethi Seshadri, Chirag Shah, Jeff Bilmes, Hannaneh Hajishirzi, Yanai Elazar

机构 * University of Washington, Seattle(华盛顿大学) Bar-Ilan University(巴伊兰大学) University of California, Irvine(加州大学伊文斯顿分校) Allen Institute of AI(人工智能研究院)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 研究通过评估文本到图像模型的模仿阈值,探讨其在版权和隐私合规中的应用。

Comments Accepted at TMLR 2025, ATTRIB, RegML, and SafeGenAI workshops at NeurIPS 2024 and NLLP Workshop 2024. https://openreview.net/forum?id=x0qJo7SPhs

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态评测 14 篇

2601.02422 2026-01-07 cs.CV cs.AI 84%

Watch Wider and Think Deeper: Collaborative Cross-modal Chain-of-Thought for Complex Visual Reasoning

拓宽视野并深入思考:协作式跨模态链式推理用于复杂视觉推理

Wenting Lu, Didi Zhu, Tao Shen, Donglin Zhu, Ayong Ye, Chao Wu

机构 * Fujian Normal University(福建师范大学) Zhejiang University(浙江大学) Zhejiang Normal University(浙江师范大学)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 CoCoT通过动态多区域定位和关系感知推理,提升复杂视觉推理性能,在多个基准测试中实现显著准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02443 2026-01-07 cs.CV cs.AI eess.IV 84%

Evaluating the Diagnostic Classification Ability of Multimodal Large Language Models: Insights from the Osteoarthritis Initiative

评估多模态大语言模型的诊断分类能力:来自骨关节炎倡议的见解

Li Wang, Xi Chen, XiangWen Deng, HuaHui Yi, ZeKun Jiang, Kang Li, Jian Li

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 研究发现,多模态大语言模型在医学图像分类中表现不佳,建议优先优化视觉编码器和数据集质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02677 2026-01-07 cs.LG q-fin.RM q-fin.ST 82%

Uni-FinLLM: A Unified Multimodal Large Language Model with Modular Task Heads for Micro-Level Stock Prediction and Macro-Level Systemic Risk Assessment

Uni-FinLLM:一种具有模块化任务头的统一多模态大语言模型,用于微观层面的股票预测和宏观层面的系统性风险评估

Gongao Zhang, Haijiang Zeng, Lu Jiang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 Uni-FinLLM通过统一多模态大语言模型,结合模块化任务头,实现了对股票预测和系统性风险评估的高效联合建模,显著提升了预测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20100 2026-01-07 cs.LG cs.AI cs.CL cs.CV 82%

MIRAGE: A Benchmark for Multimodal Information-Seeking and Reasoning in Agricultural Expert-Guided Conversations

MIRAGE:农业专家引导对话中多模态信息检索与推理的基准

Vardhan Dongre, Chi Gui, Shubham Garg, Hooshang Nayyeri, Gokhan Tur, Dilek Hakkani-Tür, Vikram S. Adve

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MIRAGE是一个用于农业专家引导对话中多模态信息检索与推理的基准,通过真实用户-专家交互数据,提供高保真的多模态推理评估平台。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03017 2026-01-07 cs.CL 79%

MMFormalizer: Multimodal Autoformalization in the Wild

MMFormalizer: 多模态自动形式化

Jing Xiong, Qi Han, Yunta Hsieh, Hui Shen, Huajian Xin, Chaofan Tao, Chenyang Zhao, Hengyuan Zhang, Taiqiang Wu, Zhen Zhang, Haochen Wang, Zhongwei Wan, Lingpeng Kong, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Edinburgh(爱丁堡大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Ohio State University(俄亥俄州立大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 MMFormalizer通过整合适应性定位与现实世界数学物理领域实体,实现多模态自动形式化,首次处理经典力学、相对论、量子力学和热力学等复杂领域。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16753 2026-01-07 cs.AI 79%

ELMM: Efficient Lightweight Multimodal Large Language Models for Multimodal Knowledge Graph Completion

ELMM: 为多模态知识图谱补全设计的高效轻量多模态大语言模型

Wei Huang, Peining Li, Meiyu Liang, Xu Hou, Junping Du, Yingxia Shao, Guanhua Ye, Wu Liu, Kangkang Lu, Yang Yu

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(计算机学院,北京邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 ELMM通过多视图视觉标记压缩和注意力修剪策略,高效解决多模态知识图谱补全中的模态冲突和计算成本问题,实现最先进的性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07747 2026-01-07 cs.CV 79%

X-RAFT: Cross-Modal Non-Rigid Registration of Blue and White Light Neurosurgical Hyperspectral Images

X-RAFT:跨模态非刚性注册蓝光和白光神经外科高光谱图像

Charlie Budd, Silvère Ségaud, Matthew Elliot, Graeme Stasiuk, Yijing Xie, Jonathan Shapey, Tom Vercauteren

机构 * Department of Surgical \& Interventional Engineering, School of Biomedical Engineering \& Imaging Sciences, King's College London, London SE1 7EH Department of Neurosurgery, King's College London Hospital NHS Foundation Trust, London SE5 9RS, UK. Department of Imaging Chemistry \& Biology, School of Biomedical Engineering \& Imaging Sciences, King's College London, London SE1 7EH, UK.

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 X-RAFT通过跨模态输入优化,实现蓝光和白光神经外科高光谱图像的非刚性注册,提升定量荧光测量精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02825 2026-01-07 cs.CV 79%

SketchThinker-R1: Towards Efficient Sketch-Style Reasoning in Large Multimodal Models

SketchThinker-R1: 向大多模态模型中高效实现草图式推理迈进

Ruiyang Zhang, Dongzhan Zhou, Zhedong Zheng

机构 * FST and ICI, University of Macau, China(澳门大学FST和ICI) Shanghai AI Laboratory, China(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 SketchThinker-R1通过引入草图式推理机制,显著降低大得多模态模型的推理token成本,同时保持答案准确性。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02399 2026-01-07 cs.SE cs.AI 79%

ProSoftArena: Benchmarking Hierarchical Capabilities of Multimodal Agents in Professional Software Environments

ProSoftArena:在专业软件环境中评估多模态智能体分层能力的基准测试

Jiaxin Ai, Yukang Feng, Fanrui Zhang, Jianwen Sun, Zizhen Li, Chuanhao Li, Yifan Chang, Wenxiao Wu, Ruoxi Wang, Mingliang Zhai, Kaipeng Zhang

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 ProSoftArena通过构建专业软件环境下的多模态智能体能力评估基准,揭示了智能体在复杂专业工作流任务中的性能瓶颈和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04141 2026-01-07 cs.AI 79%

The Artificial Intelligence Cognitive Examination: A Survey on the Evolution of Multimodal Evaluation from Recognition to Reasoning

人工智能认知测评:多模态评估从识别到推理的演变综述

Mayank Ravishankara, Varindra V. Persad Maharaj

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文综述了多模态AI评估从识别到推理的演变,探讨了测评方法的转变及当前前沿基准的发展。

Journal ref IEEE Access, vol. 14, Dec. 2025, Art. no. 3649182

详情

展开后加载摘要…

URL PDF HTML 收藏