arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-27 至 2026-01-27 共收录 116 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 10 篇

2601.17041 2026-01-27 cs.CV cs.AI 81%

Arabic Sign Language Recognition using Multimodal Approach

阿拉伯手语识别的多模态方法

Ghadeer Alanazi, Abir Benabid

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出结合Leap Motion和RGB摄像头的多模态方法,用于提高阿拉伯手语识别的准确率,实验结果显示78%的识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17123 2026-01-27 cs.HC cs.CV cs.RO 79%

Acoustic Field Video for Multimodal Scene Understanding

用于多模态场景理解的声学场视频

Daehwa Kim, Chris Harrison

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出声学场视频作为多模态场景理解的新输入方式,通过整合空间声学数据显著提升视觉-语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17611 2026-01-27 eess.AS cs.LG cs.SD eess.IV eess.SP 70%

ToS: A Team of Specialists ensemble framework for Stereo Sound Event Localization and Detection with distance estimation in Video

ToS: 一种针对视频中立体声音事件定位与检测的专家团队集成框架,包含距离估计

Davide Berghi, Philip J. B. Jackson

机构 * Centre for Vision, Speech Signal Processing (CVSSP) University of Surrey, Guildford, U.K.

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 ToS框架通过整合三个互补子网络,有效解决视频中立体声音事件定位与检测的多维度推理问题,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08487 2026-01-27 cs.CV cs.AI cs.MA 62%

MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling

MAViS:一个用于长序列视频叙事的多智能体框架

Qian Wang, Ziqi Huang, Ruoxi Jia, Paul Debevec, Ning Yu

机构 * Virginia Tech(弗吉尼亚理工大学) Nanyang Technological University(南洋理工大学) Eyeline Studios(Eyeline工作室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MAViS通过多智能体协作框架提升长序列视频生成的辅助能力、视觉质量和表达性,支持多模态输出。

Comments Video Generation Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06835 2026-01-27 cs.CV 57%

X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding

X-LeBench:一个用于极长第一人称视频理解的基准数据集

Wenqi Zhou, Kai Cao, Hao Zheng, Yunze Liu, Xinyi Zheng, Miao Liu, Per Ola Kristensson, Walterio Mayol-Cuevas, Fan Zhang, Weizhe Lin, Junxiao Shen

机构 * University of Bristol(布里斯托大学) University of Manchester(曼彻斯特大学) University of Cambridge(剑桥大学) College of AI, Tsinghua University(清华大学人工智能学院) Meta Memories.ai Research(Memories.ai研究)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 X-LeBench通过模拟真实日常生活场景,构建了首个极长第一人称视频理解基准数据集,揭示了长视频理解中的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02621 2026-01-27 physics.soc-ph cond-mat.stat-mech 50%

From motifs to Lévy flights: Modeling urban mobility in Bogotá's public transport system

从模式到莱维飞行:对波哥大公共交通系统的机动性建模

Juan F. Alayón-Martínez, Alejandro P. Riascos

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文通过分析波哥大公共交通系统的通行记录,发现其移动模式符合莱维飞行动力学,提出了一种基于用户记录的复杂交通系统分析新方法。

Comments 20 pages, 7 figures

Journal ref J. Stat. Mech. (2026) 013403

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03400 2026-01-27 cs.RO 50%

Close-Fitting Dressing Assistance Based on State Estimation of Feet and Garments with Semantic-based Visual Attention

基于足部与衣物状态估计的近身穿衣辅助

Takuma Tsukakoshi, Tamon Miyake, Tetsuya Ogata, Yushi Wang, Takumi Akaishi, Shigeki Sugano

机构 * Creative Science and Engineering Faculty, Waseda Univ.(早稻田大学创意科学与工程学部) Future Robotics Organization, Waseda Univ.(早稻田大学未来机器人组织) Faculty of Science and Engineering, Waseda Univ.(早稻田大学科学与工程学部) The National Institute of Advanced Science and Technology(日本国家先进科学与技术研究院)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本研究提出基于语义信息的穿衣辅助方法,通过多模态数据融合实现对足部和衣物状态的精准估计,成功帮助10名受试者穿袜子,优于其他方法。

Comments Accepted at RA-L, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08684 2026-01-27 cs.RO 50%

A Computationally Efficient Maximum A Posteriori Sequence Estimation via Stein Variational Inference

通过Stein变分推断实现计算高效的最大后验序列估计

Min-Won Seo, Solmaz S. Kia

机构 * Department of Mechanical and Aerospace Engineering, University of California, Irvine(加州大学尔湾分校机械与航空航天工程系)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出Stein-MAP-Seq方法,通过整合Stein变分梯度下降与动态规划算法,实现高效多模态状态估计。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 6 篇

2510.26861 2026-01-27 cs.IR cs.CL 83%

Evaluating Perspectival Biases in Cross-Modal Retrieval

评估跨模态检索中的视角偏差

Teerapol Saengsukhiran, Peerawat Chomphooyod, Narabodee Rodjananant, Chompakorn Chaksangchaichot, Patawee Prakrankamanant, Witthawin Sripheanpol, Pak Lovichit, Sarana Nutanong, Ekapol Chuangsuwanich

机构 * Department of Computer Engineering, Chulalongkorn University(楚莱隆坤大学计算机工程系) School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 本文提出3XCM基准,揭示跨模态检索中语言和文化偏见的影响,强调需通过解耦策略实现公平检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16984 2026-01-27 cs.LG cs.AI cs.CL cs.CV cs.IR cs.MM 83%

TelcoAI: Advancing 3GPP Technical Specification Search through Agentic Multi-Modal Retrieval-Augmented Generation

TelcoAI: 通过代理多模态检索增强生成技术推进3GPP技术规范搜索

Rahul Ghosh, Chun-Hao Liu, Gaurav Rele, Vidya Sagar Ravipati, Hazar Aouad

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(生成式AI创新中心,亚马逊网络服务)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 TelcoAI通过代理多模态检索增强生成技术,提升3GPP技术规范搜索的准确性和效率,实现87%的召回率和16%的性能提升。

Comments Accepted to IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15434 2026-01-27 cs.CE 78%

ManuRAG: Multi-modal Retrieval Augmented Generation for Manufacturing Question Answering (Early Version)

ManuRAG:面向制造业问答的多模态检索增强生成

Yunqing Li, Zihan Dong, Farhad Ameri, Jianbang Zhang

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 ManuRAG通过多模态检索增强生成技术,提升制造业问答的准确性与可靠性,适用于多种领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17905 2026-01-27 cs.CV cs.AI stat.ML 62%

Feature-Space Generative Models for One-Shot Class-Incremental Learning

特征空间生成模型用于单样本类增量学习

Jack Foster, Kirill Paramonov, Mete Ozay, Umberto Michieli

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 Gen1S通过特征空间生成模型提升单样本类增量学习中的新类识别性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18195 2026-01-27 cs.CV 57%

QualiRAG: Retrieval-Augmented Generation for Visual Quality Understanding

QualiRAG:用于视觉质量理解的检索增强生成

Linhan Cao, Wei Sun, Weixia Zhang, Xiangyang Zhu, Kaiwei Zhang, Jun Jia, Dandan Zhu, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 QualiRAG通过检索增强生成框架,利用大模型的潜在感知知识,实现无需训练的视觉质量理解与比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05293 2026-01-27 cs.CV 57%

Cross-domain EEG-based Emotion Recognition with Contrastive Learning

跨领域EEG情感识别与对比学习

Rui Yan, Yibo Li, Han Ding, Fei Wang

机构 * School of Software Engineering, Xi'an Jiaotong University, China(西安交通大学软件工程学院) School of Computer Science and Technology, Xi'an Jiaotong University, China(西安交通大学计算机科学与技术学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 EmotionCLIP通过多模态对比学习提升EEG情感识别的跨领域泛化能力,实现跨受试者和跨时间的高准确率

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 9 篇

2601.17761 2026-01-27 cs.LG cs.AI cs.CL 84%

AR-Omni: A Unified Autoregressive Model for Any-to-Any Generation

AR-Omni:一种统一的自回归模型用于任意到任意生成

Dongjie Cheng, Ruifeng Yuan, Yongqi Li, Runyang You, Wenjie Wang, Liqiang Nie, Lei Zhang, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态生成 :any-to-any(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 AR-Omni提出一种无需专家解码器的统一自回归模型,实现多模态任意到任意生成,解决模态不平衡、视觉保真度和稳定性与创造力平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02567 2026-01-27 cs.CV 84%

Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities

统一的多模态理解和生成模型:进展、挑战与机遇

Shanshan Zhao, Xinjie Zhang, Jintao Guo, Jiakui Hu, Lunhao Duan, Minghao Fu, Yong Xien Chng, Guo-Hua Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团) Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文探讨了多模态理解和生成模型的统一进展、挑战与机遇,分析了不同架构范式及未来研究方向。

Comments In this version, we incorporate new papers (after Aug. 2025), datasets, and benchmarks. This work is still in progress; Github project: https://github.com/AIDC-AI/Awesome-Unified-Multimodal-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20406 2026-01-27 cs.RO cs.LG 78%

PointMapPolicy: Structured Point Cloud Processing for Multi-Modal Imitation Learning

PointMapPolicy: 结构化点云处理用于多模态模仿学习

Xiaogang Jia, Qian Wang, Anrui Wang, Han A. Wang, Balázs Gyenes, Emiliyan Gospodinov, Xinkai Jiang, Ge Li, Hongyi Zhou, Weiran Liao, Xi Huang, Maximilian Beck, Moritz Reuss, Rudolf Lioutikov, Gerhard Neumann

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Reality Labs, Meta(Meta现实实验室) Johannes Kepler University Linz(林茨约翰尼斯·开普勒大学)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 PointMapPolicy通过结构化点云处理提升多模态模仿学习的精度与泛化能力,利用xLSTM融合点云与RGB数据,在RoboCasa和CALVIN基准中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18234 2026-01-27 cs.CY cs.AI cs.CL 62%

Generative AI in Saudi Arabia: A National Survey of Adoption, Risks, and Public Perceptions

生成式人工智能在沙特阿拉伯:国家调查:采用、风险和公众认知

Abdulaziz AlDakheel, Ali Alshehre, Esraa Alamoudi, Moslim AlKhabbaz, Ahmed Aljohani, Raed Alharbi

机构 * College of Computing and Informatics, Saudi Electronic University(计算机与信息学院,沙特电子大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过全国调查分析沙特阿拉伯GenAI的采用情况、风险和公众认知,发现93%的受访者积极使用GenAI进行文本任务,但整体意识和理解不均衡,需加强AI素养和伦理培训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17673 2026-01-27 cs.CV cs.AI 62%

Uni-RS: A Spatially Faithful Unified Understanding and Generation Model for Remote Sensing

Uni-RS: 一种用于遥感的具有空间忠实性的统一理解和生成模型

Weiyu Zhang, Yuan Hu, Yong Li, Yu Liu

机构 * Institute of Remote Sensing and Geographic Information System, School of Earth and Space Sciences, Peking University(遥感与地理信息系统研究所,地球与空间科学学院,北京大学) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(土木与环境工程系,香港科学与技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Uni-RS通过空间布局规划、空间感知查询监督和图像描述空间布局变化,提升遥感文本到图像生成的空间忠实性,同时保持多模态理解任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17096 2026-01-27 cs.CY cs.AI cs.CL 62%

Beyond Instrumental and Substitutive Paradigms: Introducing Machine Culture as an Emergent Phenomenon in Large Language Models

超越工具性和替代性范式:引入机器文化作为大型语言模型中的涌现现象

Yueqing Hu, Xinyang Peng, Yukun Zhao, Lin Qiu, Ka-lai Hung, Kaiping Peng

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出机器文化作为大型语言模型中的一种新兴现象,挑战传统工具性和替代性范式,揭示模型在文化表现上的独特特性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17027 2026-01-27 cs.CV cs.AI 62%

Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility

科学图像合成:基准测试、方法论与下游应用

Honglin Lin, Chonghan Qin, Zheng Liu, Qizhi Pei, Yu Li, Zhanping Zhong, Xin Gao, Yanfeng Wang, Conghui He, Lijun Wu

机构 * Shanghai Jiao Tong University(上海交通大学) OpenDataLab, Shanghai Artificial Intelligence Laboratory(OpenDataLab,上海人工智能实验室) The University of Hong Kong(香港大学) Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ImgCoder框架和SciGenBench基准,通过逻辑驱动方法提升科学图像生成的结构精度,并展示微调LMMs在科学图像上的效果,验证了高保真合成在多模态推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17733 2026-01-27 cs.CV cs.GR 57%

Flatten The Complex: Joint B-Rep Generation via Compositional $k$-Cell Particles

扁平化复杂:通过组合k-cell粒子进行联合B-Rep生成

Junran Lu, Yuanqi Li, Hengji Li, Jie Guo, Yanwen Guo

机构 * Nanjing University(南京大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于组合k-cell粒子的B-Rep生成方法,通过解耦层次结构实现拓扑与几何的联合生成,提升生成模型的精度和可编辑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00884 2026-01-27 stat.CO stat.ML 50%

Generating Synthetic Data with Locally Estimated Distributions for Disclosure Control

通过局部估计分布生成合成数据以实现披露控制

Ali Furkan Kalay

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出局部重采样器方法,通过局部估计分布生成合成数据,有效降低异常值导致的披露风险,提升数据效用与隐私保护的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态评测 21 篇

2601.17814 2026-01-27 cs.AI 83%

MMR-Bench: A Comprehensive Benchmark for Multimodal LLM Routing

MMR-Bench: 多模态大语言模型路由的综合基准

Haoxuan Ma, Guannan Lai, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11178 2026-01-27 cs.CV cs.CY 83%

BLEnD-Vis: Benchmarking Multimodal Cultural Understanding in Vision Language Models

BLEnD-Vis: 评估视觉语言模型在多模态文化理解中的基准测试

Bryan Chen Zhengyu Tan, Zheng Weihua, Zhengyuan Liu, Nancy F. Chen, Hwaran Lee, Kenny Tsu Wei Choo, Roy Ka-Wei Lee

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 BLEnD-Vis通过多模态文化基准测试评估视觉语言模型在语言重述和视觉模态下的文化理解稳健性,揭示当前模型在文化知识上的脆弱性,并指导更文化胜任的模型发展。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09327 2026-01-27 cs.CV 83%

MSSDF: Modality-Shared Self-supervised Distillation for High-Resolution Multi-modal Remote Sensing Image Learning

MSSDF:多模态自监督蒸馏用于高分辨率遥感图像学习

Tong Wang, Guanzhou Chen, Xiaodong Zhang, Chenxi Liu, Jiaqi Wang, Xiaoliang Tan, Wenchao Guo, Qingyuan Yang, Kaiqi Zhang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学) Electronic Information School, Wuhan University(电子信息学院,武汉大学)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MSSDF通过多模态自监督学习提升高分辨率遥感图像的预训练效果,优于现有方法,尤其在语义分割和深度估计任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14019 2026-01-27 cs.CV eess.SP stat.AP 83%

A Multimodal Feature Distillation with Mamba-Transformer Network for Brain Tumor Segmentation with Incomplete Modalities

一种结合Mamba-Transformer网络的多模态特征蒸馏用于缺失模态的脑肿瘤分割

Ming Kang, Fung Fung Ting, Shier Nee Saw, Raphaël C. -W. Phan, Zongyuan Ge, Chee-Ming Ting

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种结合Mamba-Transformer网络的多模态特征蒸馏方法,用于在缺失模态情况下实现更准确的脑肿瘤分割。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15552 2026-01-27 cs.CL cs.AI cs.CV 82%

Multimodal Evaluation of Russian-language Architectures

多模态评估框架MERA Multi对俄语架构的评估

Artem Chervyakov, Ulyana Isaeva, Anton Emelyanov, Artem Safin, Maria Tikhonova, Alexander Kharitonov, Yulia Lyakh, Petr Surovtsev, Denis Shevelev, Vildan Saburov, Vasily Konovalov, Elisei Rykov, Ivan Sviridov, Amina Miftakhova, Ilseyar Alimova, Alexander Panchenko, Alexander Kapitanov, Alena Fenogenova

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MERA Multi框架,用于评估俄语多模态架构,包含18个新任务和统一的评估方法,旨在解决俄语多模态基准缺失的问题。

Comments EACL main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20298 2026-01-27 cs.CL cs.AI cs.CV 82%

MangaVQA and MangaLMM: A Benchmark and Specialized Model for Multimodal Manga Understanding

MangaVQA和MangaLMM:多模态漫画理解的基准和专用模型

Jeonghun Baek, Kazuki Egashira, Shota Onohara, Atsuyuki Miyai, Yuki Imajuku, Hikaru Ikuta, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MangaVQA和MangaLMM,用于多模态漫画理解的基准和专用模型,通过视觉问答和文本识别任务提升漫画叙事理解能力。

Comments EACL 2026 Findings. Project page: https://manga109.github.io/MangaVQA_LMM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13968 2026-01-27 cs.CV cs.AI cs.CL 82%

RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation

RotBench: 对多模态大语言模型识别图像旋转能力的评估

Tianyi Niu, Jaemin Cho, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学夏洛特分校) Allen Institute for Artificial Intelligence(人工智能研究院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 RotBench评估了多模态大语言模型在识别图像旋转角度方面的性能,发现大多数模型难以区分90°和270°旋转,但能识别0°和180°图像,揭示了模型空间推理能力与人类的差距。

Comments EACL 2026 Camera-Ready. Code and data: https://github.com/tianyiniu/RotBench

详情

展开后加载摘要…

URL PDF HTML 收藏