arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-29 至 2026-01-29 共收录 47 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2601.20618 2026-01-29 cs.CV cs.AI cs.CL 87%

GDCNet: Generative Discrepancy Comparison Network for Multimodal Sarcasm Detection

GDCNet:用于多模态讽刺检测的生成不一致比较网络

Shuguang Zhang, Junhong Lian, Guoxin Yu, Baoxun Xu, Xiang Ao

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所(ICT),中国科学院(CAS)) University of Chinese Academy of Sciences, CAS(中国科学院大学) Pengcheng Laboratory(鹏城实验室) Shenzhen Stock Exchange(深圳证券交易所)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 GDCNet通过生成事实性图像描述和文本对比,提升多模态讽刺检测的准确性和鲁棒性。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20075 2026-01-29 cs.CV 70%

Sparse CLIP: Co-Optimizing Interpretability and Performance in Contrastive Learning

稀疏CLIP:在对比学习中协同优化可解释性与性能

Chuan Qin, Constantin Venhoff, Sonia Joseph, Fanyi Xiao, Stefan Scherer

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 稀疏CLIP通过在对比学习中直接整合稀疏性,实现了可解释性与性能的协同优化,保留了多模态能力并提升了下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17461 2026-01-29 cs.CV cs.CL 62%

Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies

通过利用人类方法诊断视觉语言模型的感知能力:针对色觉缺陷的色觉研究

Kazuki Hayashi, Shintaro Ozaki, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本研究通过Ishihara测试评估视觉语言模型对色觉差异的感知能力,发现模型无法再现色觉缺陷个体的感知结果,揭示了多模态AI在包容性部署中的不足。

Comments Accepted to appear in the main conference of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20064 2026-01-29 cs.CV 57%

DiSa: Saliency-Aware Foreground-Background Disentangled Framework for Open-Vocabulary Semantic Segmentation

DiSa:面向开放词汇语义分割的视觉-语义解耦框架

Zhen Yao, Xin Li, Taotao Jing, Shuai Zhang, Mooi Choo Chuah

机构 * Department of Computer Science and Engineering, Lehigh University(计算机科学与工程系,莱恩大学) Department of Computer Science(计算机科学系) Engineering, Lehigh University(工程系,莱恩大学) Qualcomm AI Research(高通人工智能研究)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 DiSa通过显著性感知解耦框架和分层细化模块,有效解决开放词汇语义分割中前景偏见和空间定位不足的问题,提升分割精度。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20707 2026-01-29 cs.CV 57%

Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models

融合重要性与多样性:KV缓存压缩的联合优化

Xuyang Liu, Xiyan Gui, Yuchao Zhang, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 MixKV通过融合重要性与多样性,优化KV缓存压缩,提升多模态模型的存储效率与推理性能。

Comments Accepted by ICLR 2026. Our code is available at https://github.com/xuyang-liu16/MixKV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01256 2026-01-29 cs.CV cs.LG 57%

NLPrompt: Noise-Label Prompt Learning for Vision-Language Models

NLPrompt: 噪声标签提示学习用于视觉-语言模型

Bikang Pan, Qun Li, Xiaoying Tang, Wei Huang, Zhen Fang, Feng Liu, Jingya Wang, Jingyi Yu, Ye Shi

机构 * ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心) University of Technology Sydney(悉尼科技大学) University of Melbourne(墨尔本大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 NLPrompt通过结合PromptMAE和PromptOT,提升视觉-语言模型在噪声标签下的提示学习鲁棒性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2402.14891 2026-01-29 cs.CL cs.AI 73%

LLMBind: A Unified Modality-Task Integration Framework

LLMBind:一种统一的模态-任务整合框架

Bin Zhu, Munan Ning, Peng Jin, Bin Lin, Jinfa Huang, Qi Song, Junwu Zhang, Zhenyu Tang, Mingjun Pan, Li Yuan

机构 * pku(北京大学) pcl(鹏城实验室) hkbu(香港 Baptist大学)

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 LLMBind通过双路径机制和MoE架构,实现多模态任务的统一整合,提升任务扩展性和性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17641 2026-01-29 cs.CL cs.AI cs.LG cs.SD 62%

AuditoryBench++: Can Language Models Understand Auditory Knowledge without Hearing?

AuditoryBench++: 语言模型能否在不听觉的情况下理解听觉知识?

Hyunjong Ok, Suho Yoo, Hyeonjun Kim, Jaeho Lee

机构 * Pohang University of Science and Technology(坡山科学技术大学) HJ AILAB Korea Advanced Institute of Science and Technology(韩国高级科学技术研究院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 AuditoryBench++通过AIR-CoT方法提升语言模型在听觉知识推理中的表现。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20402 2026-01-29 cs.HC cs.AI 57%

GuideAI: A Real-time Personalized Learning Solution with Adaptive Interventions

GuideAI: 一种具有自适应干预的实时个性化学习解决方案

Ananya Shukla, Chaitanya Modi, Satvik Bajpai, Siddharth Siddharth

机构 * HTI Lab, Plaksha University(普拉克斯大学HTI实验室)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 GuideAI通过整合实时生物反馈和多模态学习策略,提升LLM在个性化学习中的适应性和有效性,显著改善学习效果和认知负荷。

Comments Accepted for publication at the 31st International Conference on Intelligent User Interfaces (IUI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 4 篇

2601.20705 2026-01-29 cs.CV cs.AI 84%

LEMON: How Well Do MLLMs Perform Temporal Multimodal Understanding on Instructional Videos?

LEMON:大型语言模型在教学视频中的时间多模态理解表现如何?

Zhuang Yu, Lei Shen, Jing Zhao, Shiliang Sun

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 LEMON是一个针对教学视频的多模态理解评估基准,旨在评估大型语言模型在时间推理和跨模态整合方面的表现,揭示其在复杂教育内容中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11558 2026-01-29 cs.CV cs.AI cs.CL 82%

DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs

DaMO:一种数据高效的多模态协调器,用于视频LLM的时序推理

Bo-Cheng Chiu, Jen-Jee Chen, Yu-Chee Tseng, Feng-Chi Chen, An-Zi Yen

机构 * College of Artificial Intelligence, National Yang Ming Chiao Tung University(人工智能学院,阳明交通大学) Institute of Population Health Sciences, National Health Research Institutes(人口健康科学研究所,国家健康研究院) Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,阳明交通大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DaMO是一种专为视频LLM设计的数据高效多模态协调器,通过时序感知Fuseformer和四阶段训练范式提升时序推理能力,实现更精确的多模态理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19022 2026-01-29 cs.LG cs.AI 57%

EVEREST: An Evidential, Tail-Aware Transformer for Rare-Event Time-Series Forecasting

EVEREST:一种证据感知、尾部意识的Transformer用于稀有事件时间序列预测

Antanas Zilinskas, Robert N. Shorten, Jakub Marecek

机构 * Imperial College London(伦敦帝国学院) Czech Technical University in Prague(布拉格捷克技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 EVEREST通过结合证据头和极值头,实现稀有事件时间序列预测的高精度与可解释性,适用于高风险领域。

Comments Updated author affiliation. No changes to technical content

Journal ref 14th International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20729 2026-01-29 cs.LG 50%

Deep Semi-Supervised Survival Analysis for Predicting Cancer Prognosis

深度半监督生存分析用于预测癌症预后

Anchen Sun, Zhibin Chen, Xiaodong Cai

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出了一种基于深度半监督学习的Cox-MT模型,利用标记和未标记数据提升癌症预后预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2601.20028 2026-01-29 cs.LG 82%

Decomposing multimodal embedding spaces with group-sparse autoencoders

用组稀疏自编码器分解多模态嵌入空间

Chiraag Kaushik, Davis Barch, Andrea Fanelli

机构 * School of Electrical and Computer Engineering(电气与计算机工程学院) Georgia Institute of Technology(佐治亚理工学院) Dolby Laboratories(杜比实验室)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出基于组稀疏正则化的多模态嵌入分解方法,通过跨模态随机遮蔽提升多模态对齐,减少死神经元并增强语义性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20623 2026-01-29 cs.IR 80%

When Vision Meets Texts in Listwise Reranking

当视觉与文本在列表级重排序中相遇

Hongyi Cai

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);image-text(abstract)

AI总结 本文提出Rank-Nexus,一种轻量级多模态图像-文本文档重排序器,通过渐进跨模态训练策略提升重排序性能,适用于文本和图像重排序基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18759 2026-01-29 cs.HC 50%

UI Remix: Supporting UI Design Through Interactive Example Retrieval and Remixing

UI Remix:通过交互式示例检索与混搭支持 UI 设计

Junling Wang, Hongyi Lan, Xiaotian Su, Mustafa Doga Dogan, April Yi Wang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 UI Remix 通过交互式示例检索与混搭,帮助终端用户更高效地进行移动UI设计,提升设计可控性与信任度。

Comments Accepted at the 31st International Conference on Intelligent User Interfaces (IUI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 7 篇

2601.19750 2026-01-29 cs.MM cs.CV cs.IR 84%

Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues

在电子商务目录中评估多模态大语言模型用于缺失模态补全

Junchen Fu, Wenhao Deng, Kaiwen Zheng, Ioannis Arapakis, Yu Ye, Yongxin Ni, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Telefónica Scientific Research(电信科研机构) National University of Singapore(新加坡国立大学) Shandong University(山东大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文研究了多模态大语言模型在电子商务目录中补全缺失模态的能力,通过MMPCBench基准测试发现MLLMs在细粒度对齐上存在不足,并探索了GRPO方法以提升补全效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16512 2026-01-29 cs.CV cs.AI 84%

Beyond Face Swapping: A Diffusion-Based Digital Human Benchmark for Multimodal Deepfake Detection

超越人脸交换:一种基于扩散模型的多模态深度伪造检测基准

Jiaxin Liu, Jia Wang, Saihui Hou, Min Ren, Huijia Wu, Long Ma, Renwang Pei, Zhaofeng He

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DigiFakeAV数据集和DigiShield检测模型,用于多模态深度伪造检测,通过融合时空和跨模态特征提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14174 2026-01-29 cs.LG cs.AI 83%

Physics-Guided Multimodal Transformers are the Necessary Foundation for the Next Generation of Meteorological Science

物理引导的多模态Transformer是下一代气象科学的必要基础

Jing Han, Hanting Chen, Kai Han, Xiaomeng Huang, Wenjun Xu, Dacheng Tao, Ping Zhang

机构 * School of Artificial Intelligence, Beijing University of Posts Huawei Noah's Ark Lab Department of Earth System Science, Tsinghua University College of Computing \& Data Science, Nanyang Technological University State Key Laboratory of Networking Switching Technology, Beijing University of Posts

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出通过物理引导的多模态Transformer构建下一代气象科学的统一范式,以提升模型的科学一致性和物理约束能力。

Comments Perspective article

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18543 2026-01-29 cs.CV 79%

GenAgent: Scaling Text-to-Image Generation via Agentic Multimodal Reasoning

GenAgent:通过代理多模态推理扩展文本到图像生成

Kaixun Jiang, Yuzheng Wang, Junjie Zhou, Pandeng Li, Zhihang Liu, Chen-Wei Xie, Zhaoyu Chen, Yun Zheng, Wenqiang Zhang

机构 * Fudan University(复旦大学) Tongyi Lab(通义实验室) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 GenAgent通过代理多模态推理提升文本到图像生成性能,采用两阶段训练策略实现自主多轮交互与任务自适应推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20520 2026-01-29 cs.CV 57%

Context Tokens are Anchors: Understanding the Repetition Curse in dMLLMs from an Information Flow Perspective

上下文标记是锚点:从信息流的角度理解dMLLMs中的重复诅咒

Qiyan Zhao, Xiaofeng Zhang, Shuochen Chang, Qianyu Chen, Xiaosong Yuan, Xuhang Chen, Luoqi Liu, Jiajun Zhang, Xu-Yao Zhang, Da-Han Wang

机构 * SJTU(上海交通大学) CASIA(中国科学院自动化研究所) NTU(国立台湾大学) Meitu (China) Limited(美图公司) XMUT(新疆大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 CoTA通过增强上下文标记注意力和引入惩罚项缓解dMLLMs中的重复问题,提升解码性能。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20260 2026-01-29 cs.CV 57%

Reversible Efficient Diffusion for Image Fusion

可逆高效扩散用于图像融合

Xingxin Xu, Bing Cao, DongDong Li, Qinghua Hu, Pengfei Zhu

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) School of Artificial Intelligence, Tianjin University(人工智能学院,天津大学) Low-Altitude Intelligence Laboratory, Xiong’an National Innovation Center(低空智能实验室,雄安国家创新中心) Xiong’an Guochuang Lantian Technology Co., Ltd.(雄安国创蓝天科技有限公司) National University of Defense Technology(国防科技大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出可逆高效扩散模型,通过显式监督提升图像融合的生成能力,解决传统扩散模型在融合任务中的细节损失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05150 2026-01-29 cs.CV 57%

TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows

TwinFlow: 在大模型上实现一步生成的自对抗流

Zhenglin Cheng, Peng Sun, Jianguo Li, Tao Lin

机构 * Inclusion AI Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 TwinFlow 提出了一种无需预训练教师模型和标准对抗网络的一步生成框架,实现了在大模型上高效生成,提升了推理效率并降低了计算成本。

Comments arxiv v1, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 8 篇

2512.23565 2026-01-29 cs.CV cs.AI 84%

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17536 2026-01-29 cs.CL 79%

Multimodal Conversation Structure Understanding

多模态对话结构理解

Kent K. Chang, Mackenzie Hanh Cramer, Anna Ho, Ti Ti Nguyen, Yilin Yuan, David Bamman

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出多模态对话结构理解任务及TV-MMPC数据集,揭示对话角色匿名化对模型性能的影响,并分析对话中性别角色的参与差异。

Comments accepted to EACL 2026 main conference; 22 pages, 9 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20196 2026-01-29 cs.CV 79%

Automated Marine Biofouling Assessment: Benchmarking Computer Vision and Multimodal LLMs on the Level of Fouling Scale

自动化海洋生物污损评估:基于生物污损等级的计算机视觉与多模态LLM对比分析

Brayden Hamilton, Tim Cashmore, Peter Driscoll, Trevor Gee, Henry Williams

机构 * Centre for Automation and Robotic Engineering Science(自动化与机器人工程科学中心) The University of Auckland(奥克兰大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文通过对比计算机视觉与多模态LLM在生物污损等级评估中的表现,提出混合方法以实现可扩展且可解释的自动化评估。

Comments Australasian Conference on Robotics and Automation, ACRA2025 13 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17045 2026-01-29 cs.CV cs.AI cs.MM 75%

RacketVision: A Multiple Racket Sports Benchmark for Unified Ball and Racket Analysis

RacketVision: 一种多 racket 运动基准数据集用于统一的球和 racket 分析

Linfeng Dong, Yuchen Yang, Hao Wu, Wei Wang, Yuenan Hou, Zhihang Zhong, Xiao Sun

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 RacketVision 是一个用于多 racket 运动分析的基准数据集,通过细粒度注释和 CrossAttention 机制提升球轨迹预测性能。

Comments Accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20689 2026-01-29 cs.CV cs.AI 73%

Decoupling Perception and Calibration: Label-Efficient Image Quality Assessment Framework

解耦感知与校准:一种标签高效的图像质量评估框架

Xinyue Li, Zhichao Zhang, Zhiming Xu, Shubo Xu, Xiongkuo Min, Yitong Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xi’an Jiaotong University(西安交通大学) Baidu(百度)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 LEAF通过蒸馏多模态大语言模型的感知先验,实现轻量级图像质量评估,减少对人类标注的依赖,同时保持与人类注释的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10258 2026-01-29 cs.CV cs.MM 62%

XY-Cut++: Advanced Layout Ordering via Hierarchical Mask Mechanism on a Novel Benchmark

XY-Cut++: 一种基于新型基准的分层遮罩机制的高级布局排序方法

Shuai Liu, Youmeng Li, Jizeng Wei

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 XY-Cut++通过分层遮罩机制在新型基准上实现高级布局排序,提升文档阅读顺序恢复的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16656 2026-01-29 cs.AI 57%

NUMINA: A Natural Understanding Benchmark for Multi-dimensional Intelligence and Numerical Reasoning Abilities

NUMINA:多维智能与数值推理能力的自然理解基准

Changyu Zeng, Yifan Wang, Zimu Wang, Wei Wang, Zhengni Yang, Muyi Bao, Jiming Xiao, Anh Nguyen, Yutao Yue

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进技术学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Deep Perception Technology, JITRI(深度感知技术研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 NUMINA是一个用于多维智能和数值推理能力的自然理解基准,通过多尺度注释和自动化注释流程提升多模态室内感知理解,揭示当前LLM在三维空间计算中的不足。

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 22575--22590

详情

展开后加载摘要…

URL PDF HTML 收藏