arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-29 至 2025-12-29 共收录 53 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2507.18033 2025-12-29 cs.RO cs.AI 83%

OpenNav: Open-World Navigation with Multimodal Large Language Models

OpenNav: 基于多模态大语言模型的开放世界导航

Mingfeng Yuan, Letian Wang, Steven L. Waslander

机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究 institute) University of Toronto Robotics Institute(多伦多大学机器人研究所)

专题命中 图文多模态 :multimodal(title);multi-modal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 OpenNav利用多模态大语言模型实现开放世界导航,通过生成价值图增强机器人空间理解,并在真实场景中验证其鲁棒性。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21583 2025-12-29 cs.AI 83%

A Medical Multimodal Diagnostic Framework Integrating Vision-Language Models and Logic Tree Reasoning

一种整合视觉-语言模型和逻辑树推理的医学多模态诊断框架

Zelin Zang, Wenyi Gu, Siqi Ma, Dan Yang, Yue Shen, Zhu Zhang, Guohui Fan, Wing-Kuen Ling, Fuji Yang

机构 * Tsientang Institute of Advanced Study (TIAS)(钱塘先进研究所) Westlake University(西湖大学) Ant Group(蚂蚁集团) China-Japan Friendship Hospital(中日友好医院)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出一种整合视觉-语言模型与逻辑树推理的医学诊断框架,旨在提升多模态医学AI的可信度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21529 2025-12-29 cs.CV cs.AI 73%

Hierarchy-Aware Fine-Tuning of Vision-Language Models

层级感知的视觉-语言模型微调

Jiayu Li, Rajesh Gangireddy, Samet Akcay, Wei Cheng, Juhua Hu

机构 * University of Washington(华盛顿大学) Intel(英特尔)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种高效的层级感知微调框架,通过结合树路径KL散度和层级兄弟平滑交叉熵,提升视觉-语言模型在结构化分类任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06259 2025-12-29 cs.CV cs.AI 73%

SIFThinker: Spatially-Aware Image Focus for Visual Reasoning

SIFThinker: 基于空间的图像聚焦用于视觉推理

Zhangquan Chen, Ruihui Zhao, Chuwei Luo, Mingze Sun, Xinlei Yu, Yangyang Kang, Ruqi Huang

机构 * ByteDance(字节跳动)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 SIFThinker通过结合深度增强的边界框和自然语言,提升视觉推理中的空间理解和细粒度感知能力。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21871 2025-12-29 cs.CL cs.AI cs.CR cs.CY 62%

Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?

弥合版权鸿沟:大型视觉-语言模型是否能识别并尊重受版权保护的内容?

Naen Xu, Jinghuai Zhang, Changjiang Li, Hengyu An, Chunyi Zhou, Jun Wang, Boyu Xu, Yuyuan Li, Tianyu Du, Shouling Ji

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型视觉-语言模型在处理受版权保护内容时的合规性问题,提出了一种新的工具增强防御框架以降低侵权风险。

Comments AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21675 2025-12-29 cs.CV 57%

UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解

Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, Yihao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学) Sun Yat-sen University(中山大学) Tele-AI Website(Tele-AI网站)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。

Comments 27 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21450 2025-12-29 cs.LG 50%

RLLaVA: An RL-central Framework for Language and Vision Assistants

RLLaVA: 一种面向语言和视觉助手的强化学习中心框架

Lei Zhao, Zihao Ma, Boyu Lin, Yuhe Liu, Wenjun Wu, Lei Huang

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(信息与电子技术学院,人工智能研究院,北京航空航天大学,北京,中国) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(杭州国际创新研究院,北京航空航天大学,杭州,中国)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 RLLaVA 提出了一种强化学习中心框架,通过解耦算法逻辑与模型架构,实现高效训练和多任务扩展,提升视觉-语言模型性能。

Comments The code is available at https://github.com/TinyLoopX/RLLaVA

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2512.21706 2025-12-29 cs.CL cs.AI 62%

Enabling Conversational Behavior Reasoning Capabilities in Full-Duplex Speech

实现全双工语音中对话行为推理能力

Shuchang Pan, Siddharth Banerjee, Dhruv Hebbar, Siddhant Patel, Akshaj Gupta, Kan Jen Cheng, Hanjo Kim, Zeyi Austin Li, Martin Q. Ma, Tingle Li, Gopala Anumanchipalli, Jiachen Lian

机构 * Zhejiang University(浙江大学) University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于图的思维框架,通过建模对话行为的因果推断,实现全双工语音交互中的行为推理与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21566 2025-12-29 physics.optics 50%

Broadband tunable microwave photonic radar for simultaneous detection of human respiration, heartbeat, and speech with deep learning-based speech recognition

宽带可调微波光子雷达用于同时检测人体呼吸、心跳和语音的系统,结合深度学习语音识别

Lei Gao, Dingding Liang, Jiawei Gao, Chulun Lin, Zhiqiang Huang, Taixia Shi, Yang Chen

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本研究提出一种宽带可调微波光子雷达系统,结合深度学习实现对呼吸、心跳和语音的同步检测,实验验证其高精度语音识别和多模态生命体征监测能力。

Comments 40 pages, 14 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 4 篇

2512.21641 2025-12-29 cs.CV cs.AI 81%

TrackTeller: Temporal Multimodal 3D Grounding for Behavior-Dependent Object References

TrackTeller: 基于时间的多模态3D定位用于行为依赖的对象引用

Jiahong Yu, Ziqi Wang, Hailiang Zhao, Wei Zhai, Xueqiang Yan, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 TrackTeller通过融合LiDAR图像、语言条件解码和时间推理,提升动态3D场景中基于语言的物体定位与跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03606 2025-12-29 cs.RO cs.CV 70%

VTAO-BiManip: Masked Visual-Tactile-Action Pre-training with Object Understanding for Bimanual Dexterous Manipulation

VTAO-BiManip: 带物体理解的遮蔽视觉-触觉-动作预训练用于双臂灵巧操作

Zhengnan Sun, Zhaotai Shi, Jiayin Chen, Qingtao Liu, Yu Cui, Qi Ye, Jiming Chen

机构 * College of Control Science and Engineering, Zhejiang University, Hangzhou, 310027, China(浙江大学控制科学与工程学院)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 VTAO-BiManip通过结合视觉-触觉-动作预训练与物体理解,提升双臂灵巧操作的课程强化学习效果,实现超过现有方法20%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22010 2025-12-29 cs.CV cs.AI 62%

LongFly: Long-Horizon UAV Vision-and-Language Navigation with Spatiotemporal Context Integration

LongFly: 长航程无人机视觉与语言导航中的时空上下文整合

Wen Jiang, Li Wang, Kangyao Huang, Wei Fan, Jinyuan Liu, Shaoyu Liu, Hongwei Duan, Bin Xu, Xiangyang Ji

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) Chongqing Innovation Center, Beijing Institute of Technology(北京理工大学重庆创新中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Automation, Tsinghua University(清华大学自动化系) School of Software, Dalian University of Technology(大连理工大学软件学院) School of Artificial Intelligence, Xidian University(西安电子科技大学人工智能学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LongFly通过整合时空上下文提升无人机长航程视觉与语言导航的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06157 2025-12-29 cs.CV cs.AI 62%

UrbanVideo-Bench: Benchmarking Vision-Language Models on Embodied Intelligence with Video Data in Urban Spaces

UrbanVideo-Bench: 基于城市空间视频数据评估视觉-语言模型的具身智能

Baining Zhao, Jianjie Fang, Zichao Dai, Ziyou Wang, Jirong Zha, Weichen Zhang, Chen Gao, Yue Wang, Jinqiang Cui, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 UrbanVideo-Bench通过城市空间视频数据评估视频大语言模型的具身智能,揭示其在城市环境中感知、推理和导航能力的局限性,并验证了Sim-to-Real迁移的潜力。

Comments 22 pages

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 32400-32423, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2512.21698 2025-12-29 cs.CR cs.MM eess.IV 79%

Raster Domain Text Steganography: A Unified Framework for Multimodal Secure Embedding

位图域文本隐写术:一种多模态安全嵌入的统一框架

A V Uday Kiran Kandala

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出了一种基于位图域的多模态安全嵌入框架,通过字形扰动和像素计数实现文本、图像、音频和视频等异构数据的隐蔽传输。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19864 2025-12-29 cs.CL cs.AI 76%

HARMON-E: Hierarchical Agentic Reasoning for Multimodal Oncology Notes to Extract Structured Data

HARMON-E:多模态肿瘤病历的分层代理推理以提取结构化数据

Shashi Kant Gupta, Arijeet Pramanik, Jerrin John Thomas, Regina Schwind, Lauren Wiener, Avi Raju, Jeremy Kornbluth, Yanshan Wang, Zhaohui Su, Hrituraj Singh

机构 * Triomics University of Pittsburgh(匹兹堡大学) Ontada

专题命中 跨模态检索 :multimodal(title);分类 cs.CL、cs.AI

AI总结 HARMON-E通过分层代理推理框架,实现对多模态肿瘤病历的结构化数据提取,达到高精度和大规模应用。

Comments 39 Pages, Supplementary Included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21544 2025-12-29 cs.LG 71%

AVP-Fusion: Adaptive Multi-Modal Fusion and Contrastive Learning for Two-Stage Antiviral Peptide Identification

AVP-Fusion:适应性多模态融合与对比学习用于两阶段抗病毒肽识别

Xinru Wen, Weizhong Lin, Xuan Xiao

专题命中 跨模态检索 :multi-modal(title)

AI总结 AVP-Fusion通过自适应多模态融合与对比学习,实现了抗病毒肽的两阶段高效识别,显著提升准确率和决策边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05195 2025-12-29 cs.LG cs.AI 57%

HistoKernel: Whole Slide Image Level Maximum Mean Discrepancy Kernels for Pan-Cancer Predictive Modelling

HistoKernel:全切片图像层面的最大均值差异核用于跨癌症预测建模

Piotr Keller, Muhammad Dawood, Brinder Singh Chohan, Fayyaz ul Amir Afsar Minhas

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 HistoKernel通过最大均值差异核提升全切片图像层面的跨癌症预测性能,实现多模态数据整合与斑块级可解释性。

Comments 28 pages, 5 figures, 1 Table. Preprint for article in review at Nature Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21683 2025-12-29 cs.CV 57%

Contrastive Graph Modeling for Cross-Domain Few-Shot Medical Image Segmentation

对比图模型用于跨域少样本医学图像分割

Yuntian Bo, Tao Zhou, Zechao Li, Haofeng Zhang, Ling Shao

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出对比图模型,通过结构一致性先验和子图匹配解码机制,在跨域少样本医学图像分割中实现高精度与强源域准确性。

Comments Accepted to IEEE Transactions on Medical Imaging (T-MI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2512.21867 2025-12-29 cs.CV 57%

DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation

DPAR:动态分块化用于高效的自回归视觉生成

Divyansh Srivastava, Akshay Mehra, Pranav Maneriker, Debopam Sanyal, Vishnu Raj, Vijay Kamarshi, Fan Du, Joshua Kimball

机构 * University of California, San Diego(加州大学圣地亚哥分校) Dolby Laboratories(杜比实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 DPAR通过动态分块化技术提升自回归视觉生成效率,减少计算资源消耗并提高生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21691 2025-12-29 cs.CV 57%

Analyzing the Mechanism of Attention Collapse in VGGT from a Dynamics Perspective

从动力学角度分析VGGT中注意力崩溃的机制

Huan Li, Longjun Luo, Yuling Shi, Xiaodong Gu

机构 * Huazhong University of Science and Technology(华中科技大学) Guangdong University of Technology(广东工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 VGGT中注意力崩溃现象从动力学角度进行数学解释,揭示token特征流收敛规律及token合并方法对延迟崩溃的作用。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21560 2025-12-29 cs.CV 57%

Toward Intelligent Scene Augmentation for Context-Aware Object Placement and Sponsor-Logo Integration

迈向智能场景增强以实现情境感知的对象放置和赞助商-标志集成

Unnati Saraswat, Tarun Rao, Namah Gupta, Shweta Swami, Shikhar Sharma, Prateek Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science(巴里尔理工学院和科学研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出两个新任务:情境感知的对象插入和赞助商-产品标志增强,并构建了相应数据集以支持这些任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17376 2025-12-29 cs.CV 57%

Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors

迈向更深层次的情感反思:基于生成先验的富有情感的图像滤镜

Peixuan Zhang, Shuchen Weng, Jiajun Tang, Si Li, Boxin Shi

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing and National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室和视觉技术国家工程研究中心)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出AIF任务,通过生成先验提升图像情感表达,实现更深层次的情感反思。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18699 2025-12-29 cs.CV 57%

Affective Image Editing: Shaping Emotional Factors via Text Descriptions

情感图像编辑:通过文本描述塑造情感因素

Peixuan Zhang, Shuchen Weng, Chengxuan Zhu, Binghao Tang, Zijian Jia, Si Li, Boxin Shi

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory for Multimedia Information Processing and National Engineering Research Center of Visual Technology, School of Computer Science, Peking University, China(多媒体信息处理国家重点实验室和视觉技术国家工程研究中心,北京大学计算机学院)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 AIEdiT通过文本描述实现情感图像编辑,利用情感映射器和MLLM生成符合用户情感需求的图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21475 2025-12-29 cs.NI 50%

Physics-informed Diffusion Models for Multi-scale Prediction of Reference Signal Received Power in Wireless Networks

基于物理信息的扩散模型用于无线网络中参考信号接收功率的多尺度预测

Xiaoqian Qi, Haoye Chai, Yue Wang, Zhaocheng Wang, Yong Li

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出Channel-Diff框架,通过物理信息条件扩散模型实现无线网络中参考信号接收功率的多尺度预测,提升预测精度与模型可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2512.21964 2025-12-29 cs.CV 83%

Perceive and Calibrate: Analyzing and Enhancing Robustness of Medical Multi-Modal Large Language Models

感知与校准:分析和增强医疗多模态大语言模型的鲁棒性

Dunyuan XU, Xikai Yang, Yaoqian Li, Juzheng Miao, Jinpeng Li, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, CUHK, Hong Kong, China(计算机科学与工程系,CUHK,香港,中国) Institute of Medical Intelligence and XR, CUHK, Hong Kong, China(医学智能与XR研究所,CUHK,香港,中国)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出IMC框架,通过感知和校准原则提升医疗多模态大语言模型的鲁棒性,针对视觉和文本模态分别设计PDC和SMS进行噪声校正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20548 2025-12-29 cs.AI 83%

Advancing Multimodal Teacher Sentiment Analysis:The Large-Scale T-MED Dataset & The Effective AAM-TSA Model

推进多模态教师情感分析:大规模T-MED数据集与有效的AAM-TSA模型

Zhiyi Duan, Xiangren Wang, Hongyu Yuan, Qianli Xing

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出T-MED数据集和AAM-TSA模型,通过多模态融合提升教师情感分析的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21616 2025-12-29 cs.CV 83%

TAMEing Long Contexts in Personalization: Towards Training-Free and State-Aware MLLM Personalized Assistant

在个性化中延长上下文:迈向无训练和状态感知的MLLM个性化助手

Rongpei Hong, Jian Lang, Ting Zhong, Yong Wang, Fan Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) Aiwen Technology Co., Ltd.(Aiwen科技有限公司) Intelligent Digital Media Technology Key Laboratory of Sichuan Province(四川省智能数字媒体技术重点实验室)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出TAME框架,通过双记忆和RA2G范式实现无训练、状态感知的MLLM个性化,提升长上下文对话能力。

Comments Accepted by KDD 2026 research track. Code and data are available at https://github.com/ronpay/TAME

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21360 2025-12-29 cs.AI cs.SY eess.SY 83%

From Visual Perception to Deep Empathy: An Automated Assessment Framework for House-Tree-Person Drawings Using Multimodal LLMs and Multi-Agent Collaboration

从视觉感知到深度共情:一种利用多模态大语言模型和多智能体协作的房屋-树-人绘画自动评估框架

Shuide Wen, Yu Sun, Beier Ku, Zhi Gao, Lijun Ma, Yang Yang, Can Jiao

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出利用多模态大语言模型和多智能体协作,开发自动评估房屋-树-人绘画测试的框架,以提升投射评估的标准化和效率。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00846 2025-12-29 cs.CV cs.AI 81%

OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks

OmniBrainBench: 一种全面的多模态基准,用于跨多阶段临床任务的脑影像分析

Zhihao Peng, Cheng Wang, Shengyuan Liu, Zhiying Liang, Zanting Ye, Minjie Ju, PeterYM Woo, Yixuan Yuan

机构 * Chinese University of Hong Kong(香港中文大学) Sun Yat-sen Memorial Hospital, Sun Yat-sen University(中山大学孙逸仙纪念医院) Southern Medical University(南方医科大学) Zhongshan Hospital, Fudan University(复旦大学中山医院) Department of Neurosurgery, Prince of Wales Hospital(威尔士王室医院神经外科部)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 OmniBrainBench是一个全面的多模态基准,用于评估脑影像分析中MLLMs的多模态理解能力,揭示了其在复杂临床任务中的挑战和与医生的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18286 2025-12-29 cs.CV 70%

RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System

RoadSceneVQA: 用于智能交通系统 roadside 系统的视觉问答基准测试

Runwei Guan, Rongsheng Hu, Shangshu Chen, Ningyuan Xiao, Xue Xia, Jiayang Liu, Beibei Chen, Ziren Tang, Ningwei Ouyang, Shaofeng Liang, Yuxuan Fan, Wanjie Sun, Yutao Yue

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 RoadSceneVQA 通过大规模标注数据和 CogniAnchor 融合模块,提升多模态大语言模型在交通感知与推理任务中的性能。

Comments 10 pages, 6 figures, accepted by AAAI 2026. The model is also called Dream, to the other me in the world forever

详情

展开后加载摘要…

URL PDF HTML 收藏