arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-14 至 2026-01-14 共收录 60 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2504.06010 2026-01-14 cs.CV cs.MM 81%

Latent Reconstruction from Generated Data for Multimodal Misinformation Detection

从生成数据中进行潜在重建用于多模态虚假信息检测

Stefanos-Iordanis Papadopoulos, Christos Koutlis, Symeon Papadopoulos, Panagiotis C. Petrantonakis

机构 * Information Technology Institute, Centre for Research & Technology, Hellas(信息科技研究所,研究中心,希腊) Department of Electrical & Computer Engineering, Aristotle University of Thessaloniki(电气与计算机工程系,亚里士多德大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本研究提出MisCaption This!框架和LAMAR网络,通过生成高保真度的误标数据和潜在重建技术,提升多模态虚假信息检测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08420 2026-01-14 cs.CV 79%

MMLGNet: Cross-Modal Alignment of Remote Sensing Data using CLIP

MMLGNet: 利用CLIP实现遥感数据的跨模态对齐

Aditya Chaudhary, Sneha Barman, Mainak Singha, Ankit Jha, Girish Mishra, Biplab Banerjee

专题命中 图文多模态 :cross-modal(title);multimodal(abstract);分类 cs.CV

AI总结 MMLGNet通过CLIP实现遥感数据的跨模态对齐,利用多模态语言引导网络有效融合光谱、空间和几何信息,提升语义理解能力。

Comments Accepted at InGARSS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00961 2026-01-14 cs.DL cs.IR 78%

Digital Collections Explorer: An Open-Source, Multimodal Viewer for Searching Digital Collections

数字收藏探索器:一种开源的多模态查看器,用于搜索数字收藏

Ying-Hsiang Huang, Benjamin Charles Germain Lee

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 Digital Collections Explorer是一种开源多模态查看器,利用CLIP技术提升数字收藏的视觉搜索能力,并通过案例研究展示其在文化遗产档案中的应用。

Comments 14 pages, 8 figures, 2 tables

Journal ref Comput. humanit. res. 1 (2025) e14

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20387 2026-01-14 cs.AI cs.CL cs.CV 75%

Generative Digital Twins: Vision-Language Simulation Models for Executable Industrial Systems

生成数字孪生:用于可执行工业系统的视觉-语言模拟模型

YuChe Hsu, AnJui Wang, TsaiChing Ni, YuanFu Yang

机构 * Institute of Artificial Intelligence Innovation(人工智能创新研究所)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出视觉-语言模拟模型VLSM,通过统一视觉与文本理解,实现从布局草图和自然语言提示生成可执行的工业模拟代码,建立首个大规模生成数字孪生数据集并提出三个专用评估指标。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08139 2026-01-14 cs.CV cs.AI 62%

Subspace Alignment for Vision-Language Model Test-time Adaptation

子空间对齐用于视觉-语言模型测试时适应

Zhichen Zeng, Wenxuan Bao, Xiao Lin, Ruizhong Qiu, Tianxin Wei, Xuying Ning, Yuchen Yan, Chen Luo, Monica Xiao Cheng, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 SubTTA通过子空间对齐提升视觉-语言模型测试时适应性能,有效解决模态差距和视觉噪声问题。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06224 2026-01-14 cs.CV 57%

Ground What You See: Hallucination-Resistant MLLMs via Caption Feedback, Diversity-Aware Sampling, and Conflict Regularization

在所见之地接地:通过标题反馈、多样性感知采样和冲突正则化实现抗幻觉的MLLMs

Miao Pan, Wangjie Gan, Jintao Chen, Wenqi Zhang, Bing Sun, Jianwei Yin, Xuhong Zhang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出抗幻觉的MLLMs方法,通过标题反馈、多样性感知采样和冲突正则化减少幻觉,提升推理准确性。

Comments AAAI-2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05179 2026-01-14 cs.CV 57%

Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models

全局压缩指挥者:面向高分辨率大视觉-语言模型的即插即用推理加速

Xuyang Liu, Ziming Wang, Junjie Chen, Yuhang Han, Yingyao Wang, Jiale Yuan, Jun Song, Siteng Huang, Honggang Chen

机构 * Alibaba(阿里巴巴)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出GlobalCom²框架,通过全局缩略图引导局部裁剪压缩,实现高分辨率LVLMs的高效推理加速。

Comments Accepted by AAAI 2026. Code is available at \url{https://github.com/xuyang-liu16/GlobalCom2}

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2601.08457 2026-01-14 cs.AI cs.CL 84%

An Under-Explored Application for Explainable Multimodal Misogyny Detection in code-mixed Hindi-English

可解释的多模态 misogyny 检测在混合印地语-英语中的一个未被充分探索的应用

Sargam Yadav, Abhishek Kaushik, Kevin Mc Daid

专题命中 音频语音多模态 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多模态且可解释的网页应用,用于检测混合印地语-英语中的性别歧视,利用Transformer模型和可解释性技术提升透明度和可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04563 2026-01-14 cs.LG cs.AI cs.CL cs.CV 75%

A Vision for Multisensory Intelligence: Sensing, Science, and Synergy

多感官智能的愿景:感知、科学与协同

Paul Pu Liang

机构 * MIT Media Lab and MIT EECS(MIT媒体实验室和MIT电子工程与计算机科学系)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出未来十年多感官人工智能的研究愿景,强调通过感知、科学和协同三大主题推动多感官技术发展,提升人与AI的交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04151 2026-01-14 cs.CV cs.AI cs.MM cs.SD 67%

Apollo: Unified Multi-Task Audio-Video Joint Generation

Apollo:统一多任务音频视频联合生成

Jun Wang, Chunyu Qiang, Yuxin Guo, Yiran Wang, Xijuan Zeng, Feng Deng

机构 * Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 Apollo通过统一多任务架构、渐进训练策略和大规模数据集,实现音频视频联合生成的高保真度与强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08342 2026-01-14 cs.CL 57%

Detecting Mental Manipulation in Speech via Synthetic Multi-Speaker Dialogue

通过合成多说话对话检测心理操控

Run Chen, Wen Liang, Ziwei Gong, Lin Ai, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出首个通过合成多说话对话检测心理操控的研究,揭示语音与文本在检测准确性上的差异,强调多模态对话系统中模态意识的重要性。

Comments Accepted to IWSDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07999 2026-01-14 cs.SD eess.AS 57%

VoxCog: Towards End-to-End Multilingual Cognitive Impairment Classification through Dialectal Knowledge

VoxCog: 通过方言知识实现端到端多语言认知障碍分类

Tiantian Feng, Anfeng Xu, Jinkook Lee, Shrikanth Narayanan

机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(明斯希德电气与计算机工程系,南加州大学) Dornsife College of Letters, Arts and Sciences, University of Southern California(多恩斯菲学院,南加州大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 VoxCog通过整合方言知识,实现了端到端的多语言认知障碍分类,其语音基础模型在AD和MCI检测中表现出优于多模态集成和大语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2601.07850 2026-01-14 cs.MM cs.CV 88%

MLLM-VADStory: Domain Knowledge-Driven Multimodal LLMs for Video Ad Storyline Insights

MLLM-VADStory: 基于领域知识的多模态大语言模型用于视频广告剧情洞察

Jasmine Yang, Poppy Zhang, Shawndra Hill

机构 * Meta

专题命中 视频多模态 :multimodal(title,abstract);MLLM(title,abstract);分类 cs.CV、cs.MM

AI总结 MLLM-VADStory通过领域知识引导多模态大语言模型,系统量化和生成视频广告剧情洞察,提升视频广告创意效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08408 2026-01-14 cs.CV cs.RO 79%

Edge-Optimized Multimodal Learning for UAV Video Understanding via BLIP-2

边缘优化的多模态学习用于无人机视频理解 via BLIP-2

Yizhan Feng, Hichem Snoussi, Jing Teng, Jian Liu, Yuyang Wang, Abel Cherouat, Tian Wang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于BLIP-2的轻量级多模态学习平台,通过集成YOLO模型实现无人机视频理解的高效处理与多任务适应。

Comments The Tenth International Conference on Data Mining and Big Data (DMBD'2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08240 2026-01-14 eess.IV cs.CV 79%

Temporal-Enhanced Interpretable Multi-Modal Prognosis and Risk Stratification Framework for Diabetic Retinopathy (TIMM-ProRS)

时间增强的可解释多模态预后和风险分层框架用于糖尿病视网膜病变(TIMM-ProRS)

Susmita Kar, A S M Ahsanul Sarkar Akib, Abdul Hasib, Samin Yaser, Anas Bin Azim

机构 * Department of Robotics, Robo Tech Valley, Dhaka, Bangladesh(机器人系,罗布科技谷,达卡,孟加拉国)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 TIMM-ProRS通过融合视网膜图像和时间生物标志物,实现糖尿病视网膜病变的多模态和时间动态分析,达到97.8%的准确率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2511.12735 2026-01-14 cs.CV 79%

Backdoor Attacks on Open Vocabulary Object Detectors via Multi-Modal Prompt Tuning

通过多模态提示调优对开放词汇目标检测器进行后门攻击

Ankita Raj, Chetan Arora

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

AI总结 TrAP通过多模态提示调优对开放词汇目标检测器实施后门攻击,利用轻量级提示标记植入恶意行为,提升攻击成功率并改进下游任务性能。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08311 2026-01-14 cs.CV cs.AI 62%

Enhancing Image Quality Assessment Ability of LMMs via Retrieval-Augmented Generation

通过检索增强生成提升大型多模态模型的图像质量评估能力

Kang Fu, Huiyu Duan, Zicheng Zhang, Yucheng Zhu, Jun Zhao, Xiongkuo Min, Jia Wang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 IQA-RAG通过检索增强生成提升LMMs图像质量评估能力,提供高效替代微调方案

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13564 2026-01-14 cs.CL cs.AI 62%

Memory in the Age of AI Agents

人工智能代理时代的记忆

Yuyang Hu, Shichun Liu, Yanwei Yue, Guibin Zhang, Boyang Liu, Fangyi Zhu, Jiahang Lin, Honglin Guo, Shihan Dou, Zhiheng Xi, Senjie Jin, Jiejun Tan, Yanbin Yin, Jiongnan Liu, Zeyu Zhang, Zhongxiang Sun, Yutao Zhu, Hao Sun, Boci Peng, Zhenrong Cheng, Xuanbo Fan, Jiaxin Guo, Xinlei Yu, Zhenhong Zhou, Zewen Hu, Jiahao Huo, Junhao Wang, Yuwei Niu, Yu Wang, Zhenfei Yin, Xiaobin Hu, Yue Liao, Qiankun Li, Kun Wang, Wangchunshu Zhou, Yixin Liu, Dawei Cheng, Qi Zhang, Tao Gui, Shirui Pan, Yan Zhang, Philip Torr, Zhicheng Dou, Ji-Rong Wen, Xuanjing Huang, Yu-Gang Jiang, Shuicheng Yan

机构 * Core Supervisors. 0.5em Affiliations: National University of Singapore, Renmin University of China, Fudan University, Peking University, Nanyang Technological University, Tongji University, University of California San Diego, Hong Kong University of Science Technology (Guangzhou), Griffith University, Georgia Institute of Technology, OPPO, Oxford University

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文系统梳理了人工智能代理记忆的现状与分类,提出了记忆的三种形式、功能分类及动态分析,为未来智能设计提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 7 篇

2510.23301 2026-01-14 cs.CV 86%

MDReID: Modality-Decoupled Learning for Any-to-Any Multi-Modal Object Re-Identification

MDReID: 任意到任意多模态对象重识别的模态解耦学习

Yingying Feng, Jie Li, Jie Hu, Yukang Zhang, Lei Tan, Jiayi Ji

机构 * Northeastern University(东北大学) Xiamen University(厦门大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :any-to-any(title,abstract);multi-modal(title);分类 cs.CV

AI总结 MDReID通过模态解耦学习和模态感知度量学习,实现了任意到任意多模态对象重识别的鲁棒性和可扩展性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00568 2026-01-14 cs.CV cs.AI cs.LG 81%

Generating crossmodal gene expression from cancer histopathology improves multimodal AI predictions

从癌症组织病理学生成跨模态基因表达以提高多模态AI预测

Samiran Dey, Christopher R. S. Banerji, Partha Basuchowdhuri, Sanjoy K. Saha, Deepak Parashar, Tapabrata Chakraborti

机构 * School of Mathematical & Computational Sciences, Indian Association for the Cultivation of Science(数学与计算科学学院,印度科学培养协会) The Alan Turing Institute(艾伦·图灵研究所) Comprehensive Cancer Center, King’s College London(国王学院综合癌症中心) Department of Computer Science and Engineering, Jadavpur University(计算机科学与工程系,贾瓦德pur大学) MRC Biostatistics Unit, University of Cambridge(剑桥大学医学研究委员会生物统计学单位) Department of Biostatistics, Bioinformatics and Biomathematics, Georgetown University(生物统计学、生物信息学与生物数学系,杰斐逊大学) UCL Cancer Institute, Dept of Medical Physics & Biomedical Engineering, University College London(伦敦大学学院癌症研究所,医学物理与生物医学工程系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 PathGen通过生成跨模态基因表达提升癌症分级和生存风险预测的多模态AI性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08179 2026-01-14 cs.CV cs.AI cs.GR cs.LG cs.MM 67%

Instruction-Driven 3D Facial Expression Generation and Transition

基于指令的3D面部表情生成与转换

Anh H. Vo, Tae-Seok Kim, Hulin Jin, Soo-Mi Choi, Yong-Guk Kim

机构 * Department of Computer Engineering, Sejong University(忠南大学计算机工程系) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出基于指令的3D面部表情生成与转换框架,通过IFED模块和I2FET方法实现面部表情的生成与平滑过渡,实验表明其在多个数据集上优于现有方法。

Journal ref IEEE Transactions on Multimedia, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08120 2026-01-14 cs.CV cs.AI cs.LG cs.MM 67%

UniF$^2$ace: A Unified Fine-grained Face Understanding and Generation Model

UniF$^2$ace: 一个统一的细粒度人脸理解和生成模型

Junzhe Li, Sifan Zhou, Liya Guo, Xuerui Qiu, Linrui Xu, Delin Qu, Tingting Long, Chun Fan, Ming Li, Hehe Fan, Jun Liu, Shuicheng Yan

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Central South University(中南大学) Fudan University(复旦大学) Guangming Lab(光明实验室) Zhejiang University(浙江大学) Lancaster University(兰卡斯特大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 UniF$^2$ace是一个专门针对细粒度人脸理解和生成的统一多模态模型,通过双离散扩散损失和多级分组专家混合架构,提升高质量面部细节生成和细粒度属性处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08623 2026-01-14 cs.CV cs.AI cs.CR cs.LG 62%

SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models

SafeRedir: 基于提示嵌入重定向的图像生成模型鲁棒去学习

Renyang Liu, Kangjie Chen, Han Qiu, Jie Zhang, Kwok-Yan Lam, Tianwei Zhang, See-Kiong Ng

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) CFAR and IHPC, A*STAR(CFAR和IHPC,A*STAR)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 SafeRedir通过提示嵌入重定向实现图像生成模型的鲁棒去学习,无需修改模型即可有效消除不安全内容并提升对抗性攻击抵抗力。

Comments Code at https://github.com/ryliu68/SafeRedir

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08388 2026-01-14 cs.AI 57%

Creativity in AI as Emergence from Domain-Limited Generative Models

人工智能中的创造力作为领域受限生成模型的涌现

Corina Chutaux

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出从生成模型角度研究人工智能创造力,将其视为领域受限模型在受限制信息环境中的涌现属性,通过分解四个组成部分探讨创造力的生成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08095 2026-01-14 cs.CV 57%

From Prompts to Deployment: Auto-Curated Domain-Specific Dataset Generation via Diffusion Models

从提示到部署:通过扩散模型实现自动定制的领域特定数据集生成

Dongsik Yoon, Jongeun Kim

机构 * HDC LABS(HDC实验室)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出通过扩散模型生成领域特定合成数据集的方法,解决预训练模型与现实部署间的分布偏移问题,通过三阶段框架高效构建高质量可部署数据集。

Comments To appear in the Workshop on Synthetic & Adversarial ForEnsics (SAFE), WACV 2026 (oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2601.08509 2026-01-14 cs.AI cs.CL 81%

What If TSF: A Benchmark for Reframing Forecasting as Scenario-Guided Multimodal Forecasting

如果TSF:一个用于将预测重新框架化为基于场景的多模态预测的基准

Jinkwan Jang, Hyunbin Jin, Hyungjin Park, Kyubyung Chae, Taesup Kim

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 What If TSF是一个用于评估模型是否能根据上下文文本,特别是未来场景,进行多模态预测的基准。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21503 2026-01-14 cs.AI cs.CV 81%

MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions

MoHoBench: 通过无法回答的视觉问题评估多模态大语言模型的诚实性

Yanxu Zhu, Shitong Duan, Xiangxu Zhang, Jitao Sang, Peng Zhang, Tun Lu, Xiao Zhou, Jing Yao, Xiaoyuan Yi, Xing Xie

机构 * Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Renmin University of China(中国人民大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MoHoBench通过评估多模态大语言模型在面对无法回答的视觉问题时的诚实行为,揭示其诚实性受视觉信息影响,提出改进方法以提升模型可信度。

Comments AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08292 2026-01-14 cs.CV 79%

KidVis: Do Multimodal Large Language Models Possess the Visual Perceptual Capabilities of a 6-Year-Old?

KidVis: 多模态大语言模型是否具备六岁儿童的视觉感知能力?

Xianfeng Wang, Kaiwei Zhang, Qi Jia, Zijian Chen, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 KidVis研究通过对比人类儿童与多模态大语言模型在视觉能力上的表现,揭示了当前模型在基础视觉感知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21495 2026-01-14 cs.RO 78%

CLAMP: Crowdsourcing a LArge-scale in-the-wild haptic dataset with an open-source device for Multimodal robot Perception

CLAMP:通过开源设备收集大规模真实场景触觉数据集以实现多模态机器人感知

Pranav N. Thakkar, Shubhangi Sinha, Karan Baijal, Yuhan, Bian, Leah Lackey, Ben Dodson, Heisen Kong, Jueun Kwon, Amber Li, Yifei Hu, Alexios Rekoutis, Tom Silver, Tapomayukh Bhattacharjee

机构 * Cornell University(康奈尔大学) Horace Mann School(霍拉曼学校)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 CLAMP通过开源设备收集大规模真实场景触觉数据集,训练多模态触觉编码器,实现材料识别和机器人操作任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08440 2026-01-14 cs.CV 70%

Incentivizing Cardiologist-Like Reasoning in MLLMs for Interpretable Echocardiographic Diagnosis

激励MLLMs实现类似心内科医生的推理以实现可解释的超声心动图诊断

Yi Qin, Lehan Wang, Chenxu Zhao, Alex P. W. Lee, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出CRT和CardiacMind,通过引入心内科医生的思维模式,提升MLLMs在超声心动图诊断中的推理能力,实现48%的诊断性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏