arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-24 至 2026-02-24 共收录 107 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2602.03098 2026-02-24 cs.LG cs.AI 70%

TextME: Bridging Unseen Modalities Through Text Descriptions

TextME: 通过文本描述弥合未见模态

Soyeon Hong, Jinchan Kim, Jaegook You, Seungtaek Choi, Suha Kwak, Hyunsouk Cho

机构 * Department of Artificial Intelligence, Ajou University, Suwon, South Korea Division of Language \& AI, Hankuk University of Foreign Studies, Seoul, Korea Graduate School of AI, POSTECH, Pohang, Korea Department of Software, Ajou University, Suwon, South Korea

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 TextME通过仅使用文本描述实现跨模态扩展,无需配对监督,有效弥合不同模态间的差距。

Comments Code available at https://github.com/SoyeonHH/TextME

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00523 2026-02-24 cs.AI cs.CV 62%

VIRTUE: Visual-Interactive Text-Image Universal Embedder

VIRTUE: 视觉-交互文本-图像通用嵌入器

Wei-Yao Wang, Kazuya Tateishi, Qiyu Wu, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团有限公司) Sony AI(索尼人工智能)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VIRTUE通过引入视觉交互能力,提升图像和文本的联合表示学习,实现更精确的实体级信息处理和应用拓展。

Comments ICLR 2026. 25 pages. Project page: https://sony.github.io/virtue/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18476 2026-02-24 q-bio.BM cs.AI cs.LG 57%

BioLM-Score: Language-Prior Conditioned Probabilistic Geometric Potentials for Protein-Ligand Scoring

BioLM-Score:基于语言先验的概率几何势用于蛋白质-配体评分

Zhangfan Yang, Baoyun Chen, Dong Xu, Jia Wang, Ruibin Bai, Junkai Ji, Zexuan Zhu

机构 * School of Computer Science, University of Nottingham Ningbo(计算机科学学院,诺丁汉大学宁波分校) School of Artificial Intelligence, Shenzhen University(人工智能学院,深圳大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 BioLM-Score结合几何建模与表征学习,提供一种高效、可泛化且可解释的蛋白质-配体评分方法,提升药物发现效率。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 17 篇

2602.19348 2026-02-24 cs.CV cs.AI 84%

MultiDiffSense: Diffusion-Based Multi-Modal Visuo-Tactile Image Generation Conditioned on Object Shape and Contact Pose

MultiDiffSense: 基于扩散的多模态视觉-触觉图像生成,基于物体形状和接触姿态

Sirine Bhouri, Lan Wei, Jian-Qing Zheng, Dandan Zhang

机构 * Department of Bioengineering, Imperial-X Initiative, Imperial College London(生物工程系、Imperial-X计划、帝国理工学院伦敦分校) CAMS-Oxford Institute, University of Oxford(CAMS-牛津研究所、牛津大学)

专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MultiDiffSense是一种基于扩散的多模态视觉-触觉图像生成模型,通过双条件化实现可控且物理一致的多模态生成,提升了触觉传感数据集的生成效率和跨模态学习能力。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19497 2026-02-24 cs.CV 83%

MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models

MICON-Bench: 多图像上下文图像生成的基准测试与增强

Mingrui Wu, Hang Liu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 MICON-Bench通过六个任务评估多图像上下文生成能力,并提出DAR机制提升生成质量与连贯性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19409 2026-02-24 cs.SD 82%

AuditoryHuM: Auditory Scene Label Generation and Clustering using Human-MLLM Collaboration

AuditoryHuM: 利用人机协同生成和聚类听觉场景标签

Henry Zhong, Jörg M. Buchholz, Julian Maclaren, Simon Carlile, Richard F. Lyon

机构 * Australian Hearing Hub, Macquarie University, Sydney, Australia(澳大利亚听力中心、麦觉里大学、悉尼、澳大利亚) Google Research Australia, Sydney, Australia(谷歌澳大利亚研究、悉尼、澳大利亚)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract)

AI总结 AuditoryHuM通过人机协同方法实现听觉场景标签的自动生成与聚类,提供了一种高效且低成本的标准化分类解决方案,适用于边缘设备部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19822 2026-02-24 cs.CV cs.AI 81%

Efficient endometrial carcinoma screening via cross-modal synthesis and gradient distillation

通过跨模态合成与梯度蒸馏实现高效的子宫内膜癌筛查

Dongjing Shan, Yamei Luo, Jiqing Xuan, Lu Huang, Jin Li, Mengchu Yang, Zeyu Chen, Fajin Lv, Yong Tang, Chunxiang Zhang

机构 * School of Medical Information and Engineering, Southwest Medical University(西南医科大学医学信息与工程学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Department of Ultrasound, Affiliated Hospital of Southwest Medical University(西南医科大学附属医院超声科) Department of Functional Examination Unit, Zibo Hospital of Traditional Chinese Medicine(淄博中医药医院功能检查科) Key Laboratory of Medical Electrophysiology, Ministry of Education& Medical Electrophysiological Key Laboratory of Sichuan Province, Institute of Cardiovascular Research, Southwest Medical University(教育部医学电生理重点实验室、四川省医学电生理重点实验室、西南医科大学心血管研究所) Department of Radiology, the First Affiliated Hospital of Chongqing Medical University(重庆医科大学第一附属医院放射科) Department of Cardiology, Affiliated Hospital of Southwest Medical University(西南医科大学附属医院心内科) International Research Center for Complexity Sciences, Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院复杂科学研究中心) Institute of Intelligent Chinese Medicine, Chongqing University of Chinese Medicine(重庆中医药大学智能中药研究院) Basic Medicine Research Innovation Center for Cardiometabolic Diseases, Ministry of Education, Southwest Medical University(教育部心脑血管疾病基础医学研究创新中心、西南医科大学)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种高效的两阶段深度学习框架,通过跨模态合成与梯度蒸馏技术,在低计算成本下实现高灵敏度和特异度的子宫内膜癌筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09609 2026-02-24 cs.CV 79%

Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing

Tele-Omni: 一种用于视频生成与编辑的统一多模态框架

Jialun Liu, Tian Li, Xiao Cao, Yukuo Ma, Gonghu Shang, Haibin Huang, Chi Zhang, Xiangzhen Chang, Zhiyong Huang, Jiakui Hu, Zuoxin Li, Yuanzhi Liang, Cong Liu, Junqi Liu, Robby T. Tan, Haitong Tang, Qizhen Weng, Yifan Xu, Liying Yang, Xiaoyan Yang, Peng Yu, Shiwen Zhang, Xuelong Li

机构 * TeleAI

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Tele-Omni是一种统一多模态框架,通过解析文本、图像和参考视频指令,实现视频生成与编辑的灵活控制,提升时间一致性和视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15857 2026-02-24 cs.IR 78%

Large-scale Benchmarks for Multimodal Recommendation with Ducho

基于Ducho的多模态推荐系统大规模基准测试

Matteo Attimonelli, Danilo Danese, Angela Di Fazio, Daniele Malitesta, Claudio Pomo, Tommaso Di Noia

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文首次提出基于Ducho的多模态推荐系统大规模基准测试,通过统一实验环境评估多模态特征提取器的性能。

Comments Accepted in Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18903 2026-02-24 cs.CV cs.HC 74%

SCHEMA for Gemini 3 Pro Image: A Structured Methodology for Controlled AI Image Generation on Google's Native Multimodal Model

Gemini 3 Pro图像的SCHEMA:为Google原生多模态模型的受控AI图像生成的结构化方法

Luca Cazzaniga

机构 * Independent Researcher(独立研究者)

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 SCHEMA为Google Gemini 3 Pro图像提供结构化提示工程方法,通过三级系统提升AI图像生成的可控性,实现高合规率和跨领域应用。

Comments 24 pages, 8 tables. Based on SCHEMA Method v1.0 (deposited December 11, 2025). Previously published on Zenodo: doi:10.5281/zenodo.18721380

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19163 2026-02-24 cs.CV cs.MM cs.SD 73%

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

JavisDiT++:联合音频视频生成的统一建模与优化

Kai Liu, Yanhao Zheng, Kai Wang, Shengqiong Wu, Rongjunchen Zhang, Jiebo Luo, Dimitrios Hatzinakos, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) HiThink Research(HiThink研究) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。

Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20057 2026-02-24 cs.RO cs.AI 57%

AdaWorldPolicy: World-Model-Driven Diffusion Policy with Online Adaptive Learning for Robotic Manipulation

AdaWorldPolicy:基于世界模型的扩散策略与在线自适应学习的机器人操控

Ge Yuan, Qiyuan Qiao, Jing Zhang, Dong Xu

机构 * The University of Hong Kong(香港大学) Beihang University(北航大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 AdaWorldPolicy通过结合世界模型和在线自适应学习,实现机器人操控的高效动态适应。

Comments Homepage: https://AdaWorldPolicy.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19542 2026-02-24 cs.CV 57%

Vinedresser3D: Agentic Text-guided 3D Editing

Vinedresser3D: 基于代理的文本引导3D编辑

Yankuan Chi, Xiang Li, Zixuan Huang, James M. Rehg

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Vinedresser3D通过多模态大语言模型和潜在空间编辑技术实现高质量文本引导的3D编辑,提升编辑精度与一致性。

Comments CVPR 2026, Project website:https://vinedresser3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19193 2026-02-24 cs.RO cs.AI 57%

Visual Prompt Guided Unified Pushing Policy

基于视觉提示的统一推送策略

Hieu Bui, Ziyan Gao, Yuya Hosoda, Joo-Ho Lee

机构 * Graduate School of Information Science and Engineering, Ritsumeikan University, Japan(立命馆大学信息科学与工程研究生院) Japan Advanced Institute of Science and Technology (JAIST)(日本先进科学研究院) College of Information Science and Engineering, Ritsumeikan University, Japan(立命馆大学信息科学与工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于视觉提示的统一推送策略,通过整合轻量级提示机制提升多模态推送动作的生成效率,适用于广泛规划问题,并在桌面清洁任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04808 2026-02-24 q-bio.NC cs.AI 57%

Setting up for failure: automatic discovery of the neural mechanisms of cognitive errors

失败的设定:自动发现认知错误的神经机制

Puria Radmard, Paul M. Bays, Máté Lengyel

机构 * Department of Engineering, University of Cambridge(工程系,剑桥大学) Department of Psychology, University of Cambridge(心理学系,剑桥大学) Department of Cognitive Science, Central European University(认知科学系,中央欧亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出通过训练RNNs复制行为特征,自动发现认知错误的神经机制,解决了传统方法在数据有限和行为优化上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21896 2026-02-24 cs.AI 57%

GenesisGeo: Technical Report

GenesisGeo:技术报告

Minfeng Zhu, Zi Wang, Sizhe Ji, Zhengtong Du, Shengqiang Tai, Junming Ke, Xiao Deng, Zanlang Yin, Xiuqi Huang, Heyu Wang, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Polytechnic Institute, Zhejiang University(浙江大学多科大学院) Hangzhou Research Institute of AI and Holographic Technology(杭州人工智能与全息技术研究 institutes) Volkswagen Group Innovation(大众集团创新) School of Mathematical Science, Zhejiang University(浙江大学数学科学学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出GenesisGeo-1M数据集及基于多任务学习的几何学习框架,通过大规模合成数据提升模型在几何推理任务中的性能,实现金牌级表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18711 2026-02-24 cs.CV 57%

HIME: Mitigating Object Hallucinations in LVLMs via Hallucination Insensitivity Model Editing

HIME: 通过幻觉不敏感模型编辑缓解LVLMs中的物体幻觉

Ahmed Akl, Abdelwahed Khamis, Ali Cheraghian, Zhe Wang, Sara Khalifa, Kewen Wang

机构 * School of Information and Communication Technology, Griffith University, Australia(信息与通信技术学院,格里菲斯大学) Data61, CSIRO, Australia(Data61,澳大利亚联邦科学与工业研究组织) School of Engineering, Macquarie University, Sydney, Australia(工程学院,麦觉大学) School of Information Systems, Queensland University of Technology, Australia(信息系统学院,昆士兰技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 HIME通过分层加权编辑方法有效抑制LVLMs中的物体幻觉,减少61.8%的幻觉问题,无需额外参数或计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18451 2026-02-24 cs.CY cs.AI 57%

Developing a Multi-Agent System to Generate Next Generation Science Assessments with Evidence-Centered Design

开发一个多智能体系统以生成下一代科学评估并采用证据中心设计

Yaxuan Yang, Jongchan Park, Yifan Zhou, Xiaoming Zhai

机构 * AI4STEM Education Center, University of Georgia(AI4STEM教育中心,佐治亚大学) Department of Educational Psychology, University of Georgia(教育心理学系,佐治亚大学) School of Computing, University of Georgia(计算学院,佐治亚大学) Department of Mathematics, Science, and Social Studies Education, University of Georgia(数学、科学与社会科学教育系,佐治亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出将证据中心设计整合到多智能体系统中,以自动生成符合NGSS的评估项目,发现AI生成的项目在包容性方面表现良好,但存在清晰性和多模态设计的局限。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19276 2026-02-24 cs.SE 50%

ComUICoder: Component-based Reusable UI Code Generation for Complex Websites via Semantic Segmentation and Element-wise Feedback

ComUICoder:基于语义分割和元素反馈的组件式可重用UI代码生成用于复杂网站

Jingyu Xiao, Jiantong Qin, Shuoqi Li, Man Ho Lam, Yuxuan Wan, Jen-tse Huang, Yintong Huo, Michael R. Lyu

专题命中 多模态生成 :multimodal(abstract)

AI总结 ComUICoder通过语义分割和元素反馈技术,提升复杂网站中可重用UI代码的生成质量与重用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26308 2026-02-24 cs.RO 50%

Anomaly detection for generic failure monitoring in robotic assembly, screwing and manipulation

通用故障监控中机器人装配、拧螺钉和操作中的异常检测

Niklas Grambow, Lisa-Marie Fenner, Felipe Kempkes, Philip Hotz, Dingyuan Wan, Jörg Krüger, Kevin Haninger

机构 * Department of Automation at Fraunhofer IPK(弗劳恩霍夫研究所自动化部门) Department of Industrial Automation Technology at TU Berlin(柏林技术大学工业自动化技术部门)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出了一种适用于多种机器人任务的异常检测方法,通过比较不同自编码器方法,验证了其在不同任务和控制策略中的泛化能力,并展示了在布线和拧螺钉任务中高可靠性的检测效果。

Comments 8 pages, 5 figures, 4 tables, the paper has been accepted for publication in the IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 21 篇

2408.07543 2026-02-24 cs.CV cs.CL 84%

MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts

MathScape:在现实数学情境中评估多模态大语言模型

Hao Liang, Linzhuang Sun, Minxuan Zhou, Zirong Chen, Meiyi Qiang, Mingan Lin, Tianpeng Li, Fan Yang, Zenan Zhou, Wentao Zhang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Baichuan Inc.(百度文心)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 MathScape是一个评估多模态大语言模型在现实数学情境中推理能力的新基准,揭示了现有模型在现实任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18967 2026-02-24 cs.RO 82%

TactEx: An Explainable Multimodal Robotic Interaction Framework for Human-Like Touch and Hardness Estimation

TactEx:一种可解释的多模态机器人交互框架,用于类人触觉和硬度估计

Felix Verstraete, Lan Wei, Wen Fan, Dandan Zhang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 TactEx通过融合视觉、触觉和语言模态,实现类人触觉和硬度估计,展示了在水果成熟度评估中的高任务成功率和可解释性。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19562 2026-02-24 cs.AI cs.CV 81%

A Multimodal Framework for Aligning Human Linguistic Descriptions with Visual Perceptual Data

一种多模态框架,用于将人类语言描述与视觉感知数据对齐

Joseph Bingham

专题命中 多模态评测 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态框架,通过结合语言和视觉信息,实现了对人类指称行为的稳健建模,并在经典认知基准上取得了优于人类的表现。

Comments 19 Pages, 6 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 81%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18880 2026-02-24 cs.CV cs.AI 81%

FOCA: Frequency-Oriented Cross-Domain Forgery Detection, Localization and Explanation via Multi-Modal Large Language Model

FOCA:基于多模态大语言模型的频率导向跨域伪造检测、定位与解释

Zhou Liu, Tonghua Su, Hongshi Zhang, Fuxiang Yang, Donglin Di, Yang Song, Lei Fan

机构 * Harbin Institute of Technology(哈尔滨工业大学) DZ-Matrix Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) Chongqing Research Institute of HIT(哈尔滨工业大学重庆研究院) University of New South Wales(新南威尔士大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FOCA通过多模态大语言模型整合空间与频域特征,实现图像伪造的高精度检测、定位及可解释性解释,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05761 2026-02-24 cs.AI cs.CL 81%

Early Multimodal Prediction of Cross-Lingual Meme Virality on Reddit: A Time-Window Analysis

早期多模态预测跨语言Reddit迷因病毒性:时间窗口分析

Sedat Dogan, Nina Dethlefs, Debarati Chakraborty

机构 * School of Computer Science, University of Hull(赫尔大学计算机科学学院) Loughborough University(洛桑大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于多模态特征的迷因病毒性预测方法,通过时间窗口分析展示早期预测的可行性,并揭示了网络和时间特征对突破内容限制的重要性。

Comments Accepted to ACM WebSci 2026. 10 pages, 9 fiures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19723 2026-02-24 cs.CV 79%

Towards Personalized Multi-Modal MRI Synthesis across Heterogeneous Datasets

面向异质数据集的个性化多模态MRI合成

Yue Zhang, Zhizheng Zhuo, Siyao Xu, Shan Lv, Zhaoxi Liu, Jun Qiu, Qiuli Wang, Yaou Liu, S. Kevin Zhou

机构 * University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) Capital Medical University(首都医科大学) Army Medical University(中国人民解放军陆军军医大学) China National Clinical Research Center for Neurological Diseases(中国国家神经疾病临床研究中心)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 PMM-Synth通过个性化特征调制模块、模态一致批量调度器和选择性监督损失,实现跨异质数据集的多模态MRI合成,提升诊断准确性与实用性。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19178 2026-02-24 cs.CV 79%

EMAD: Evidence-Centric Grounded Multimodal Diagnosis for Alzheimer's Disease

EMAD: 基于证据的多模态诊断框架用于阿尔茨海默病

Qiuhui Chen, Xuancheng Yao, Zhenglei Zhou, Xinyue Hu, Yi Hong

机构 * East China University of Science and Technology(东华大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 EMAD通过多模态证据接地机制,生成结构化诊断报告,提升阿尔茨海默病诊断的透明度和临床一致性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19170 2026-02-24 cs.CV 79%

BriMA: Bridged Modality Adaptation for Multi-Modal Continual Action Quality Assessment

BriMA:基于多模态适应的持续动作质量评估

Kanglei Zhou, Chang Li, Qingyi Pan, Liyuan Wang

机构 * Department of Psychological and Cognitive Sciences, 2 Department of Statistics and Data Science, Tsinghua University(1 心理学与认知科学系,2 统计学与数据科学系,清华大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 BriMA通过桥接模态适应方法,在模态缺失条件下提升多模态持续动作质量评估的性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17052 2026-02-24 cs.AI 79%

ViLBias: Detecting and Reasoning about Bias in Multimodal Content

ViLBias:检测和推理解多模态内容中的偏见

Shaina Raza, Caesar Saleh, Azib Farooq, Emrul Hasan, Franklin Ogidi, Haad Zahid, Maximus Powers, Marcelo Lotif, Anam Zahid, Karanpal Sekhon, Veronica Chatrath, Roya Javedi, Vahid Reza Khazaie, Zhenyu Yu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 ViLBias通过多模态基准检测新闻中的偏见,利用LLM和VLMs提升推理准确率和忠实度,参数高效方法能恢复大部分微调性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏