arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-28 至 2026-08-28 共收录 77 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2608.26722 2026-08-28 cs.CV 新提交 87%

UniGeo: A Multi-modal Large Language Model for Text-Guided Cross-View Geo-Localization

UniGeo:用于文本引导跨视角地理定位的多模态大语言模型

Jiahao Wen, Hang Yu, Zhedong Zheng

机构 * School of Computer Engineering and Science, Shanghai University(上海大学计算机工程与科学学院) Institute of Collaborative Innovation, University of Macau(澳门大学协同创新研究院)

专题命中 图文多模态 :multi-modal(title);MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract)

AI总结 UniGeo是一种统一多模态大语言模型,通过地理语义学习、跨视角生成及即插即用验证模块,在文本引导无人机地理定位任务中显著提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26645 2026-08-28 cs.RO 新提交 80%

FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation

FLARE:一种面向视觉-语言机器人操纵中自主修正与恢复的故障感知框架

Ganlong Zhao, Zijia Tang, Xingping Chen, Zhanghui Kuang, Ye Tian, Guanbin Li

机构 * The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Duke University(杜克大学) Sun Yat-sen University(中山大学) TengenX(天工科技) Tencent Robotics X(腾讯Robotics X实验室) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 图文多模态 :MLLM(summary_cn,abstract)

AI总结 针对视觉-语言机器人操纵中VLAs无法从执行错误恢复的问题,提出含“重试”“重置”范式的FLARE框架,结合MLLM实现故障恢复,显著提升接触密集型操纵任务的成功率与鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26143 2026-08-28 cs.CL cs.AI 新提交 62%

Beyond Accuracy: A Qualitative Analysis of Vision-Language Models for Hate Speech Detection in Memes

超越准确率:对用于表情包仇恨言论检测的视觉-语言模型的定性分析

Muhammad Jawad Chowdhury, Adiba Hasan, Ishrak Hossain, Shahriar Ivan, Sabbir Ahmed

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过定性分析LLaVA-7B等四个VLMs在零样本、少样本设置下的表现,揭示其检测仇恨表情包时忽略关键语境线索的问题,为优化模型提供了更深入的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26866 2026-08-28 cs.CV 新提交 57%

Order Matters: A Chinese Multi-Panel Meme Benchmark for Vision-Language Reasoning

顺序很重要:面向视觉-语言推理的中文多面板梗图基准

Haihan Li, Haihao Li, Zhenfei Xu, Jize Qian

机构 * Shanghai Maritime University(上海海事大学) Dalian Maritime University(大连海事大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究推出中文多面板梗图基准CMPM,评估大型视觉-语言模型对梗图的顺序感知推理能力,发现模型在打乱顺序时准确率大幅下降,Gemini 3.1 Pro和GPT-5.5表现优于开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26829 2026-08-28 cs.LG cs.CV 新提交 57%

SAGE: Variate-Wise Semantic Augmentation for Vision-Language Time Series Forecasting

SAGE:面向视觉-语言时间序列预测的逐变量语义增强方法

Haizhao Fan, Xinyi Le

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对时间序列预测模型缺乏语义知识的问题,提出基于CLIP的SAGE框架,通过双重利用CLIP实现多模态监督,在8个长期基准及M4数据集上取得最优精度。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26716 2026-08-28 cs.CV 新提交 57%

Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models

超越原子布局:基于视觉-语言模型的组合式设计理解

Yiyang Huang, Zhaowen Wang, Simon Jenni, Jing Shi, Yitian Zhang, Yizhou Wang, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(奥多比研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文针对组合式布局理解任务,提出后训练范式MASON,利用约2万布局的CoDeLayout数据集,使Qwen2.5-VL 7B准确率达91.66%,优于基线及全数据微调。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 10 篇

2608.27135 2026-08-28 cs.CL 新提交 88%

Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models

语音与文本的不同解读:多模态模型中的跨模态不稳定性

Basel Mousi, Fahim Dalvi, Shammur Chowdhury, Firoj Alam, Nadir Durrani

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所(哈马德·本·哈利法大学))

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title);multimodal foundation model(abstract);分类 cs.CL

AI总结 该研究针对多模态模型在语音与文本、英语与阿拉伯语间的判断一致性问题,构建含10150张图像的基准,发现模态与语言转换会引入未被整体准确率捕捉的不一致性,语音还会放大部分失败,且公开了该基准。

Comments Interpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26213 2026-08-28 cs.SD cs.CV eess.AS 新提交 81%

Attention-Guided Reliability Scaling for Contrastive Decoding in Robust Audio-Visual Speech Recognition

用于鲁棒视听语音识别中对比解码的注意力引导可靠性缩放

YoungChae Kim, Da-Hee Yang, Joon-Hyuk Chang

机构 * Hanyang University(汉阳大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

AI总结 本研究针对鲁棒视听语音识别问题,提出注意力引导的对比解码可靠性缩放方法,在LRS3数据集上实现了干净与低信噪比条件下的性能提升。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26163 2026-08-28 cs.CL cs.AI cs.HC cs.MA cs.SD 新提交 79%

From Sound to Symptom: Real-Time Respiratory Signal Understanding for Conversational Healthcare Agents

从声音到症状:面向对话式医疗智能体的实时呼吸信号理解

Tanmay Laud, Herprit Mahal, Subhabrata Mukherjee

机构 * Hippocratic AI(希波克拉底人工智能公司)

专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出面向对话式医疗智能体的HealthCUES系统,可实时检测分析咳嗽等呼吸信号,经内部与外部数据集评估及医疗人员验证,性能优异且具临床实用性。

Comments Accepted for publication at SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27176 2026-08-28 cs.CL cs.AI cs.LG eess.AS 新提交 67%

When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue

当文本误导时:面向音频接地对话的不一致感知推理

Yen-Ju Lu, Yuzhe Wang, Yaohan Guan, Xiluo He, Jiarui Hai, Mingrui Liang, Kaavya Chaparala, Thomas Thebaud, Laureano Moro-Velazquez, Najim Dehak, Jesus Villalba

机构 * Center for Language and Speech Processing, Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本研究针对口语对话理解中基于转录本的捷径问题,构建了含501个问题的受控基准ContraTalk,提出Audio Twin智能体式推理框架,可提升冲突问答案例的准确率并减少文本偏向陷阱选择。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26925 2026-08-28 cs.CL eess.AS 新提交 62%

Mapping Written Words to Spoken Words in a Different Language Using Only Visual Grounding

仅使用视觉 grounding 将不同语言的书面词映射到口语词

Gabriel Pirlogeanu, Dan Oneata, Horia Cucu, Herman Kamper

机构 * Politehnica Bucharest(布加勒斯特理工大学) Stellenbosch University(斯坦陵布什大学) Trinity College Dublin(都柏林圣三一学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本研究针对低资源场景下的语音数据构建问题,提出一种基于自监督语音表示的对齐方法,可从视觉 grounding 数据中直接学习跨语言词到语音的映射,效果优于以往的注意力模型。

Comments 9 pages, 5 figures, 5 tables, preprint, submitted to IEEE Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26432 2026-08-28 cs.SD cs.AI cs.CL 新提交 62%

SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning

SpeechGym:一种用于通过强化学习训练语音智能体的原生音频 Gym

Jiajun Fan, Jingyuan Li, Prashanth Gurunath Shivakumar, Jia-Hong Huang, Qi Luo, M. Maruf, Ivan Bulyko, Ge Liu, Roger Ren

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon AGI Foundations(亚马逊AGI基础研究部)

专题命中 音频语音多模态 :omni-modal(abstract);分类 cs.CL、cs.AI

AI总结 研究针对语音智能体训练中梯度无法流动、难以强化学习的问题,提出原生音频环境 SpeechGym,用每轮过程奖励解决稀疏性问题,使开放权重模型在语音基准上任务成功率翻倍且排名提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26194 2026-08-28 cs.CL cs.AI cs.IR 新提交 62%

A Reranker for Orchestrating Heterogeneous Speech and Text Retrievers

用于协调异构语音和文本检索器的重排序器

Inho Kim, Sumyeong Ahn

机构 * Korea Institute of Energy Technology(韩国能源技术研究院)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态RAG数据库场景,提出STeReO重排序器,构建专用数据集训练后,可有效聚合异构检索结果,显著提升下游问答性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26148 2026-08-28 cs.CL cs.SD eess.AS 新提交 62%

Towards Interpretable Depression Detection: Linking Acoustic Features to DSM-5 Indicators

面向可解释的抑郁检测:将声学特征与DSM-5指标关联

Jonas Länzlinger, Katharina O.E. Müller, Burkhard Stiller, Bruno Rodrigues

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 该研究提出透明关联框架,将语音声学特征映射到DSM-5抑郁指标,在DAIC-WOZ上初步验证了声学特征与相关指标的关联,实现可解释且隐私保护的抑郁检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26431 2026-08-28 cs.SD eess.AS 新提交 57%

AudioSpan: Spanning the Duration and Depth of Audio Comprehension

AudioSpan:覆盖音频理解的时长与深度

Wen Huang, Yunfei Chu, Meng Gao, Haolin He, Jin Xu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 音频语音多模态 :omni-modal(abstract);分类 eess.AS

AI总结 本研究提出覆盖10分钟至2小时音频的基准AudioSpan,含3240个分三认知层级的问题,评估12个大型音频-语言模型,发现从长音频提取相关事实是核心难点,该基准可公开获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26153 2026-08-28 cs.AI 新提交 57%

EEG-to-Report: An Annotation and Feature-Text Framework for Training Language Models on Clinical EEG

EEG-to-Report:用于在临床脑电图上训练语言模型的标注与特征-文本框架

Xuan-The Tran, Le Trung Kien Nguyen

机构 * Vietnam Maritime University(越南海事大学) HAISmartlink Lab(HAISmartlink实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 针对临床EEG报告依赖人工、现有工具无法满足AI训练需求的问题,提出EEG-to-Report框架,整合多格式EEG处理与标注,生成对齐特征-文本对,还含自动报告模块,为自动化EEG报告系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 10 篇

2608.26787 2026-08-28 cs.MM 新提交 79%

Self-Reflective Multi-modal Reasoning for Short-Video Fake News Detection

用于短视频假新闻检测的自反思多模态推理

Pinjie Xu, Yuzhou Yang, Zhikai Tan, Qichao Ying, Zaiyang Yu, Ce Li, Zhenxing Qian

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.MM

AI总结 针对短视频假新闻检测的挑战,提出SRM-FND框架,通过自反思多模态推理及相关机制,在FakeSV和FakeTT数据集上实现优于强基线的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27044 2026-08-28 cs.AI cs.CV 新提交 79%

Omni-Interactive Universal Embedder

全交互通用嵌入器

Wei-Yao Wang, Kazuya Tateishi, Shuyang Cui, Christian Simon, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 视频多模态 :multimodal(abstract);any-to-any(abstract);omni-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出OmniUE,一种支持文本、视频、音频全交互查询的通用嵌入器,在多个基准上超越现有模型,引入OmniCHOIR基准验证其能力,推动全模态表示学习发展。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26210 2026-08-28 q-bio.QM 新提交 78%

Multimodal risk trajectories reveal heterogeneous paths to dementia

多模态风险轨迹揭示痴呆的异质性路径

Zhiqi Lee, Haowen Li, Tao Liu, Shiyuan Zhang, Bingjie Wang, Jinzhao Fan, Yunkai Zhang, Zhuonan Wang, Lijun Bai

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 该研究开发多模态框架NetMoint,整合多组学与影像数据预测不同痴呆亚型的个体化长期风险,识别出小比例高风险群体及其特异性分子特征,为痴呆风险分层提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26193 2026-08-28 cs.AI 新提交 70%

AffectOmni: RL-Verifiable People-Centric Grounded Affective Reasoning for Social and Art-Related Scenes

AffectOmni:面向社交与艺术相关场景的可通过强化学习验证的以人为中心的接地情感推理

Yibo Wang, Rui Yang, Jisheng Dang, Bimei Wang, Yitao Wu, Pengfei Cao, Wencan Zhang, Hong Peng, Bin Hu, Tat-Seng Chua

机构 * Lanzhou University(兰州大学) Hainan University(海南大学) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 AffectOmni是面向社交与艺术场景的可验证情感推理框架,通过GRPO训练,引入两类奖励优化以人为中心的证据选择与时间推理,经多数据集实验较7B基线实现显著性能提升。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26786 2026-08-28 cs.MM 新提交 57%

Emotion Understanding in Streaming Video with Trajectory-Aware Reliability

基于轨迹感知可靠性的流视频情感理解

Qingsong Wang, Qigong Lei, Zitong Wang, Bohan Yu, Zhiang Dong, Jian liu, Weiqiang Wang, Chang Yao, Jingyuan Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

AI总结 针对流视频情感理解的实时需求,提出TRACE框架,通过轨迹感知可靠性机制优化多模态推理分配,在StreamMER等数据集上提升了准确率与成本的权衡效果。

Comments Accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26752 2026-08-28 cs.CV 新提交 57%

Glass Surface Detection Grounded in 3D Visual Geometry

基于3D视觉几何的玻璃表面检测

Yiwei Lu, Ke Xu, Tao Yan, Xiaojun Chang, Radu Timofte, Rynson W. H. Lau

机构 * Jiangnan University(江南大学) University of Science and Technology of China(中国科学技术大学) University of Wurzburg(维尔茨堡大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出将玻璃表面检测(GSD)基于3D视觉几何的新范式,结合VGGT、FSAM与GeGB,在7个基准上达最优性能,泛化性好且提升玻璃场景重建效果。

Comments 9 pages, 10 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26684 2026-08-28 cs.CV 新提交 57%

Reason in the Words You Speak: Idiolectal Paraphrasing Off-Policy Traces for Reasoning Distillation in VideoLLMs

用你所说的语言推理:为VideoLLM中的推理蒸馏进行个人习语式的离线策略轨迹改写

Ji Soo Lee, Jinyoung Park, Seohyun Lee, Jongha Kim, Joonmyung Choi, Jinsung Yoon, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) Korea University(高丽大学) Google Cloud AI Research(谷歌云人工智能研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对VideoLLM的推理蒸馏提出Echo-GRPO框架,通过改写教师特权轨迹为学生自身习语实现策略对齐,实例化的VideoEcho-R1在多骨干和基准测试中均获性能提升,且作为插件模块适配多种训练框架。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26495 2026-08-28 cs.CV 新提交 57%

Video-FLAIR: Not Whether to Reason, But How

Video-FLAIR:不是是否推理,而是如何推理

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出 Video-FLAIR 训练框架,通过强化学习让模型为多模态查询选择适配的推理模式,在多个视频多模态基准上提升准确率并降低 token 用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26659 2026-08-28 cs.LG 新提交 50%

Simple Actors and Deep Critics for Scalable Reinforcement Learning

用于可扩展强化学习的简单演员与深度评论家

Guhyeon Kang, Jaehwi Lee, Minhae Kwon

机构 * Sungkyunkwan University(成均馆大学) Soongsil University(崇实大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出LAC算法,将容量分配给深度评论家而非简单演员,解决离线RL中加深评论家的三种失效模式,在OGBench上实现与强基线相当性能且推理延迟最高降4倍。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26579 2026-08-28 cs.IR 新提交 50%

Preference Flow Matching with Spectral Factorization for Micro-video Recommendation

结合谱分解的微视频推荐偏好流匹配方法

Xinxin Dong, Haokai Ma, Fei Hu, YuZe Zheng, Bin Wu, Yonghui Yang, Xiaodong Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究针对微视频推荐中主流方法的语义动态纠缠与流匹配模型忽略时间结构的问题,提出PrismRec框架,通过谱语义分解和上下文校准偏好匹配,在四个数据集上较SOTA提升最高22.65%且效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2608.27121 2026-08-28 cs.MM cs.CV cs.LG 新提交 84%

How AI Experiences Art: Emergent Aesthetic Structure in a Self-Supervised Multimodal Embedding Space

AI如何体验艺术:自监督多模态嵌入空间中的涌现审美结构

Corey D.C. Heath

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 该研究提出自监督多模态嵌入框架,在无显式标签的情况下发现AI的审美结构,探讨其与人类情感标签的差异,可应用于RAG媒体组织与自动标注等场景。

Comments Accepted at ICMI Companion '26 (Companion Publication of the 28th ACM International Conference on Multimodal Interaction), October 5-9, 2026, Napoli, Italy. 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26414 2026-08-28 cs.CL cs.IR 新提交 79%

Case2Flow: Bridging Patient Cases and Guideline Flowcharts through Multimodal Retrieval

Case2Flow:通过多模态检索连接患者病例与指南流程图

Jiale Wei, Yufan Chen, Alexander Jaus, Zdravko Marinov, Julian Friedrich, Simon Reiß, Jens Kleesiek, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University Hospital Essen(埃森大学医院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究提出Case2Flow任务,构建含202份流程图的FlowAtlas语料库,提出无需训练的CRISP方法优化多模态检索,提升Recall@1达18.71个百分点,为病例匹配指南流程图提供可行方案。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26964 2026-08-28 cs.LG 新提交 78%

Graph-Based Pseudo-multimodal Contrastive Learning for 12-Lead ECG Representations

基于图的伪多模态对比学习用于12导联心电图表征

Mengyu Wang, Kozo Okada, Takafumi Goto, Natsuko Jinba, Hiroki Yamaya, Kiyoshi Hibi, Tomoki Hamagami

机构 * Yokohama National University(横滨国立大学) Yokohama City University Medical Center(横滨市立大学医学中心) Fukuda Denshi Co.,Ltd(福田电子株式会社)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对现有12导联ECG分析方法难以捕捉导联间依赖与全局模式的问题,提出Graph-CMMC框架,通过将ECG波形转换为GADF图像构建伪多模态表征,结合图关系模块建模导联间依赖,在冠状动脉闭塞分类任务上取得了有竞争力的性能。

Comments 7 pages, 7 figures. Presented at the 48th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 14 篇

2608.26581 2026-08-28 cs.LG 新提交 87%

Activation Outliers Matter: Robust Recovery for Quantized Multimodal LLMs

激活异常值很重要:量化多模态大语言模型的鲁棒恢复

Tanzila Rahman, Mehran Taghian Jazi, Yunke Peng, Zhuang Ma, Anandharaju Durai Raju, Yao Wang, Xing Huang, Hei Yi Mak, Shadan Golestan, Hoang Le, Yonghan Dong, Wei Guo, Yaoyuan Wang

机构 * Huawei(华为)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本研究针对多模态大语言模型超低比特量化的性能损失问题,提出Residual Fallback Quantization框架,可有效恢复MXFP4、HiF4量化下的性能,缩小与BF16基线的差距。

Comments 14 Pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏