arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-17 至 2026-08-17 共收录 68 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 2 篇

2608.13861 2026-08-17 cs.CV 新提交 79%

XSA-MAD: Cross-modal Semantic Alignment for Morphing Attack Detection

XSA-MAD:用于变形攻击检测的跨模态语义对齐

Jie Jin, Mahiro Tokumasu, Yu Makino, Masakatsu Nishigaki, Tetsushi Ohki

机构 * RIKEN AIP(理化学研究所人工智能项目)

专题命中 图文多模态 :cross-modal(title);multimodal(abstract);分类 cs.CV

AI总结 针对现有图像型变形攻击检测方法泛化性差的问题,提出基于CLIP的多模态框架XSA-MAD,通过对齐图像与语义空间实现对不同变形攻击的检测,在高保真攻击下性能优于现有方法

Comments accepted to ICIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21956 2026-08-17 cs.CV 版本更新 77%

Global-Local Dual Perception for MLLMs in High-Resolution Text-Rich Image Translation

全局-局部双感知用于高分辨率文本密集图像翻译的MLLMs

Junxin Lu, Tengfei Song, Zhanglin Wu, Pengfei Li, Xiaowei Liang, Hui Yang, Kun Chen, Ning Xie, Yunfei Lu, Jing Zhao, Shiliang Sun, Daimeng Wei

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Labs, Huawei Technologies Co., LTD(华为技术有限公司2012实验室) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出GLoTran框架,通过全局-局部双感知方法提升高分辨率文本密集图像翻译的准确性和完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 7 篇

2512.17474 2026-08-17 eess.AS cs.SD 83%

Zero-Shot Recognition of Dysarthric Speech Using Commercial Automatic Speech Recognition and Multimodal Large Language Models

基于商业自动语音识别和多模态大语言模型的口吃语音零样本识别

Ali Alsayegh, Tariq Masood

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract);分类 eess.AS

AI总结 本研究评估了商业ASR和MLLM在口吃语音识别中的性能,发现GPT-4o在重度口吃情况下显著降低WER,而Gemini变体表现下降,为辅助语音接口技术选择提供实证依据。

Journal ref International Journal of Intelligent Systems, 2026; 2026:6065038

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13957 2026-08-17 cs.SD cs.MM eess.AS 新提交 81%

H2H Music Improv: A Communication Model and Audio-Visual Dataset for Music Improvisation

H2H音乐即兴:一种音乐即兴的通信模型及视听数据集

Aleksandra Teng Ma, Anthony Cammarota, Jiayi Wang, Alexandria Smith, Cheng-Zhi Anna Huang, Jeffrey Albert, Alexander Lerch

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM、eess.AS

AI总结 该研究针对现有AI即兴系统缺乏通信意识的问题,通过与专业即兴者协作推导通信模型,并构建首个自由即兴的H2H视听数据集,为AI音乐伙伴设计提供新资源。

Comments Published in the Proceedings of the Society for Music Information Retrieval Conference (ISMIR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28642 2026-08-17 cs.AI 版本更新 77%

Parameter- and Bandwidth-Efficient Edge--cloud Many-to-Many Speech-to-Text Translation

带宽高效且隐私保护的边缘-云多对多语音翻译

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Lei Chen, Ming Liu, Bing Qin, Yang Xiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 提出边缘-云协同框架ESRT,通过分割推理架构压缩中间特征实现带宽降低10倍和语音隐私保护,并采用多任务加权课程学习策略实现45种语言的多对多语音翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14150 2026-08-17 cs.CL 新提交 57%

Leading-Silence Augmentation and Multi-Stage Synthetic Supervision for the Second MLC-SLM Challenge

面向第二届MLC-SLM挑战赛的前置静音增强与多阶段合成监督

Kexin Shi, Renhe Sun, Yuge Huang, Ximeng Wang, Jiayi Zhou, Jian Liu, Malu Zhang

机构 * Ant Group(蚂蚁集团) UESTC(电子科技大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对第二届MLC-SLM挑战赛的两项任务,分别采用前置静音增强等策略微调VibeVoice-ASR-7B、用合成问答对微调Qwen3-Omni-30B-A3B-Instruct,提升了任务1和任务2的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00982 2026-08-17 eess.AS 57%

VisG AV-HuBERT: Viseme-Guided AV-HuBERT

VisG AV-HuBERT:基于视觉发音的AV-HuBERT

Aristeidis Papadopoulos, Rishabh Jain, Naomi Harte

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出VisG AV-HuBERT,通过引入辅助的发音分类任务,强化模型对视觉发音特征的依赖,提升在噪声环境下的语音识别性能。

Comments Includes Supplementary Material. Accepted for Publication at International Conference on Pattern Recognition 2026 - ICPR 2026. Code is available at https://github.com/aristosp/visg_avhubert

Journal ref A. Papadopoulos, R. Jain, N. Harte, VisG AV-HuBERT: Viseme-Guided AV-HuBERT, in Pattern Recognition. ICPR 2026, Lecture Notes in Computer Science, vol. 16812, pp. 667-682, Springer, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10441 2026-08-17 cs.CL 版本更新 57%

Decoding Student Minds: Leveraging Conversational Agents for Psychological and Learning Analysis

解码学生心智:利用对话代理进行心理和学习分析

Nour El Houda Ben Chaabene, Hamza Hammami, Laid Kahloul

机构 * STIH Laboratory, Sorbonne University(索邦大学STIH实验室) LIPAH-LR11ES14, National Engineering School of Tunis(突尼斯国家工程学院LIPAH-LR11ES14) Faculty of Sciences of Tunis(突尼斯科学学院) LINFI Laboratory(LINFI实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出一种结合多模态数据和语义推理的对话代理,用于实时分析学生认知和情感状态,提升学习表现和情感福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02916 2026-08-17 cs.SD cs.LG 版本更新 50%

SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos

SALSA-V:基于视频的捷径增强式长同步音频生成模型

Amir Dellali, Luca A. Lanzendörfer, Florian Grötschla, Roger Wattenhofer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 SALSA-V是一种多模态视频转音频生成模型,通过掩码扩散目标和捷径损失实现长音频同步高保真生成,仅需8步采样即可快速生成,性能优于现有SOTA,可用于专业音频合成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 6 篇

2608.14157 2026-08-17 cs.AI cs.LG 新提交 79%

Removing Temporal Note Redundancy Improves Multimodal Reinforcement Learning for Medicine

消除时间性笔记冗余可提升医学多模态强化学习性能

Chenran Weng, Joo Seung Lee, Malini Mahendra, Anil Aswani

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对机械通气决策的RL方法缺失笔记临床信息的问题,提出冗余感知多模态框架,通过两种策略去除笔记冗余,在ICU数据上显著提升了RL临床决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14070 2026-08-17 cs.CV 新提交 70%

InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors

InstructVVT:无需辅助空间先验的指令驱动视频虚拟试穿

Dingbao Shao, Song Wu, Xinyu Chen, Qian Wang, Jiahang Li, Kuai Jiang, Jiang Lin, Yuhang Liu, Ziyu Chen, Duo Li, Jiaxin Hu, Shengrong Gu, Ziheng Tang, Rongrong Liu, Yanlun Peng, Liang Li, Junlan Feng, Lujia Jin, Ting Zhang, Jian Yang, Zili Yi

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 InstructVVT是基于DiT的视频虚拟试穿框架,通过双层级参考调控方案无需推理时空间先验,在ViViD-S等数据集上优于现有开源方法,解决了现有方法依赖辅助先验的问题。

Comments 23 pages, 10 figures. Dingbao Shao and Song Wu contributed equally. Zili Yi is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08705 2026-08-17 cs.CV 版本更新 57%

HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales

HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准

Wenbo Xu, Zhimin Chen, Xiaojie Liang, Hengrui Liu, Ziqi Sheng, Wei Lu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06201 2026-08-17 cs.CV 版本更新 57%

Point-Supervised Skeleton-Based Human Action Segmentation

基于点监督的骨架人类动作分割

Hongsong Wang, Yiqin Shen, Pengbo Yan, Jie Gui, Yang Zhang

机构 * Southeast University(东南大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种点监督框架,通过多模态骨架数据和新型原型相似性方法,实现了高效的基于骨架的人类动作分割,减少了注释工作量并提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14349 2026-08-17 cs.LG 新提交 50%

Non-Parametric Spatiotemporal Trajectory Prediction via State-Conditioned Transition Sampling

基于状态条件转移采样的非参数时空轨迹预测

Michael Fore, Akshay Jain, Justin Downes, Rohan Pradhan, Duncan Botti

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究提出一种无训练的非参数时空轨迹预测方法,无需GPU和学习参数,在数据充足时精度与57M参数Transformer相当,数据稀缺时性能显著更优,可从少量历史数据部署到新区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10780 2026-08-17 cs.RO 版本更新 50%

StageWAM: Joint-Embedding Stage Prediction for World-Action Models in Robot Manipulation

JEPA-WAM:机器人操作中世界-动作模型的阶段级联合嵌入预测

Xiao Liu, Yuguang Yang, Xi Wang, Kai Jiang, Cheng Chi, Yong Xu, Wenchao Ding, Yilun Chen, Yan Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 该研究针对通用机器人策略未明确建模任务阶段级未来的问题,提出JEPA-WAM模型,在50个RoboTwin 2.0任务上实现90.25%的整体成功率,成功减少了平均执行步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 8 篇

2607.18786 2026-08-17 cs.IR 版本更新 82%

Beyond Noisy Signals: Dual-Level Denoising for Multi-modal Sequential Recommendation

超越噪声信号:用于多模态序列推荐的双层去噪

Jie Luo, Qi Jin, Xinming Zhang

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 研究多模态序列推荐中的双重噪声困境,提出DDMSR框架,从特征拓扑和序列频率角度净化信号,设计基于图的特征去噪与频域序列去噪模块,纳入多模态对比对齐目标,实验证明该框架性能优于基线。

Comments Accepted by ACM MM 2026. 12 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14029 2026-08-17 cs.CL 新提交 79%

S2Dialog: Multimodal Dialogue Retrieval with Semantic and Acoustic-Style Modeling

S2Dialog:结合语义与声学风格建模的多模态对话检索

Xueqi Wang, Zhigang Wang, Runqing Zhang, Zhenqi Jia, Junfeng Zhao

机构 * College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) University of Electronic Science and Technology of China, Shenzhen Campus(电子科技大学深圳校区)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 研究针对现有多模态对话检索方法无法捕捉对话全局语义与风格一致性的问题,提出S2Dialog框架,结合对话级文本与声学检索器及对比学习,在DailyTalk数据集上实现出色检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08802 2026-08-17 cs.AI 版本更新 79%

Improving Generalization Robustness of Multimodal RLVR

提升多模态RLVR的泛化鲁棒性

Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) University of California Berkeley(加州大学伯克利分校) Rochester Institute of Technology(罗切斯特理工学院) Georgia Institute of Technology(佐治亚理工学院) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28026 2026-08-17 cs.AI 版本更新 79%

BUZZY: Contrastive Scoring to Mitigate Text-Induced Bias in Multimodal Multiple-Choice QA

当选择成为先验:用于科学图表多选问答的对比解码

Taeyun Roh, Suhyeong Park, Dongyoung Lee, Eunyeong Jo, Wonjune Jang, Junha Jung, Jaewoo Kang

机构 * Korea University(高丽大学) Konkuk University(建国大学) Myongji University(明知大学) AIGEN Sciences

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出SCICON方法,通过对比文本和图像信息,减少选择偏差,提升科学图表多选问答的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14355 2026-08-17 cs.AI 新提交 70%

Disentangled Shared Representations Improve Morpho-Transcriptomic Integration

解耦共享表示可改进形态-转录组整合

Julian Ostermaier, Swann Ruyter, Reuben Dorent, Daniel Racoceanu

机构 * ESPCI Paris, PSL University(巴黎高等物理化工学院,PSL大学) Sorbonne Université(索邦大学) CNRS(法国国家科学研究中心) Inserm(法国国家健康与医学研究院) AP-HP(巴黎公共医疗集团) Inria(法国国家信息与自动化研究所) Paris Brain Institute – ICM(巴黎脑研究所 – ICM)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本研究针对空间转录组学的多模态表示学习问题,对比不同模型的标准与解耦变体,发现解耦共享与模态特有信息可提升相关指标,为多模态学习提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14252 2026-08-17 cs.AI cs.CL 新提交 62%

Grounding Without Corrective Control: Truth-Tracking Profiles for Large Language Models

无校正控制的基础:大语言模型的真值追踪剖面

Brett Reynolds

机构 * Humber Polytechnic(亨伯理工学院) University of Toronto(多伦多大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型中无校正控制的基础问题,提出路径剖面概念以分析真值追踪,指出纯文本模型继承的模式可提供衍生可应答性,不同方法对任务的真值追踪改进可能与表面改进不一致。

Comments 24 pages, 1 figure, 1 table. A six-page methodological supplement, reproducible R script, and constructed data are included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13939 2026-08-17 cs.CV cs.AI 新提交 62%

CMCNet: Aligning Ultrasound Image Embeddings with Textual TI-RADS Representations for Fine-Grained Thyroid Classification

CMCNet:将超声图像嵌入与文本TI-RADS表示对齐以用于细粒度甲状腺分类

Bingxin Yu, Xueli Wang, Jerry Zhou, Wenyan Wang, Li Wen, Lan Huang, Xin Feng, Fengfeng Zhou, Kewei Li

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建含600个甲状腺结节的STN数据集,提出CMCNet模型,通过中心间隔对比损失对齐图像与文本嵌入,实现细粒度甲状腺分类,性能优于多类基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08151 2026-08-17 cs.CV cs.MM 版本更新 62%

Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention

视觉与语言在哪里交汇?通过对比注意力理解并优化MLLMs中的视觉融合

Shezheng Song, Shasha Li, Shan Zhao, Xiaopeng Li, Qian Wan, Chengyu Wang, Tianwei Yan, Jun Ma, Jie Yu

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 通过对比注意力框架,研究揭示了MLLMs中视觉-文本融合的层次演变,并改进了多模态推理性能。

Comments CVPR Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 11 篇

2608.14043 2026-08-17 cs.CV 新提交 90%

Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation

超越文本条件:面向视频生成的MLLM-DiT融合系统研究

Yanbo Ding, Yijia Fan, Caihua Shan, Yifan Yang, Yifei Shen, Weijie Wang, Xirui Hu, Dongsheng Li, Lili Qiu, Yuqing Yang, Yali Wang

机构 * Chinese Academy of Sciences(中国科学院) Microsoft Research(微软研究院) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学)

专题命中 多模态生成 :MLLM(title,title_cn);分类 cs.CV

AI总结 该研究针对视频生成中MLLM与DiT融合问题,提出BiVidGen框架,通过MLLM生成语义视觉标记辅助DiT渲染,提升了视频的语义对齐度与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13679 2026-08-17 cs.GR 新提交 82%

Strand-based Hairstyle Generation via Large Reconstruction and Multimodal Models

基于 strand 的发型生成:结合大型重建模型与多模态模型

Conghui Hao, Tao Huang, Yuefan Shen, Tongtong Wang, Zhongtian Zheng, Kui Wu

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 该研究提出一种结合 LRMs、LMMs 与经典几何处理的自动流程,可从单视图图像快速生成高质量、适配生产的各类基于 strand 的发型,适用于现代数字人工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14138 2026-08-17 cs.CV cs.AI 新提交 81%

SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation

SPARGen:通过原生多模态生成统一空间感知与推理

Jinsheng Quan, Jianhua Li, Siyi Xie, Xuanke Shi, Kewang Deng, Zukai Chen, Feifei Shao, Lei Yang, Quan Wang, Yawei Luo

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 SPARGen是统一多模态框架,将3D重建等空间任务转为指令条件生成任务,在单一框架内实现异构空间任务的竞争力性能,突破现有方法的知识迁移限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15740 2026-08-17 cs.CV cs.AI cs.LG cs.MM 版本更新 80%

Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

通过隐式文化对齐奖励建模消除文本到图像评估中的偏差

Bo-An Chang, Yu-Chih Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究文本到图像评估中文化真实性问题,提出基于轻量级多模态大语言模型构建的隐式文化对齐奖励模型,集成隐式文化探测器与跳跃连接交叉注意力机制,实验证明该模型准确率高、速度快,能为偏好优化管道提供有效信号。

Comments 16 pages, 2 figures, ECCV 2026 Workshop FAILED

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14446 2026-08-17 cs.AI 新提交 79%

Wyvern: An Agentic Framework for Generating Grounded Multimodal Reports

Wyvern:用于生成基于事实的多模态报告的智能体框架

Beatrice Alessandra Motetti, Emilien Guandalino, Daniele Jahier Pagliari, Alessio Burrello, Lorenz K. Müller, Konstantin Berestizshevsky, Lukas Cavigelli

机构 * Politecnico di Torino(都灵理工大学) Huawei Research(华为研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 针对生成式模型内容缺乏事实依据的问题,提出Wyvern多智能体框架生成多模态技术报告,经评估其图像信息量、报告实用性及引用指标均优于基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14032 2026-08-17 cs.IR cs.AI 新提交 79%

HAM-RAG: Hierarchy-Aware Multimodal RAG for Structure-Faithful Interleaved Generation

HAM-RAG:面向结构保真交错生成的层级感知多模态检索增强生成

Yin Li, Ziyang Hu, Zhiyu Guo, Xiangyu Liu, Wenbin Li, Boo-Ho Yang, Rav Lawana, Ziyue Li, Wei Zeng, Fugee Tsung

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文针对现有多模态RAG方法丢失结构化文档层级信息的问题,提出HAM-RAG框架,引入HAM-Bench基准验证,使多模态平均性能提升17.3%,为可靠多模态助手提供了层级感知的基础信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11116 2026-08-17 cs.CV cs.NE 79%

Toward Generalized Detection of Synthetic Media: Limitations, Challenges, and the Path to Multimodal Solutions

Redwan Hussain, Mizanur Rahman, Prithwiraj Bhattacharjee

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

Comments 10 Pages, 4 figures, 1 table, 7th International Conference on Trends in Computational and Cognitive Engineering(TCCE-2025)

详情

展开后加载摘要…

URL PDF HTML 收藏