arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-18 至 2026-08-18 共收录 170 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 23 篇

2504.13460 2026-08-18 cs.CV cs.AI 81%

Chain-of-Evidence Multimodal Reasoning for Few-shot Temporal Action Localization

基于证据链的多模态推理用于少样本时序动作定位

Mengshi Qi, Hongwei Ji, Wulian Yun, Xianlin Zhang, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于证据链的多模态推理方法,通过结合文本和视觉信息提升少样本时序动作定位的性能。

Comments Accepted by TIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14657 2026-08-18 cs.LG cs.CV 新提交 79%

LUNG-KGMM: Knowledge-Guided Multimodal Learning for Lung Cancer Incidence Prediction

LUNG-KGMM:用于肺癌发病预测的知识引导多模态学习

Chunlei Yang, Shuyan Li, Zhong Cao

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出LUNG-KGMM知识引导多模态框架,整合多类数据与临床知识开展1-6年肺癌发病预测,经MIMIC及厦门队列验证,其性能优于现有方法且具备跨队列可迁移性。

Comments 22 pages, 4 figures, 7 tables, accepted by PRCV Oral

Journal ref The 9th Chinese Conference on Pattern Recognition and Computer Vision, PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21333 2026-08-18 cs.CV 版本更新 79%

MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

MME-VideoOCR:评估多模态大语言模型在视频场景中基于OCR的能力

Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zhang, Liang Wang, Haoxuan Li, Zhouchen Lin, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Wenjing Yang

机构 * Kling Team(Kling团队) PKU(北京大学) THU(清华大学) CASIA(中国科学院自动化研究所) CUHKSZ(香港科技大学) NTU(国立台湾大学) NJU(南京大学) XJTU(吉林大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文推出MME-VideoOCR视频OCR基准,评估18个最先进MLLMs的视频OCR能力,发现现有模型在需视频整体理解的任务中表现有限,最优模型准确率仅73.7%,明确了高分辨率输入等对视频OCR的重要性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14952 2026-08-18 cs.RO cs.CV eess.SP 新提交 74%

Evidence of Absence: Cross-Modal Abductive Risk Perception to Sustain World Models When Vision Fails

不存在的证据:当视觉失效时维持世界模型的跨模态溯因风险感知

Cong Xu, Ravi Sankar

机构 * University of South Florida(南佛罗里达大学)

专题命中 视频多模态 :cross-modal(title);分类 cs.CV

AI总结 该研究提出跨模态溯因风险感知方法,在视觉失效时通过声学线索维持世界模型,可提前1.7秒预警,虚警减少42%,校准良好,能在视觉退化下保持高危险感知度。

Comments 7 pages, 3 figures. Working draft prepared for journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15869 2026-08-18 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 70%

Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

超越视觉思维链:用于主动视频推理的内化视觉思维

Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel, Joerg Liebelt

机构 * Apple(苹果公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究提出后训练框架IVT,在训练时内化视觉预测能力,推理时直接生成答案,相较Visual CoT性能相当或更优且延迟降低5倍以上,可实现更高效准确的主动视频推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14754 2026-08-18 eess.SP 新提交 67%

EEG2MOTION: Towards Open-Vocabulary Human Motion Synthesis from Non-invasive Brain Signals

EEG2MOTION:面向基于无创脑信号的开放词汇人体动作合成

Yulong Peng, Yijian Pan, Yuqi Yang, Nenggan Zheng, Weidong Chen, Xiaoling Hu, Shaomin Zhang

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 研究人员推出首个EEG-动作-文本数据集EEG2MOTION,提出EEG条件掩码动作模型EMMM,实现从无创脑信号生成多样连贯的全身体人体动作,为生成式开放词汇运动BCI开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16316 2026-08-18 cs.CV cs.AI cs.CL 新提交 67%

Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning

深度思维对齐:面向视频推理的轨迹级潜在知识蒸馏

Ao Shen, Yongheng Zhang, Yinghui Li, Manning Wang, Di Yin, Xing Sun

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对视频推理LMMs的高计算成本问题,提出Latent-OPD方法,通过轨迹级潜在知识蒸馏与渐进式教师前瞻策略提升轻量模型性能,在6个基准上优于仅输出监督的OPD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13606 2026-08-18 cs.AI cs.CL cs.LG cs.MA cs.MM 版本更新 67%

MobileMem: Learning from a Year of Mobile Experiences

MobileMem:从一年的移动体验中学习

Xinle Deng, Yida Xue, Xiangyuan Ru, Yijun Chen, Buqiang Xu, Mingjun Mao, Xinjie Liu, Haoming Xu, Shuofei Qiao, Mengru Wang, Chen Jiang, Yuchen Eleanor Jiang, Lizhong Wang, Jason Wang, Li Zeng, Haofen Wang, Guilin Qi, Huajun Chen, Ningyu Zhang

机构 * OPPO OpenKG

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。

Comments Technical Report; Project Page: http://mobilemem.openkg.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14718 2026-08-18 cs.CV cs.CL 新提交 62%

VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understanding

VideoGAIA:面向通用人工智能助手的智能体视频理解基准

Fan Zhang, Guangming Yao, Jinyang Wu, Hao Wu, Zheng Lian, Xinyu Geng, Jingdong Chen, Yi Yuan, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 VideoGAIA是面向通用AI助手的智能体视频理解基准,构建多轮工具增强交互任务,现有MLLMs在其上准确率不足60%,可评估下一代模型并推动相关转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08974 2026-08-18 cs.CV cs.AI 版本更新 62%

Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models

追踪真相:面向视频大语言模型的物体感知时空监控

Tri Cao, Khoi Le, Thong Nguyen, Cong-Duy Nguyen, Quynh Vo, Anh Tuan Luu, Chunyan Miao, See-Kiong Ng, Shuicheng Yan, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) VinUniversity(文大学) Nanyang Technological University(南洋理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出STEMO-Bench基准测试,通过分解查询验证时空监控能力,改进视频大语言模型的时空推理一致性。

Comments The authors are withdrawing this manuscript due to errors identified in the experimental evaluation and result aggregation, which affect several reported quantitative results and some conclusions. These issues require substantial re-evaluation of the experiments and analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11399 2026-08-18 cs.CV cs.CL 版本更新 62%

Lost in Adaptation: Layer-Selective Recovery of Temporal Reasoning in Video-Language Models

层次间推理:通过层选择性融合恢复视频-语言模型中的时间推理

Zihang Fu, Haonan Wang, Jian Kang, Kenji Kawaguchi, Jiaying Wu

机构 * National University of Singapore(新加坡国立大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出MERIT框架,通过层选择性融合提升视频-语言模型的时间推理能力,同时保持时间感知能力,优于全模型融合和随机层选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16332 2026-08-18 cs.CV 新提交 57%

Unlocking Motion in Expressions: Temporal Calibration for Referring Video Object Segmentation

解锁表达中的运动:用于指称视频目标分割的时间校准

Yiwen Jiang, Zhengtong Zhu, Ruixin Zhang, Jiaqing Fan

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对指称视频目标分割中运动语义依赖未显式建模的问题,提出EMC框架,通过MSP、MIC、STSC模块校准运动线索,在6个基准上验证了方法的优越性。

Comments Accept by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15708 2026-08-18 cs.CV 新提交 57%

What You Ask is What You Ground: Bridging Question Intent to Temporal Evidence for Grounded VideoQA

你所问即你所定位:连接问题意图与时序证据以实现定位视频问答

Jinhwan Seo, Kyubeom Han, Jumin Lee, Junhyug Noh, Sung-eui Yoon

机构 * KAIST(韩国科学技术院) Ewha Womans University(梨花女子大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对定位视频问答中问题不变定位的失效模式,提出GroundFormer模型,通过可学习通信令牌、因子化MIL交叉注意力等技术,在NExT-GQA和STAR数据集上实现最优性能,提升时序定位的问题区分性。

Comments Accepted at ECCV2026. Code: https://github.com/jinhseo/GroundFormer. Project page: https://jinhseo.github.io/groundformer/groundformer.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15437 2026-08-18 cs.RO cs.CV cs.DC cs.SY eess.SY 新提交 57%

MM-BEV: Enhancing Timeliness by Computing Where and When it Matters

MM-BEV:通过计算关键的位置与时刻提升时效性

Liangkai Liu, Kang G. Shin

机构 * Texas Tech University(德克萨斯理工大学) University of Michigan(密歇根大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MM-BEV是一种遵循「计算关键位置与时刻」的实时多模态BEV系统,通过四种机制优化,在nuScenes数据集和Clearpath Husky A300平台上显著降低延迟,且性能损失极小。

Comments 12 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15261 2026-08-18 cs.CV 新提交 57%

Boundary-Aligned Contribution Routing for Robust Optical--SAR Object Detection

用于稳健光学-SAR目标检测的边界对齐贡献路由

Haifa Zhang, Yijing Wang, Haoyu Wang, Zheng Li, Zhiqiang Zuo

机构 * Tianjin University(天津大学) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 该研究针对光学-SAR融合目标检测中的负跨模态迁移问题,提出边界对齐贡献路由方法,在M4-SAR和SpaceNet6-OTD实验中提升了检测性能并降低了负迁移率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15230 2026-08-18 cs.CV 新提交 57%

PersonaDrive: Controllable Trajectory Prediction with Multi-Dimensional Driving Personas

PersonaDrive:基于多维驾驶 personas 的可控轨迹预测

Chan Lee, Kimin Yun, Yuseok Bae, Seong Tae Kim, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学) ETRI(韩国电子通信研究院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对现有轨迹预测方法可控性不足的问题,提出 PCT 数据集与 PersonaDrive 框架,通过多轴设计实现可控轨迹生成,性能优于基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15085 2026-08-18 cs.CL 新提交 57%

Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs

为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性

Yihang Du, Juhao Liang, Zhengzhao Lai, Siyu Li, Yan Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15058 2026-08-18 cs.CV 新提交 57%

MEDR: Query-Independent Frame Selection via Multi-Signal Event Modeling and Dynamic Rescoring

MEDR:基于多信号事件建模与动态重评分的查询无关帧选择

Xinlei Pu, Weijie Shi, Wen Yang, Yi Cao, Hao Chen, Yuanjun Liu, Wenwei Ding, Jia Zhu, Jiajie Xu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出无需训练的MEDR帧选择方法,通过多信号事件建模与动态重评分实现查询无关,在Video-MME等基准上提升了多模态大语言模型的长视频处理准确率,且帧集可跨问题复用。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14740 2026-08-18 cs.CV 新提交 57%

From Dense Prediction to Visual Editing: Structured Supervision for Unified Image and Video Creation

从密集预测到视觉编辑:用于统一图像与视频创作的结构化监督

Zhefan Rao, Bin Zou, Haoxuan Che, Xuanhua He, Chong Hou Choi, Yanheng Li, Rui Liu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Celia Research HK City University of Hong Kong(香港城市大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出基于深度与表面法向量预测的结构化视觉监督框架,共享MMDiT主干实现统一图像视频创作,提升了相关基准任务分数,证明密集监督对下游创作的结构知识迁移价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13015 2026-08-18 cs.RO 版本更新 50%

Learning Versatile Humanoid Manipulation with Touch Dreaming

通过触觉梦想学习多功能人形操作

Yaru Niu, Zhenlong Fang, Binghong Chen, Shuai Zhou, Revanth Krishna Senthilkumaran, Hao Zhang, Bingqing Chen, Chen Qiu, H. Eric Tseng, Jonathan Francis, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) UT Arlington(UT阿灵顿) Bosch Center for AI(博世人工智能中心)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出HTD模型,结合触觉、视觉和本体感觉,通过触觉梦想增强学习实现高灵活性的人形操作,实验证明在五个真实任务中成功率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19264 2026-08-18 physics.med-ph 版本更新 50%

A novel method for analysis of transient morphological changes in quasiperiodic physiological signals and their neurogenic correlates

一种用于分析准周期生理信号瞬态形态变化及其神经源性关联的新方法

Tomasz Gradowski, Damian Waląg, Tomir Domański, Teodor Buchner

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种新的可视化方法,用于分析准周期生理信号的瞬态形态变化及其神经源性关联,通过二维地毯图同时评估心跳节律和信号特征。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 18 篇

2411.15041 2026-08-18 cs.AI cs.CL 版本更新 86%

mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA

mR²AG:用于基于知识的视觉问答的多模态检索-反思增强生成

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Chen, Zhongang Qi, Chunfeng Yuan, Bing Li, Junfu Pu, Yuxuan Zhao, Zehua Xie, Jin Ma, Ying Shan, Weiming Hu

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对多模态大语言模型在基于知识的视觉问答中的缺陷,提出mR²AG框架,通过两种反思操作实现自适应检索与信息定位,在相关基准任务上性能优于现有方法。

Comments Accepted for publication in IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16628 2026-08-18 cs.AI 新提交 83%

Hypergraph-based Multimodal Retrieval-Augmented Generation with Incremental Refinement

基于超图的多模态检索增强生成与增量优化

Shenao Chen, Yidan Xu, Xiangmin Han, Rundong Xue, Duanpo Wu, Yuhan Gao, Chenggang Yan, Yue Gao

机构 * Hangzhou Dianzi University(杭州电子科技大学) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 该研究针对现有多模态检索增强生成系统的二元连接局限与优化冗余问题,提出Hyper-M2RAG框架,通过多模态超图建模与锚点驱动的增量优化机制,在多模态基准数据集上实现优于现有方法的性能。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15096 2026-08-18 cs.CV eess.IV 新提交 83%

MODAL: Multi-Modal Object Re-ID via Model-Driven Sparse Decoupling and Text-Image Differential Filtering

MODAL:基于模型驱动稀疏解耦与文本-图像差分滤波的多模态对象重识别

Chengbo Huang, Jun-Jie Huang, Long Lan, Tianrui Liu, Xueqiong Li, Yuanxi Peng, Xinwang Liu, Meng Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MODAL多模态对象重识别框架,通过多模态特征稀疏解耦模块与文本-图像差分滤波模块解决现有方法的特征纠缠与模态缺失性能下降问题,在四个数据集上取得SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23694 2026-08-18 cs.CL 版本更新 83%

ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models

ChartFI: 多模态大语言模型图表描述的忠实性与洞察力基准测试

Fen Wang, Zekai Shao, Qiman Kang, Chunran Hu, Zhixuan Zhang, Lexu Xie, Chao Liu, Siming Chen

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Zhengzhou Zhongke Institute of Integrated Circuit and System Application(郑州中凯集成电路与系统应用研究院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 提出ChartFI-Bench基准,包含896个复杂图表-描述对,并设计四个评估指标(忠实性、覆盖率、信息量、敏锐度),系统评估多模态大语言模型生成图表描述的质量。

Comments Accepted by VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14763 2026-08-18 eess.IV cs.AI cs.CV cs.LG 新提交 81%

Cross-Modal Ultrasound-MRI Learning for Fetal Brain Ventricular Volumetry and Abnormality Screening

用于胎儿脑室体积测量与异常筛查的跨模态超声-MRI学习

Yuhao Huang, Yuanji Zhang, Yuhuan Lu, Dong Ni, P. Ellen Grant, Davood Karimi

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出跨模态学习框架VIFBA,基于超声视频实现胎儿脑室体积预测、VM严重程度分类及非VM异常筛查,性能优于基线与现有模型,为产前脑筛查提供实用方案。

Comments 17 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22067 2026-08-18 cs.CL cs.AI 版本更新 81%

Multimodal Language Models Benchmarked Against the NRC Reactor Operator Licensing Examination: Fine-Tuning and Retrieval Strategies

基于美国核管理委员会反应堆操作员执照考试的多模态语言模型微调与检索策略基准测试

Isak Hwang, Yoon Pyo Lee, Syed Bahauddin Alam

机构 * organization= Department of Nuclear Engineering, Hanyang University , addressline= 222 Wangsimni-ro , postcode= 04763 , state= Seongdong-gu , city= Seoul , country= South Korea organization= The Grainger College of Engineering, Nuclear, Plasma \& Radiological Engineering, University of Illinois Urbana-Champaign , city= Urbana , state= IL , country= USA

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对美国核管理委员会反应堆操作员执照考试,评估310亿参数多模态模型应用核知识的能力,通过对比基础模型与多种微调及检索配置,发现固定大小分块RAG的SFT配置表现最佳,并揭示了分块策略规律及RAFT与SFT的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15662 2026-08-18 cs.LG 新提交 78%

Sequential Multimodal Evidence Optimization for Product Media Ranking in E-Commerce

电商中产品媒体排序的序列多模态证据优化

Prasenjit Dey, Frank McIntyre, Arnab Sinha

机构 * Amazon.com Inc.(亚马逊公司)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对电商产品媒体排序问题,本文提出SMEO框架,通过轨迹效用模型和生存加权自回归策略优化,提升转化率并减少消费者划动次数。

Comments Proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026), Rome, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14841 2026-08-18 cs.AI 新提交 74%

What the Reranker Sees: Multi-Aspect Page Annotation for Long-Document Multimodal Question Answering

重排序器所见:面向长文档多模态问答的多方面页面标注

Guanchen Wu, Jiayuan Ding, Subhabrata Mukherjee, Carl Yang

机构 * Emory University(埃默里大学) Hippocratic AI(希波克拉底人工智能公司)

专题命中 跨模态检索 :multimodal(title);分类 cs.AI

AI总结 本文针对长文档多模态问答的重排序瓶颈,提出含Trident-R与Trident-S组件的Trident模型,通过多方面页面标注提升检索与生成性能,在多数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16536 2026-08-18 cs.CR cs.CL 新提交 70%

DSPrompt: Dynamic Soft Prompt Defense Against M-RAG Corruption

DSPrompt:针对M-RAG污染的动态软提示防御

Chang Liu, Yuni Lai, Mingyue Cui, Cong Tian, Yunyan Zhang, Xian Wu, Kai Zhou, Bin Xiao

专题命中 跨模态检索 :multimodal(abstract,abstract_cn);分类 cs.CL

AI总结 本文针对M-RAG面临的对抗攻击问题,提出DSPrompt动态软提示防御框架,通过在冻结检索器编码器插入可学习软提示,以低开销实现了优于现有方法的防御效果,同时维持检索与生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏