CUE-M: Contextual Understanding and Enhanced Search with Multimodal Large Language Model
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
Comments Preprint. Under review
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
Comments Preprint. Under review
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
Comments arXiv admin note: substantial text overlap with arXiv:2410.15281
专题命中 多模态RAG :RAG(abstract);retriever(abstract);分类 cs.CL
Comments NAACL 2025 main
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
Comments 11 pages, 4 figures. 2 tables
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
Comments the correct arxiv version
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
Comments 6 pages
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
Comments Accepted to NeurIPS2024
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR
Comments Accepted to Demo track of EMNLP 2024
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
Comments 8 pages, 1 figure
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR
Comments ACMMM 2024 MMGR WORKSHOP
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
Comments 13 pages, 6 figures, a plug-and-play framework to augment large vision-language models with up-to-date internet knowledge
专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract);分类 cs.AI
专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract);分类 cs.CL
Comments 5 pages, 1 figure, 15th International Particle Accelerator Conference
机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genoa, Italy(人机交互实验室,意大利理工学院,热那亚) ; Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院,美国亚特兰大)
专题命中 多模态RAG :RAG(abstract,comments);retrieval-augmented generation(abstract)
Comments Code, video and RAG dataset are available at \url{https://sites.google.com/view/omni-vic}
UEmbed:统一稀疏与稠密多模态嵌入
机构 * CASIA(中国科学院自动化研究所) ; Alibaba Group(阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Yale University(耶鲁大学)
专题命中 多模态RAG :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 UEmbed是一种仅解码器的多模态嵌入模型,可单次前向传播生成稀疏与稠密表示,在MMEB-v2和BEIR上表现优异,统一了两类嵌入并支持多模态智能体应用。
PRIMA:通过大语言模型进行风险集成图像-元数据对齐的医学诊断预训练
机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) ; Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学眼科与视觉科学系)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 提出PRIMA框架,通过检索增强生成策展风险-疾病关联专家语料库优化文本编码器,用双编码器预训练策略及四个互补损失函数弥合模态差距,融合特征用于疾病分类,性能优于其他方法。
基于超像素的二次无约束二进制优化用于可扩展量子增强医学图像分割
机构 * American University of Beirut(贝鲁特美国大学) ; Centre de Visió per Computador (CVC)(计算机视觉中心 (CVC)) ; Ingenii Inc.(英格尼公司) ; Hamad Bin Khalifa University(哈马德·本·哈利法大学)
专题命中 多模态RAG :RAG(abstract,abstract_cn)
AI总结 研究针对QUBO用于医学图像分割时的可扩展性挑战,提出基于超像素的QUBO框架,用简单线性迭代聚类分组像素,在区域邻接图上公式化分割。实验表明该方法提升了分割质量、计算速度并减小问题规模,还符合量子退火器连接限制。
Comments 7 pages, 2 figures
OmniRetriever: 通过融合作为教师蒸馏实现任意到任意的音频-视频-文本检索
机构 * Memories.ai Research(Memories.ai研究院)
专题命中 多模态RAG :RAG(abstract,abstract_cn)
AI总结 提出融合作为教师蒸馏方法,利用三元组嵌入的融合信号训练单模态嵌入,并构建OmniRetriever-7B模型,在零样本检索基准上超越现有方法,同时发布OmniRetriever-Bench基准。
基于轻量级置信感知语言模型的自动驾驶决策
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract)
AI总结 提出一种利用轻量级置信感知语言模型的决策框架,通过多智能体协作生成置信注释的决策演示并蒸馏到双头轻量模型,在nuPlan上实现SOTA成功率和低延迟。
Comments 8 Pages, 3 figures, ITSC 2026
HOG-Layout:通过视觉-语言模型实现层次化3D场景生成、优化与编辑
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 HOG-Layout利用大语言模型和视觉-语言模型实现文本驱动的层次化3D场景生成、优化与实时编辑,通过检索增强生成技术提升语义一致性,结合优化模块增强物理一致性,实现高效场景编辑。
Comments CVPR 2026
通过一次剪辑检索增强多模态大语言模型的长视频理解
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算教育部重点实验室) ; Xiamen University(厦门大学)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 本文提出OneClip-RAG方法,通过一次剪辑检索提升多模态大语言模型对长视频的理解能力,改进知识完整性和语义连贯性,并设计新数据集和训练方案。
VQ-Jarvis:具备锐利视觉与快速思考的检索增强视频修复代理
机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院,深圳,中国) ; ByteDance Inc., Shenzhen, China(字节跳动公司,深圳,中国)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 本文提出VQ-Jarvis,一种具备锐利视觉与快速思考的视频修复代理,通过构建大规模视频配对增强数据集和分层操作调度策略,提升视频修复的准确性和效率。
Comments Video restoration, Agent-based restoration
FinMMDocR:基于场景意识、文档理解与多步骤计算的金融多模态推理基准测试
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 FinMMDocR通过引入场景意识、文档理解和多步骤计算,推动多模态大语言模型在现实金融场景中的推理能力提升,其包含12种隐含金融场景、9类丰富文档及平均11步推理任务。
Comments Accepted by AAAI-26 Main Track
Journal ref Proc. AAAI 2026 (Vol. 40, No. 30), pages 25858-25866
PaAgent:通过主观-客观强化学习实现的面向人物图像修复代理
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) ; Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院) ; State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学智慧城市物联网国家重点实验室) ; National-Local Joint Engineering Research Center of Biodiagnosis and Biotherapy, the Second Affiliated Hospital of Xi’an Jiaotong University(西安交通大学生物诊断与生物治疗国家地方联合工程研究中心) ; College of Information and Control Engineering, Xi’an University of Architecture and Technology(西安建筑科技大学信息与控制工程学院)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract)
AI总结 PaAgent通过结合自进化的人物银行和检索增强生成技术,提升图像修复任务中对复杂场景的感知能力,通过主观-客观强化学习策略优化修复工具选择,实验验证其在多种修复基准上的优越性。