SoccerRAG: Multimodal Soccer Information Retrieval via Natural Queries
专题命中 多模态RAG :RAG(abstract,comments);retrieval augmented generation(abstract);分类 cs.IR
Comments accepted to CBMI 2024 as a regular paper; https://github.com/simula/soccer-rag
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 多模态RAG :RAG(abstract,comments);retrieval augmented generation(abstract);分类 cs.IR
Comments accepted to CBMI 2024 as a regular paper; https://github.com/simula/soccer-rag
太迟回忆:多模态知识检索中双跳问题的解释
机构 * University of Oxford(牛津大学) ; McGill University(麦吉尔大学) ; Meta ; MATS
专题命中 多模态RAG :knowledge retrieval(title)
AI总结 本文研究了多模态知识检索中双跳问题的影响,发现VLMs在处理视觉输入时过晚解决实体表示导致事实回忆性能下降,并提出通过修补和提示方法恢复性能。
建筑文档中基于证据的约束检查
专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.AI
AI总结 该研究针对建筑文档审查的约束检查问题,提出基于证据的流程,通过实验发现调整图像预算分配可提升项目家族决策准确性,同时揭示分辨率广度权衡,为证据路由和专家审查提供依据。
Comments 11 pages, 3 figures, 4 tables
通过偏好优化整合多模态知识以增强大语言模型的多模态知识转移(生物医学应用)
专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.CL
AI总结 MINT通过偏好优化整合多模态知识,提升大语言模型在生物医学任务中的表现,特别是在罕见遗传疾病预测和组织类型分类中取得显著成效。
GUIDE:通过实时网络视频检索和即插即用标注解决GUI代理的领域偏见
机构 * Shanghai Jiao Tong University(上海交通大学) ; State Key Laboratory for General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院) ; Beijing Institute of Technology(北京理工大学)
专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.AI
AI总结 GUIDE通过实时网络视频检索和即插即用标注框架,解决GUI代理的领域偏见问题,通过视频语义分析和自动化标注流程提升代理对特定应用的操作流程和UI布局的理解,实验表明其在多代理系统和单模型代理中均能提升性能。
Comments Accepted to ECCV 2026. 30 pages: 15-page main paper followed by supplementary material as an appendix (Sections A-F). Project page: https://sharryXR.github.io/GUIDE/
WorldMemArena: 通过动作-世界交互评估多模态智能体记忆
机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) ; J.P. Morgan Chase(摩根大通) ; ETH Zurich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.CL
AI总结 提出WorldMemArena基准,通过动作-世界交互循环的四阶段生命周期评估多模态智能体记忆,揭示现有方法在写入、维护、检索和使用中的失败点。
Comments 25 pages, 8 figures
VRAG:面向交互式视频生成的世界模型学习
机构 * Peking University(北京大学) ; University of Oxford(牛津大学) ; Princeton University(普林斯顿大学)
专题命中 多模态RAG :retrieval augmented generation(abstract);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 针对自回归视频生成中累积误差和记忆机制不足的问题,提出视频检索增强生成(VRAG)方法,通过显式全局状态条件降低长期累积误差并提升时空一致性。
Comments Published at NeurIPS 2025. Project page: https://sites.google.com/view/vrag
SVFSearch: 一种面向游戏垂直领域的多模态知识密集型短视频帧搜索基准
机构 * Kuaishou Technology(快手科技)
专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出SVFSearch,首个针对中文游戏领域短视频帧搜索的多模态知识密集型基准,通过5000个四选一测试示例和4198个辅助训练示例,评估了从直接问答到计划-行动-重新计划代理等多种方法在短视频帧搜索中的性能。
RS-Claw:通过分层技能树实现渐进式主动工具探索的遥感代理
机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) ; School of Resources and Environment, University of Electronic Science and Technology of China(资源与环境学院,电子科技大学) ; School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(地球科学与空间信息工程学院,湖南科技大学) ; Sanya Institute of Hunan University of Science and Technology(海南科技大学三亚研究院)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
AI总结 本文提出RS-Claw,通过分层技能树实现主动探索,解决遥感代理工具选择中的被动机制问题,提升长周期推理中的工具命中率和上下文空间效率。
SoccerRef-Agents: 多智能体系统用于自动足球裁判
机构 * University of Michigan(密歇根大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态RAG :RAG(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出SoccerRef-Agents多智能体系统,通过构建多模态基准和知识库,提升足球裁判决策的准确性和可解释性。
Comments 26 pages, 8 figures. Submitted to ISACE 2026. Github Repo: https://github.com/yjlog/SoccerRef-Agents
LumiVideo:一种用于视频色彩分级的智能代理系统
机构 * Northwestern University(西北大学) ; Northeastern University(东北大学) ; South China University of Technology(华南理工大学) ; Hong Kong Baptist University(香港浸会大学) ; Beijing Normal - Hong Kong Baptist University(北京师范大学-香港浸会大学)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
AI总结 LumiVideo通过感知、推理、执行和反思四个阶段模仿专业调色师的工作流程,利用LLM和RAG框架实现非线性色彩参数空间导航,生成符合行业标准的色彩配置文件,并支持通过自然语言反馈进行迭代优化。
保险中的AI:适应性问卷以提升风险评估
机构 * Deloitte(德勤) ; Faculty of Engineering, University of Porto(波尔图大学工程学院) ; LIACC, Faculty of Engineering, University of Porto(波尔图大学工程学院人工智能与计算机科学实验室)
专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract);分类 cs.AI
AI总结 本文提出ARQuest框架,利用大语言模型和替代数据源创建个性化适应性问卷,通过社交媒体图像分析等技术提升风险评估的准确性与用户满意度。
Journal ref International Workshop on Agentic Engineering (AGENT 2026)
MRD:多分辨率检索-检测融合用于高分辨率图像理解
机构 * HITSZ(哈尔滨工业大学)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
AI总结 本文提出MRD框架,通过多分辨率语义融合和开放词汇检测提升高分辨率图像理解,实现局部和全局视角的增强,取得单目标和多目标理解任务的最先进性能。
Comments Accepted to CVPR 2026
智能协同设计:一种基于多模态代理的交互式LLM框架用于室内空间设计
机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
AI总结 本文提出一种基于LLM的多模态多代理框架,通过自然语言描述和图像动态生成3D设计,提升用户参与度和设计效率。
Comments 25 pages, 20 figures; accepted for publication in the Proceedings of ACADIA 2025
基于可定位性的自适应推理图像地理定位方法
机构 * The University of Utah(犹他大学) ; The University of Oklahoma(俄克拉荷马大学) ; Worcester Polytechnic Institute(沃斯特理工学院) ; Rensselaer Polytechnic Institute(雷士利理工学院) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
AI总结 本文提出Geo-ADAPT框架,通过优化可定位性评分和两阶段分组相对策略优化,提升图像地理定位的适应性和准确性,减少幻觉。
CMRAG:基于共模的视觉文档检索与问答
机构 * Baidu Inc(百度公司) ; The University of Hong Kong(香港大学) ; Beihang University(北京航空航天大学) ; Peking University(北京大学)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
AI总结 CMRAG通过统一编码模型和共模信息检索方法,提升多模态视觉文档问答系统的性能。
Comments Published at ICLR 2026 Workshop on Multimodal Intelligence
MC-Search:基于结构化长推理链评估和增强多模态代理搜索
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Meta ; IBM Research(IBM研究院) ; Stony Brook University(石溪大学)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
AI总结 MC-Search是首个针对代理MM-RAG的基准,通过结构化长推理链评估和增强多模态代理搜索,揭示了系统性问题并改进了模型的规划和检索能力。
Comments ICLR 2026
一种多模态对话助手,用于从遥感开放数据中表征农业地块
机构 * Dept. AI \& Data Analytics CTIC Technology Center Gijón, Spain ; Dept. IT CTIC Technology Center Gijón, Spain ; Eng. University of Oviedo Gijón, Spain ; Dept. R \& D CTIC Technology Center Gijón, Spain
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
AI总结 本研究提出一种多模态对话助手,通过自然语言交互整合遥感和农业数据,降低专业信息访问门槛,实现农业地块表征。
Comments Accepted at 2025 4th International Conference on Geographic Information and Remote Sensing Technology
Journal ref Proc. Int. Conf. GIRST 2025 (2025) 127-132
多模态同行评审模拟:面向社区意识的论文修订可操作待办推荐系统
机构 * Hong Kong Polytechnic University(香港理工大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Independent Researcher(独立研究者)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
AI总结 本研究提出一个多模态同行评审模拟系统,通过整合文本和视觉信息,利用检索增强生成技术提升评审质量,并生成可操作的待办列表,以提高论文修订的效率和准确性。
Comments Accepted by TheWebConf 2026 Demo Track
RoD-TAL:罗马尼亚驾照考试问答的基准测试
机构 * National University of Science and Technology POLITEHNICA Bucharest, Faculty of Automatic Control and Computers(波兰技术大学布加勒斯特分校) ; Technical University of Munich(慕尼黑技术大学) ; National Institute for Research & Development in Informatics - ICI Bucharest(信息研究所-布加勒斯特) ; Paris 1 Panthéon-Sorbonne University(巴黎1大学) ; University of Bucharest(布加勒斯特大学)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
AI总结 RoD-TAL是一个用于评估大型语言模型和视觉语言模型在罗马尼亚驾照法律问答中性能的多模态基准数据集,通过文本和图像问答任务验证了领域微调和推理优化对考试通过率的影响。
Comments 41 pages, 30 figures, Accepted by the Findings of EACL 2026
RAVENEA:多模态检索增强视觉文化理解的基准
机构 * University of Copenhagen(哥本哈根大学) ; ETH Zürich(苏黎世联邦理工学院) ; University of Amsterdam(阿姆斯特丹大学) ; University of Cambridge(剑桥大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Singapore Management University(新加坡管理大学)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
AI总结 RAVENEA通过多模态检索增强方法提升视觉文化理解,验证了文化注释对多模态检索和下游任务的增强效果,并揭示了不同国家间性能差异。
Comments ICLR 2026; Project page: https://jiaangli.github.io/ravenea/
对法语PDF到Markdown转换的视觉语言模型进行基准测试
机构 * Probayes, La Poste(Probayes公司) ; OpenValue, La Poste(OpenValue公司)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
AI总结 本研究针对法语PDF到Markdown转换,评估了视觉语言模型在处理复杂文档中的表现,发现专有模型在手写和表单处理上更具鲁棒性,而开源系统在标准打印布局上表现良好。
Comments 13 pages, 6 figures
理解并缓解LLM生成的RTL代码错误
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL
AI总结 本文提出基于LLM的框架,通过检索增强生成、规则检查、多模态转换和迭代仿真调试,显著提升了RTL代码生成的准确性。
Comments Accepted by IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems
基于像素的检索用于知识型大型多模态模型
机构 * Meta Reality Labs(Meta现实实验室) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
AI总结 PixSearch是一种端到端的多模态模型,通过像素级检索和统一感知与推理,提升视觉问答任务中的事实一致性与泛化能力。
Comments Preprint
CoSense-LLM:在成本和不确定性意识下实现边缘语义的云边协作
专题命中 多模态RAG :RAG(abstract);hybrid retrieval(abstract);分类 cs.CL
AI总结 CoSense-LLM通过边缘优先设计,在成本和不确定性意识下实现云边协作,以提供紧凑的语义标记和隐私保护。
Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation
基于多智能体架构的智能AI眼镜系统:用于实时语音处理与任务执行
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
AI总结 本文提出一种基于多智能体架构的AI眼镜系统,实现实时语音处理与多语言任务执行。
Comments Published in NCS 2025 (Paper No. N0180)
ArtCognition:一种多模态AI框架,用于从视觉和运动学绘画线索中感知情绪状态
机构 * Department of Electrical and Computer Engineering, University of Tehran(电信工程系,德黑兰理工大学) ; Tehran Institute for Advanced Studies, Khatam University(德黑兰高级研究院,凯塔姆大学) ; Department of Psychology, Allameh Tabataba’i University(心理学系,阿勒梅·塔巴塔比大学)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR
AI总结 ArtCognition通过融合视觉和运动学绘画线索,提供非侵入性情绪状态评估的新方法,验证了其在心理测量中的潜力。
Comments 12 pages, 7 figures
Yuan3.0 Flash:面向企业应用的开源多模态大语言模型
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
AI总结 Yuan3.0 Flash通过RAPO算法提升企业任务性能,实现高效多模态大语言模型开源
NEURO-GUARD:神经符号泛化与无偏自适应路由用于诊断——可解释的医疗AI
机构 * Arizona State University(亚利桑那州立大学)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI
AI总结 NEURO-GUARD通过整合视觉变换器与语言驱动推理,提升医疗图像诊断的准确性、透明性和泛化能力。
Comments Accepted at Asilomar Conference
ModernVBERT: 向更小的视觉文档检索器迈进
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR
AI总结 ModernVBERT通过优化视觉文档检索模型,实现了在文档检索任务中性能优于更大模型的高效轻量级模型。