"Is this an example image?" -- Predicting the Relative Abstractness Level of Image and Text
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 14 pages, 6 figures, accepted at ECIR2019
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 14 pages, 6 figures, accepted at ECIR2019
减轻技术人员的检索负担:面向赛斯纳172维护手册的多模态检索增强生成
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 本研究针对赛斯纳172维护手册,开发多模态检索增强生成流程,其多模态手册检索器召回率达93.37%,生成响应与基准答案语义相似度87.20%,可减轻技术人员检索负担。
Netflix 中通过多模态嵌入实现多媒体资产个性化
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 Netflix 采用多模态嵌入技术,通过双塔模型结合 CLIP 嵌入、三模态基础模型 MediaFM 及离线代理任务,优化了美术图像和视频预览的个性化推荐,提升了冷启动性能与效果。
CompCPZ:在语言引导的机器人操作中保留多模态意图
机构 * School of Computation, Information and Technology(计算、信息与技术学院) ; Technical University of Munich(慕尼黑工业大学)
专题命中 图文多模态 :multi-modal(title,abstract)
AI总结 CompCPZ是一种用于语言引导机器人操作的代数层,可恢复多模态析取表示,在ManiSkill3基准测试中性能优于多种基线,且能迁移至真实机器人实验,凸显组合语言接地需评估意图连通分量结构。
《狼来了:多模态安全护栏中安全输入被对抗性误分类为不安全》
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 该研究针对多模态安全护栏提出不安全诱导攻击,通过不安全语义蒸馏实现84%攻击成功率,揭示了当前多模态安全架构存在安全输入被误判为不安全的可用性漏洞。
Comments Accepted by KDD 2026
PhenoNEST:用于本体感知多模态植物表型分析和性状发现的神经符号框架
机构 * Centre of Studies in Resources Engineering (CSRE)(资源工程研究中心) ; Indian Institute of Technology Bombay(孟买印度理工学院)
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 提出构建多模态粒状知识图谱框架,以弥合语义鸿沟,通过蒸馏野外记录提取实体和关系,结合模型与本体对齐,经视觉语言模型生成软图,引入节点连接多模态子图,成功映射野外观察,助力小麦育种。
我在哪里?基于视觉-语言模型的语义地图定位用于多模态定位
机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校)
专题命中 图文多模态 :multi-modal(title);cross-modal(abstract)
AI总结 将机器人定位重构为语义推理任务,使用微调的Qwen2.5-VL-7B模型融合摄像头、LiDAR和语义地图预测位姿,在室内数据集上达到98.23%位置精度,并展现出跨模态互补性和对新场景的泛化能力。
MemVenom:网络代理中多模态记忆的触发式投毒
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室) ; Tianjin University(天津大学) ; Shenzhen International Graduate School, Tsinghua University(深圳国际研究生学院,清华大学) ; Huawei Technologies Ltd.(华为技术有限公司)
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 提出MemVenom框架,针对网络代理的外部记忆系统,通过触发条件检索和攻击诱导,实现黑盒多模态记忆投毒,达到高成功率且不影响良性性能。
Comments Preprint. 27 pages, 6 figures, 6 tables
多模态大语言模型赋能的HAP下行链路鲁棒波束成形
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 本文提出基于多模态大语言模型的波束成形框架,通过飞行 telemetry 预测HAP姿态并实现鲁棒下行通信,提升用户服务比和总速率22.1%和12.5%。
CAMD:面向多模态大语言模型高效推理的覆盖感知多模态解码
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 本文提出CAMD,通过动态分配计算资源提升多模态大语言模型的推理效率与可靠性,解决解码方法在易例和难例间的计算不匹配问题。
多模态行为树生成:一种小型视觉-语言模型用于机器人任务规划
机构 * Department of Electronics, Information, and Bioengineering, Politecnico di Milano(电子信息与生物工程系,米兰理工学院)
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 本文提出一种小型视觉-语言模型,通过生成行为树提升机器人任务规划效率,实验证明其在性能和资源消耗上均优于现有闭源模型。
GeMi:基于图的多模态推荐系统用于叙事卷轴绘画
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 GeMi是一种基于图的多模态推荐系统,专门用于叙事卷轴绘画,结合多模态内容和用户偏好,为艺术保护和数据存储提供解决方案。
机器人选择性感知:多模态VLA中的任务感知注意力
机构 * Dongguk University(东国大学)
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 本文提出了一种动态信息融合框架,通过任务感知注意力提升机器人多模态VLA模型的效率与鲁棒性。
RAPTOR-AI用于灾难OODA循环:基于经验驱动的多模态RAG框架
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 RAPTOR-AI通过分层多模态RAG框架,结合经验驱动的代理控制和LoRA适应,提升灾害响应中的检索精度、情境基础性和任务分解准确性。
Comments 8 pages, 3 figures, 2 tables
整合APK图像和文本数据以增强威胁检测:一种多模态深度学习方法用于Android恶意软件
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 本文提出一种多模态深度学习方法,通过整合APK图像和文本数据提升Android恶意软件检测效果,系统评估不同图像类型和分辨率,并利用CLIP模型增强分析能力。
数字收藏探索器:一种开源的多模态查看器,用于搜索数字收藏
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 Digital Collections Explorer是一种开源多模态查看器,利用CLIP技术提升数字收藏的视觉搜索能力,并通过案例研究展示其在文化遗产档案中的应用。
Comments 14 pages, 8 figures, 2 tables
Journal ref Comput. humanit. res. 1 (2025) e14
基于偏好强化学习的多模态反馈与轨迹合成:从基础模型出发
机构 * Purdue University(普渡大学) ; Beijing University of Chemical Technology(北京化工大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Sungkyunkwan University(成均馆大学) ; Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 图文多模态 :multimodal(title,abstract)
AI总结 PRIMT通过多模态反馈和轨迹合成,利用基础模型解决偏好强化学习中的查询模糊性和信用分配问题,提升机器人复杂行为的学习效率。
基于分层多模态场景图的视觉语言导航:快速与慢速推理
机构 * Horizon Robotics ; D-Robotics Robotics
专题命中 图文多模态 :multi-modal(title,abstract)
AI总结 FSR-VLN通过分层多模态场景图与快速-慢速推理机制,提升视觉语言导航的效率与准确性,实现低延迟高成功率的导航性能。
Comments Demo video are available at https://horizonrobotics.github.io/robot_lab/fsr-vln/
专题命中 图文多模态 :multimodal(title,abstract)
专题命中 图文多模态 :multimodal(title,abstract)
Comments Accepted for presentation at CORL 2025. Code, models, and data are available at https://search-tta.github.io/
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL、cs.AI
Comments First Peer Reviewed Review Paper for Object Detection with Vision-Language Models (VLMs)
Journal ref Information Fusion, 2025
机构 * University of Padova(帕多瓦大学) ; Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Örebro University(奥雷布罗大学) ; NVIDIA Research(NVIDIA研究)
专题命中 图文多模态 :multimodal(title,abstract)
Comments Project page: https://j-dapt.github.io/. 9 pages, 6 figures
专题命中 图文多模态 :omni-modal(title,abstract)
Comments 9 pages, 7 figures, 6 tables
机构 * TMCC, College of Computer Science, Nankai University, Tianjin, China(TMCC,计算机科学学院,南开大学,天津,中国) ; Alibaba International Digital Commerce(阿里巴巴国际数字商务) ; University of Exeter(埃克塞特大学)
专题命中 图文多模态 :multimodal(title,abstract)
专题命中 图文多模态 :multimodal(title,abstract)
Comments 30 pages, 4 figures, 2 tables, includes supplementary information (with additional 21 pages, 9 figures, 1 table)
Journal ref ACS Appl. Mater. Interfaces 15, 22692-22704 (2023)
机构 * Computer Engineering, Texas A\&M University, College Station, TX 77843, USA ; College of Science ; Engineering, Hamad Bin Khalifa University, Doha, Qatar ; Dept. of Electrical \& Computer Engineering, Texas A\&M University at Qatar, Doha, Qatar ; Orthotics, Ankara University, Ankara, Turkey
专题命中 图文多模态 :multimodal(title,abstract)
Comments Presented at ICML 2025 Workshop on DataWorld
专题命中 图文多模态 :multimodal(title,abstract)
专题命中 图文多模态 :multimodal(title,abstract)
Comments 9 pages, 14 figures and 3 tables
专题命中 图文多模态 :multimodal(title,abstract)
Comments ICLR 2025
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL、cs.AI
Comments 19 pages