GPT-4V(ision) is a Generalist Web Agent, if Grounded
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by ICLR 2024
专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project page: https://vis-www.cs.umass.edu/multiply
专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract)
Comments 19 pages, 6 figures; matches version published in Universe
Journal ref Universe 10 (2024), 11
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM
Comments Accepted at ACM Multimedia'23 Open-Source Software Competition Track
专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 32 pages, 10 figures, 24 tables. Accepted to NeurIPS 2023
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Extended Abstract accepted to the 32nd International Joint Conference on Artificial Intelligence (IJCAI 2023); special journal track for authors of published JAIR 2022 and AIJ 2022 papers. 6 pages, 2 figures. arXiv admin note: substantial text overlap with arXiv:2106.13948
专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Outstanding Paper Award at NeurIPS 2022. Project website: https://minedojo.org
专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to CVPR 2022
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Journal of Artificial Intelligence Research 74 (2022) 459-515
专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted at Novel Ideas in Learning-to-Learn through Interaction (NILLI) workshop @ EMNLP 2021
专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Conference on Robot Learning (CoRL) 2019
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(虎盘实验室) ; Zhejiang University(浙江大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI;MLLM(comments)
Comments The technical report of RynnEC, an embodied cognition MLLM
一种用于主动数据收集、出行行为建模及天气敏感需求预测的智能体方法
机构 * McGill University(麦吉尔大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出三智能体工作流,结合对话式调查、传统建模与多模态LLM预测,基于学生通勤数据实现天气敏感出行需求预测,视觉配置模型准确率达71.5%
结合大语言模型常识推理能力的多智能体协同框架用于自动驾驶
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 该研究针对自动驾驶中强化学习等方法的上下文推理缺陷,提出结合LLM常识推理的混合多智能体协同框架,经CARLA场景验证可保留结构化控制与安全机制,具备应用潜力。
Comments 17 pages, 7 figures
每幅画都讲述一个危险的故事:基于内存增强的多智能体 jailbreak 攻击 VLMs
机构 * Wuhan University(武汉大学) ; Zhongguancun Academy(中关村学院) ; Tianjin University(天津大学) ; University of the Chinese Academy of Sciences(中国科学院大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI、cs.MM
AI总结 本文提出MemJack框架,通过视觉语义引导多智能体协作,利用迭代空域投影过滤器提升对VLMs的攻击成功率,实验表明其在COCO数据集上达到71.48%的攻击成功率。
Comments This work was accepted by WISE2026. 15 pages, 2 figures
Co-RL:多智能体强化学习中多样群体涌现的无监督推理
机构 * University of Exeter(埃克塞特大学) ; ByteDance(字节跳动) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; UC San Diego(加州大学圣迭戈分校)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出Co-RL框架,通过参数不共享的多智能体协作训练,利用同伴奖励减少对真实标注的依赖,提升纯文本及多模态任务的推理性能,缓解训练崩溃与响应同质化问题。
Comments 30 pages, 5 figures, 11 tables
教学与成长:面向通用机器人学习的智能体中心架构
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出TGL智能体中心架构,通过将演示转化为可复用技能块,无需特定任务再训练即可实现通用机器人学习,在LIBERO评估中达SOTA性能,还提出相关缩放定律假设。
通过记忆增强的规划和前瞻性构建视觉导航的统一世界模型
机构 * University of Washington(华盛顿大学) ; National University of Singapore(新加坡国立大学) ; Apple(苹果公司) ; Microsoft Research(微软研究院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出UniWM,一种整合视觉前瞻性与规划的统一世界模型,通过记忆机制提升导航鲁棒性和泛化能力,在多个基准测试中显著提升导航成功率。
Comments Accepted to ECCV 2026. 22 pages, 12 figures, code: https://github.com/UWMILab/UniWM
UI-Mate:利用上下文内演示推进开放权重基础图形用户界面智能体
机构 * Tencent Hy Frontier Team(腾讯 Hy 前沿团队)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 UI-Mate是集成环境基训练栈与上下文内演示学习的GUI智能体,在多计算机使用基准上创开放权重SOTA,提升了长周期办公任务的执行可靠性
Comments UI-Mate Technical Report. Project page: https://ui-mate.github.io
OpenVisTool:用于合成具有指导性的视觉工具使用轨迹的开源方案
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本研究提出OpenVisTool框架,构建含因果监督的视觉工具使用轨迹数据集OpenVisTool-42K,微调后模型视觉工具使用性能提升,大模型接近领先闭源系统。
ToolVision:通过能力对齐监督学习何时以及如何使用视觉工具
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对多模态模型工具使用监督错位问题,提出ToolVision方法,通过能力对齐的SFT与RL监督优化工具使用学习,在多个视觉基准上实现性能提升并将公开发布相关资源。
Comments 18 pages, 13 figures
VTO:面向视频异常检测的可视化工具编排
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; School of Digital Media & Design Art(数字媒体与设计艺术学院)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对视频异常检测中传统方法泛化差、多模态智能体工具编排难的问题,提出过程监督强化学习框架VTO,结合VAD-Tool工具集,在工具调度上较基线提升10.2%。
Comments Accepted by ACM MM 2026
STEMMA:用于评估大语言模型(LLM)自我身份一致性的对抗性多智能体框架
专题命中 多模态Agent :multi-modal(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对LLM自我身份一致性评估问题,提出对抗性多智能体框架STEMMA,结合手动设计的对抗性提示开展实验,发现多数LLM存在自我表征不一致的问题。
Comments 15 pages
OpenForgeRL:在任何环境中训练原生利用工具的智能体
机构 * Columbia University(哥伦比亚大学) ; Dartmouth College(达特茅斯学院) ; Microsoft Research(微软研究院)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 研究针对现代AI智能体依赖复杂推理工具难端到端训练的问题,提出OpenForgeRL框架,通过轻量级代理和Kubernetes编排器,在多环境下对基于工具的智能体端到端训练,验证了框架效果并分析了工具选择和RL对智能体行为的影响。
Comments added github link
通过模态差距感知自蒸馏从符号状态学习视觉空间规划
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出MGSD两阶段框架,通过冷启动接地和特权教师蒸馏弥合视觉与符号规划之间的模态差距,在视觉规划基准上显著提升性能。
Comments 18 pages, preprint
Kimi K2.5:视觉代理智能
机构 * Kimi Team(Kimi 团队)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 Kimi K2.5通过联合优化文本和视觉模态,提出Agent Swarm框架,实现多模态代理智能的先进性能和高效任务处理。
Comments Kimi K2.5 tech report
OneDayAgent:面向自主智能体的长程管控框架
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 OneDayAgent是一种长程管控框架,可将开放式请求分解为子任务,在不同后端LLMs上实现最优性能,解决智能体的多类失效模式。
Comments Ongoing work
SVRepair: 结构化视觉推理用于自动化程序修复
机构 * Ant Group(蚂蚁集团) ; Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems(浙江可感知智能系统重点实验室)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 SVRepair 通过结构化视觉表示框架,结合多模态信息提升程序修复的准确性与效率。