Bias in Multimodal AI: Testbed for Fair Automatic Recruitment
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
Journal ref IEEE CVPR Workshop on Fair, Data Efficient and Trusted Computer Vision, Washington, Seattle, USA, 2020
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
Journal ref IEEE CVPR Workshop on Fair, Data Efficient and Trusted Computer Vision, Washington, Seattle, USA, 2020
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL
Comments 8 pages, 9 figures
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
Comments First two authors contributed equally; International Conference on Automated Planning and Scheduling (ICAPS) 2020
专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI
Comments Extended Abstract for the IROS 2019 Workshop on Deep Probabilistic Generative Models for Cognitive Architecture in Robotics
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
Comments Advances in Cognitive Systems Cognitive Vision Workshop (2019), 8 pages, 5 figures
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
Comments 20 pages, 5 figures, 5 tables; Under Review
专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV
Comments ICRA Workshop on Long Term Human Motion Prediction (extended abstract)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
Journal ref Remote Sensing of Environment, 228, pages 129 - 143, 2019
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
Comments 8 pages, 8 figures, Accepted to Intelligent Vehicles (IV) Symposium 2019
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
Journal ref 1st Workshop on "Behavior, Emotion and Representation: Building Blocks of Interaction'', Oct 2017, Bielefeld, Germany. 2017
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV
Comments To Appear in 2014 IEEE Conference on Computer Vision and Pattern Recognition (CVPR 2014)
Journal ref CVPR 2014, pp. 4114 - 4121
基于离线大语言模型的机械臂多模态交互控制
机构 * University of Tokyo(东京大学)
专题命中 多模态Agent :multi-modal(title,abstract);multimodal(comments)
AI总结 该研究提出“Socratic Models-ChatGLM”算法,基于离线开源大语言模型与PyBullet平台实现机械臂多模态交互控制,可降低成本并解决复杂多步骤机械操作任务。
Comments This research work has been accepted for poster presentation at ICRA 2026 MEI (Multimodal Embodied Interaction in Robots) Workshop. (Here is the workshop-version short paper.)
Journal ref https://ieeexplore.ieee.org/abstract/document/11371765; 2025
大规模多模态工作流程用于电池表征:从概念到实现
专题命中 多模态Agent :multi-modal(title,comments);multimodal(abstract)
AI总结 本文提出了一种大规模多模态工作流程,用于电池表征,通过整合多种技术分析电极材料的演变和电解质成分的影响,展示了标准化流程和多属性元视图的应用。
Comments 32 pages, 6 figures, research article, keywords: Battery, Workflow, Experimental characterization, Multi-modal, Large scale, Correlation, Aging
机构 * Honda Research Institute, USA(本田研究院(美国)) ; Department of Mechanical Engineering, University of California Riverside(加州大学河滨分校机械工程系)
专题命中 多模态Agent :multimodal(title,abstract)
Comments To appear at IROS '25. 8 pages. 3 tables. 6 figures. Project page: https://darshangm.github.io/papers/active-probing-multimodal-predictions/
专题命中 多模态Agent :multimodal(title,abstract)
Comments 8 pages, accepted for publication and presentation at 2023 25th ACM International Conference on Multimodal Interaction (ICMI)
IQA-T1:基于工具的图像质量评估视觉证据推理
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对开放世界图像质量评估难题,提出IQA-T1框架,通过自主调用工具生成视觉证据增强多模态大语言模型推理,构建Q-Tool数据集,实验表明该框架性能最佳且评估可解释、基于证据。
Comments Accepted by ECCV 2026
科大讯飞-具身全能技术报告
机构 * iFLYTEK ; LindenBot ; University of Science and Technology of China(中国科学技术大学)
专题命中 多模态Agent :multimodal(abstract);image-text(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI
AI总结 研究通用具身智能体,提出统一多模态基础模型iFLYTEK-Embodied-Omni,通过共享多模态自注意力联合建模视觉、语言和动作,结合多种数据构建数据集并采用四阶段策略训练,实现脑-小脑协作。
通过通用关键帧提取桥接VideoQA和视频引导的智能体任务
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出VG-GUIBench基准和TASKER关键帧提取算法,联合考虑任务相关性和场景动态,在VideoQA和视频引导的GUI任务上提升性能。
Comments Accepted by ECCV 2026. Project Page: https://vg-gui-tasker.github.io/
感知、判断与进化:基于事后洞察的自优化取证智能体用于AI生成图像检测
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出ForeAgent框架,采用感知-判断架构融合多视图线索,并引入事后洞察驱动的自优化策略,通过采样-反思-进化范式持续提升检测能力,在多个基准上达到最优性能。
Comments 10 pages
MIRAGE: 针对Web代理的隐蔽视觉提示注入漏洞检测
机构 * SDU(山东大学)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出MIRAGE框架,利用扩散模型在受限区域生成视觉上无害的对抗图像,实现针对多模态大模型Web代理的隐蔽间接提示注入攻击,以检测其视觉漏洞。
MUSE: 多模态大语言模型的统一智能体框架
机构 * Northeastern University(东北大学)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出MUSE框架,通过可组合模块(任务表示、视觉处理、感知工具、结构化解析、确定性验证和验证器引导修复)提升冻结多模态大语言模型性能,无需重新训练。
PInVerify:面向主动实例验证的离线具身基准
机构 * University of Trento(特伦托大学)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出主动实例验证任务,构建离线具身基准PInVerify,通过多视角导航和细粒度属性匹配评估具身智能体,并基于多模态大语言模型建立基线。
Comments Accepted as a poster at the Foundation Models Meet Embodied Agents (FMEA) Workshop, CVPR 2026. 44 pages including appendix. Code: https://github.com/Avalon-S/PInVerify
RSAgent: 通过多轮工具调用学习推理与行动进行文本引导的分割
机构 * Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University(上海智能信息处理关键实验室,计算机科学与人工智能学院,复旦大学) ; Artificial Intelligence, Fudan University(人工智能,复旦大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 RSAgent通过多轮工具调用实现文本引导分割的推理与行动,采用两阶段框架提升分割性能,达到领域内和领域外基准的最先进水平。