arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-08 至 2025-12-08 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 3 篇

2512.04563 2025-12-08 cs.CV 70%

COOPER: A Unified Model for Cooperative Perception and Reasoning in Spatial Intelligence

COOPER:一种用于空间智能中协作感知与推理的统一模型

Zefeng Zhang, Xiangzhao Hao, Hengzhu Tang, Zhenyu Zhang, Jiawei Sheng, Xiaodong Li, Zhenyang Li, Li Gao, Daiting Shi, Dawei Yin, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Baidu Inc.(百度公司)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 COOPER是一种统一的多模态大语言模型,通过整合深度和分割等辅助模态,提升空间感知与推理能力,实现空间智能的增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05965 2025-12-08 cs.CV 57%

EditThinker: Unlocking Iterative Reasoning for Any Image Editor

EditThinker: 解锁任何图像编辑器的迭代推理

Hongyu Li, Manyuan Zhang, Dian Zheng, Ziyu Guo, Yimeng Jia, Kaituo Feng, Hao Yu, Yexin Liu, Yan Feng, Peng Pei, Xunliang Cai, Linjiang Huang, Hongsheng Li, Si Liu

机构 * Beihang University(北航大学) Meituan(美团) CUHK MMLab CUHK IMIXR Tsinghua University(清华大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 EditThinker通过迭代推理框架提升图像编辑指令遵循能力,利用强化学习优化编辑过程,显著提高模型性能。

Comments Project page: https://appletea233.github.io/think-while-edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06211 2025-12-08 cs.CV 57%

iMotion-LLM: Instruction-Conditioned Trajectory Generation

iMotion-LLM:基于指令的轨迹生成

Abdulwahab Felemban, Nussair Hroub, Jian Ding, Eslam Abdelrahman, Xiaoqian Shen, Abduallah Mohamed, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology (KAUST)(卡塔尔国王阿卜杜勒阿齐兹大学科学与技术学院) Meta Reality Labs(Meta现实实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 iMotion-LLM通过结合预训练LLM与轨迹预测模块,实现基于文本指令的交互式运动生成,提升自动驾驶中的轨迹生成准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏