ORIGEN: Zero-Shot 3D Orientation Grounding in Text-to-Image Generation
机构 * KAIST(韩国科学技术院)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG
Comments Project Page: https://origen2025.github.io
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * KAIST(韩国科学技术院)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG
Comments Project Page: https://origen2025.github.io
机构 * The University of Hong Kong(香港大学) ; Salesforce AI Research(Salesforce AI研究院)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI
Comments 49 pages, 13 figures
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; University of Trento(特伦托大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV
机构 * University of Siena(锡耶纳大学) ; Scuola Normale Superiore(正规大学) ; KU Leuven(卢森堡大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI
Journal ref Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence (IJCAI-25), pp. 4806-4814, 2025
机构 * The University of Tokyo(东京大学) ; RIKEN AIP(理化学研究所AIP) ; Waseda University(早稻田大学) ; Wuhan University(武汉大学) ; Stanford University(斯坦福大学)
专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * Southeast University(东南大学) ; Monash University(墨尔本大学) ; Xiaohongshu Inc.(小红书公司) ; University of Southern California(南加州大学) ; Fudan University(复旦大学)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * Department of Computer Science(计算机科学系) ; Delft University of Technology(代尔夫特理工大学) ; LatentWorlds AI ; National Policelab AI & Model-Driven Decisions Lab(国家警务实验室AI与模型驱动决策实验室)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Accepted as poster in the NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted as a Spotlight Paper at NeurIPS 2025
机构 * Shandong University(山东大学) ; National University of Singapore(新加坡国立大学) ; Kuaishou Technology(快手科技) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Preprint
机构 * Xinjiang University(新疆大学) ; Xi'an Jiaotong University(西安交通大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by ACM MM 2025
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California Los Angeles(加州大学洛杉矶分校)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
Comments NeurIPS 2025 Spotlight; project page: https://wjdghks950.github.io/partonomy.github.io/
机构 * Obvious Research(Obvious研究)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Technical report after open-source release
机构 * Institute of New Media and Communications(新媒体与通讯研究所) ; Dept. of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
Comments Accepted to FM4RoboPlan workshop at RSS 2025
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
机构 * Zhejiang University(浙江大学) ; School of Engineering, Westlake University(西湖大学工程学院) ; Peking University(北京大学) ; Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖先进研究院技术研究所)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
Comments Preprint version
机构 * School of Computer Science, University of South China(南方大学计算机科学学院) ; New Laboratory of Pattern Recognition, MAIS, CASIA(模式识别新实验室,MAIS,CASIA) ; School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) ; Department of Computer Science and Engineering, University of California, Merced(加州大学默塞德分校计算机科学与工程系) ; Department of Computer Science and Engineering, Yonsei University(延世大学计算机科学与工程系)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
Comments Accepted by TPAMI
专题命中 文档图表理解 :vision-language model(title);vision language model(abstract)
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 GUI与屏幕智能体 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments 12 pages, 10 figures, under review
机构 * DRAGON Lab at Department of Mechanical Engineering, The University of Tokyo(东京大学机械工程系DRAGON实验室)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments 18 pages, 10 figures
Journal ref Advanced Intelligent Systems, Oct. 2025
机构 * Xiaomi Inc(小米公司)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted at NeurIPS 2025
机构 * Division of Information Science, NAIST(NAIST信息科学系) ; Guardian Robot Project, RIKEN(RIKEN守护机器人项目)
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to IROS2025
机构 * Institute of Science Tokyo(东京科学研究所) ; RIKEN AIP(日本科学技术研究所AIP)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
Comments ICCV 2025 Poster
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学) ; Southeast University(东南大学) ; Ant Group, Alibaba(蚂蚁集团)
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Evaluating the Evolving LLM Lifecycle - Benchmarks, Emergent Abilities, and Scaling
机构 * School of Physical and Mathematical Sciences, Nanyang Technological University(南洋理工大学物理与数学科学学院) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) ; Agency for Science, Technology and Research(科技研究局) ; School of Information Technology(信息技术学院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.CV
Comments NeurIPS 2025
专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.AI、cs.LG
Journal ref IEEE Transactions on Information Forensics and Security (Volume: 20), 2025
机构 * AIMI Center Stanford University(AIMI中心 斯坦福大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI