arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4513 篇

2509.04744 2026-01-26 cs.SD cs.CL eess.AS 50%

WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning

WildScore: 多模态符号音乐推理在现实中的基准测试

Gagan Mundada, Yash Vishe, Amit Namburi, Xin Xu, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 WildScore是首个用于评估多模态大语言模型在现实世界中符号音乐推理能力的基准测试,通过真实音乐作品和用户生成问题,系统性评估模型在音乐学分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15129 2026-01-22 cs.CL 50%

RSNA Large Language Model Benchmark Dataset for Chest Radiographs of Cardiothoracic Disease: Radiologist Evaluation and Validation Enhanced by AI Labels (REVEAL-CXR)

用于心胸疾病胸部X光影像的RSNA大语言模型基准数据集:通过AI标签增强的放射科评估和验证(REVEAL-CXR)

Yishu Wei, Adam E. Flanders, Errol Colak, John Mongan, Luciano M Prevedello, Po-Hao Chen, Henrique Min Ho Lee, Gilberto Szarf, Hamilton Shoji, Jason Sho, Katherine Andriole, Tessa Cook, Lisa C. Adams, Linda C. Chu, Maggie Chung, Geraldine Brusca-Augello, Djeven P. Deva, Navneet Singh, Felipe Sanchez Tijmes, Jeffrey B. Alpert, Elsie T. Nguyen, Drew A. Torigian, Kate Hanneman, Lauren K Groner, Alexander Phan, Ali Islam, Matias F. Callejas, Gustavo Borges da Silva Teles, Faisal Jamal, Maryam Vazirabad, Ali Tejani, Hari Trivedi, Paulo Kuriki, Rajesh Bhayana, Elana T. Benishay, Yi Lin, Yifan Peng, George Shih

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本研究通过AI辅助标注流程,创建了包含200张胸部影像的基准数据集,用于评估不同模型,同时帮助放射科医生更高效地标注影像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14352 2026-01-22 cs.RO 50%

RoboBrain 2.5: Depth in Sight, Time in Mind

RoboBrain 2.5:视觉深度,思维时间

Huajie Tan, Enshen Zhou, Zhiyu Li, Yijie Xu, Yuheng Ji, Xiansheng Chen, Cheng Chi, Pengwei Wang, Huizhu Jia, Yulong Ao, Mingyu Cao, Sixiang Chen, Zhe Li, Mengzhen Liu, Zixiao Wang, Shanyu Rong, Yaoxu Lyu, Zhongxia Zhao, Peterson Co, Yibo Li, Yi Han, Shaoxuan Xie, Guocai Yao, Songjing Wang, Leiduo Zhang, Xi Yang, Yance Jiao, Donghai Shi, Kunchang Xie, Shaokai Nie, Chunlei Men, Yonghua Lin, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * BAAI RoboBrain Team(百度人工智能研究院RoboBrain团队)

专题命中 视觉推理 :grounding(abstract)

AI总结 RoboBrain 2.5通过提升3D空间推理和时间值估计,增强具身智能在复杂精细操作中的物理基础和执行感知能力。

Comments 37 pages, 13 figures, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11525 2026-01-21 cs.HC 50%

PlotGen-Bench: Evaluating VLMs on Generating Visualization Code from Diverse Plots across Multiple Libraries

PlotGen-Bench: 评估VLMs在从多样化图表生成可视化代码的能力 across 多个库

Yi Zhao, Zhen Yang, Shuaiqi Duan, Wenmeng Yu, Zhe Su, Jibing Gong, Jie Tang

专题命中 视觉推理 :vision-language model(abstract)

AI总结 PlotGen-Bench评估VLMs在多库场景下生成可视化代码的能力,发现开源模型在视觉和语义一致性上表现欠佳,需进一步提升。

Comments 30 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10455 2026-01-16 cs.CL cs.RO 50%

SurgGoal: Rethinking Surgical Planning Evaluation via Goal-Satisfiability

SurgGoal: 重新思考手术计划评估 via 目标满足性

Ruochen Li, Kun Yuan, Yufei Xia, Yue Zhou, Qingyu Lu, Weihang Li, Youxiang Zhu, Nassir Navab

机构 * Technical University of Munich, Germany(慕尼黑技术大学) University of Strasbourg, France(斯特拉斯堡大学) University of Glasgow, United Kingdom(格拉斯哥大学) Nanyang Technological University, Singapore(南洋理工大学) University of Massachusetts Boston, USA(马萨诸塞大学波士顿分校)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 SurgGoal通过目标满足性度量重新评估手术计划,揭示视频大语言模型在安全关键环境中的性能问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09562 2026-01-16 cs.IR 50%

MM-BRIGHT: A Multi-Task Multimodal Benchmark for Reasoning-Intensive Retrieval

MM-BRIGHT: 一种多任务多模态基准用于推理密集型检索

Abdelrahman Abdallah, Mohamed Darwish Mounis, Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Mostafa Farouk Senussi, Mohamed Mahmoud, Mohammed Ali, Adam Jatowt, Hyun-Soo Kang

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 MM-BRIGHT是首个用于推理密集型检索的多模态基准,通过29个技术领域中的2,803个现实世界查询,评估了多模态检索模型在文本到文本、多模态到文本等任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09523 2026-01-15 cs.IR 50%

TEMPO: A Realistic Multi-Domain Benchmark for Temporal Reasoning-Intensive Retrieval

TEMPO:一个用于时间推理密集检索的多领域基准

Abdelrahman Abdallah, Mohammed Ali, Muhammad Abdul-Mageed, Adam Jatowt

专题命中 视觉推理 :grounding(abstract)

AI总结 TEMPO是一个结合时间推理与多领域检索的基准,通过复杂查询和多步骤检索规划,评估检索系统在时间信息处理上的挑战和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08739 2026-01-14 cs.CL 50%

PrivGemo: Privacy-Preserving Dual-Tower Graph Retrieval for Empowering LLM Reasoning with Memory Augmentation

PrivGemo: 保护隐私的双塔图检索用于增强LLM推理的记忆增强

Xingyu Tan, Xiaoyang Wang, Qing Liu, Xiwei Xu, Xin Yuan, Liming Zhu, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Data61, CSIRO(Data61,CSIRO)

专题命中 视觉推理 :grounding(abstract)

AI总结 PrivGemo通过双塔设计和隐私保护机制,实现隐私保护的图检索增强推理,提升LLM在知识密集型任务中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06848 2026-01-13 cs.CL 50%

Explainable Multimodal Aspect-Based Sentiment Analysis with Dependency-guided Large Language Model

可解释的多模态基于方面的情感分析与依赖引导的大语言模型

Zhongzheng Wang, Yuanhe Tian, Hongzhi Wang, Yan Song

机构 * Harbin Institute of Technology(哈尔滨工程大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本文提出了一种基于依赖引导的大语言模型的多模态情感分析方法,通过生成可解释的自然语言解释来提升情感分类的准确性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05336 2026-01-12 cs.RO 50%

Intent at a Glance: Gaze-Guided Robotic Manipulation via Foundation Models

意图一目了然:通过基础模型实现的注视引导的机器人操作

Tracey Yee Hsin Tay, Xu Yan, Jonathan Ouyang, Daniel Wu, William Jiang, Jonathan Kao, Yuchen Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 GAMMA通过结合基础模型和注视技术,实现无需特定任务训练的机器人操作自主控制,提升人机交互的直观性和可扩展性。

Comments Accepted to 2025 RSS Robot Planning in the Era of Foundation Models (FM4RoboPlan) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00388 2026-01-06 cs.CL 50%

Vision-Language Reasoning for Geolocalization: A Reinforcement Learning Approach

基于视觉-语言推理的地理定位:一种强化学习方法

Biao Wu, Meng Fang, Ling Chen, Ke Xu, Tao Cheng, Jun Wang

专题命中 视觉推理 :vision-language model(abstract)

AI总结 本文提出Geo-R,一种基于强化学习的无检索地理定位框架,通过链式区域生成可解释的监督,提升定位准确性与可解释性。

Comments Accepted to AAAI 2026. Project Page: https://github.com/aialt/geo-r

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24133 2026-01-06 physics.chem-ph physics.comp-ph physics.data-an 50%

Bridging Visual Intuition and Chemical Expertise: An Autonomous Analysis Framework for Nonadiabatic Dynamics Simulations via Mentor-Engineer-Student Collaboration

弥合视觉直觉与化学专业性:通过导师-工程师-学生协作的自主分析框架实现非绝热动力学模拟分析

Yifei Zhu, Jiahui Zhang, Binni Huang, Zhenggang Lan

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 VisU通过导师-工程师-学生协作框架,实现非绝热动力学模拟分析的自动化,减少人工依赖,提升机理发现的直观性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01618 2026-01-06 cs.RO 50%

Action-Sketcher: From Reasoning to Action via Visual Sketches for Long-Horizon Robotic Manipulation

动作草图生成器:通过视觉草图实现从推理到动作的长周期机器人操作

Huajie Tan, Peterson Co, Yijie Xu, Shanyu Rong, Yuheng Ji, Cheng Chi, Xiansheng Chen, Qiongyu Zhang, Zhongxia Zhao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(1 多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Academy of Artificial Intelligence(2 北京人工智能研究院) University of Sydney(3 新南威尔士大学) Institute of Automation, Chinese Academy of Sciences(4 中国科学院自动化研究所)

专题命中 视觉推理 :grounding(abstract)

AI总结 动作草图生成器通过视觉草图实现从推理到动作的长周期机器人操作,结合视觉-语言-动作框架提升任务执行的鲁棒性和可解释性。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20938 2025-12-25 cs.HC 50%

Pioneering Multimodal Emotion Recognition in the Era of Large Models: From Closed Sets to Open Vocabularies

开创性多模态情感识别在大模型时代的探索:从封闭集到开放词汇

Jing Han, Zhiqiang Gao, Shihao Gao, Jialing Liu, Hongyu Chen, Zixing Zhang, Björn W. Schuller

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 本文首次系统评估了多模态大语言模型在开放词汇情感识别中的表现,发现两阶段三模态融合方法效果最佳,视频模态最为关键,同时揭示开放与封闭源LLM性能差距较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09141 2025-12-25 cs.RO 50%

RGMP: Recurrent Geometric-prior Multimodal Policy for Generalizable Humanoid Robot Manipulation

RGMP: 基于几何先验的多模态策略用于通用人形机器人操作

Xuetao Li, Wenke Huang, Nengyuan Pan, Kaiyan Zhao, Songhua Yang, Yiming Wang, Mengde Li, Mang Ye, Jifeng Xuan, Miao Li

专题命中 视觉推理 :vision language model(abstract)

AI总结 RGMP通过结合几何-语义推理与递归高斯适应,实现了高效的人形机器人多模态操作控制。

Journal ref Proceedings of the AAAI conference on artificial intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20092 2025-12-24 cs.CL 50%

Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents

Memory-T1: 基于强化学习的多会话代理时间推理

Yiming Du, Baojun Wang, Yifan Xiang, Zhaowei Wang, Wenyu Huang, Boyang Xue, Bin Liang, Xingshan Zeng, Fei Mi, Haoli Bai, Lifeng Shang, Jeff Z. Pan, Yuxin Jiang, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co.,Ltd(华为技术有限公司) HKUST(香港科技大学) The University of Edinburgh(爱丁堡大学)

专题命中 视觉推理 :grounding(abstract)

AI总结 Memory-T1通过强化学习提升多会话代理的时间推理能力,实现7B模型在Time-Dialog基准上的67.0%高分,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15309 2025-12-19 cs.RO 50%

DynamicGSG: Dynamic 3D Gaussian Scene Graphs for Environment Adaptation

DynamicGSG: 动态3D高斯场景图用于环境适应

Luzhou Ge, Xiangyu Zhu, Zhuo Yang, Xuesong Li

机构 * School of Computer Science, Beijing Institute of Technology, China(计算机学院,北京理工大学)

专题命中 视觉推理 :vision language model(abstract)

AI总结 DynamicGSG通过动态高斯场景图实现环境适应,利用高斯溅射技术构建层次化场景图,提升环境理解和适应能力。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12967 2025-12-16 cs.CL 50%

QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management

QwenLong-L1.5: 长上下文推理与内存管理的训练配方

Weizhou Shen, Ziyi Yang, Chenliang Li, Zhiyuan Lu, Miao Peng, Huashan Sun, Yingcheng Shi, Shengyi Liao, Shaopeng Lai, Bo Zhang, Dayiheng Liu, Fei Huang, Jingren Zhou, Ming Yan

专题命中 视觉推理 :grounding(abstract)

AI总结 QwenLong-L1.5通过长上下文数据合成、稳定强化学习和内存增强架构,提升长上下文推理能力及超长任务处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10624 2025-12-12 cs.CL 50%

AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence

AgriGPT-Omni: 一种统一的语音-视觉-文本框架用于多语言农业智能

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 AgriGPT-Omni提出了一种统一的语音-视觉-文本框架,通过数据合成、多阶段训练和三模态基准,提升多语言农业智能的性能和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13886 2025-12-12 cs.CL 50%

Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning

Game-RL: 合成多模态可验证游戏数据以提升VLMs的通用推理能力

Jingqi Tong, Jixin Tang, Hangcheng Li, Yurong Mou, Ming Zhang, Jun Zhao, Yanbo Wen, Fan Song, Jiahao Zhan, Yuyang Lu, Chaoran Tao, Zhiyuan Guo, Jizhou Yu, Tianhao Cheng, Zhiheng Xi, Changhao Jiang, Zhangyue Yin, Yining Zheng, Weifeng Ge, Guanhua Chen, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉推理 :vision language model(abstract)

AI总结 Game-RL通过合成多模态可验证游戏数据提升VLMs的通用推理能力。

Comments 69 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09310 2025-12-11 cs.RO 50%

Scene-agnostic Hierarchical Bimanual Task Planning via Visual Affordance Reasoning

场景无关的双臂任务规划 via 视觉可及性推理

Kwang Bin Lee, Jiho Kang, Sung-Hee Lee

机构 * Graduate School of Culture Technology, Korea Advanced Institute of Science and Technology (KAIST)(文化科技研究生院,韩国科学技术院)

专题命中 视觉推理 :grounding(abstract)

AI总结 本文提出了一种场景无关的双臂任务规划框架,通过视觉可及性推理实现双臂操作的高效规划与执行。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03568 2025-12-04 cs.HC 50%

Synthetic Cognitive Walkthrough: Aligning Large Language Model Performance with Human Cognitive Walkthrough

合成认知 walkthrough:使大语言模型性能与人类认知 walkthrough 对齐

Ruican Zhong, David W. McDonald, Gary Hsieh

专题命中 视觉推理 :visual reasoning(abstract)

AI总结 研究探讨了大型语言模型能否通过模拟人类行为来提升认知 walkthrough 的效率,并展示了其在可用性测试中的潜在应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15607 2025-12-02 cs.RO 50%

PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models

基于偏好强化学习的多模态反馈与轨迹合成:从基础模型出发

Ruiqi Wang, Dezhong Zhao, Ziqin Yuan, Tianyu Shao, Guohua Chen, Dominic Kao, Sungeun Hong, Byung-Cheol Min

机构 * Purdue University(普渡大学) Beijing University of Chemical Technology(北京化工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Sungkyunkwan University(成均馆大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 视觉推理 :vision-language model(abstract)

AI总结 PRIMT通过多模态反馈和轨迹合成,利用基础模型解决偏好强化学习中的查询模糊性和信用分配问题,提升机器人复杂行为的学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21402 2025-11-27 cs.CL 50%

Text-to-SQL as Dual-State Reasoning: Integrating Adaptive Context and Progressive Generation

文本到SQL作为双状态推理:整合自适应上下文和渐进生成

Zhifeng Hao, Qibin Song, Ruichu Cai, Boyan Xu

机构 * School of Computer Science, Guangdong University of Technology(广东工业大学计算机科学学院) College of Science, Shantou University(汕头大学科学学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 视觉推理 :grounding(abstract)

AI总结 DSR-SQL通过双状态推理框架整合自适应上下文和渐进生成,提升文本到SQL的执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13733 2025-11-26 cs.RO 50%

FSR-VLN: Fast and Slow Reasoning for Vision-Language Navigation with Hierarchical Multi-modal Scene Graph

基于分层多模态场景图的视觉语言导航:快速与慢速推理

Xiaolin Zhou, Tingyang Xiao, Liu Liu, Yucheng Wang, Maiyue Chen, Xinrui Meng, Xinjie Wang, Wei Feng, Wei Sui, Zhizhong Su

机构 * Horizon Robotics D-Robotics Robotics

专题命中 视觉推理 :VLM(abstract)

AI总结 FSR-VLN通过分层多模态场景图与快速-慢速推理机制,提升视觉语言导航的效率与准确性,实现低延迟高成功率的导航性能。

Comments Demo video are available at https://horizonrobotics.github.io/robot_lab/fsr-vln/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22888 2025-11-25 cs.IR 50%

MGFRec: Towards Reinforced Reasoning Recommendation with Multiple Groundings and Feedback

MGFRec: 向多接地与反馈的强化推理推荐迈进

Shihao Cai, Chongming Gao, Haoyan Liu, Wentao Shi, Jianshan Sun, Ruiming Tang, Fuli Feng

专题命中 视觉推理 :grounding(abstract)

AI总结 MGFRec通过多轮接地和反馈机制提升推荐系统中推理与实际物品空间的一致性,改进推荐效果。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12001 2025-11-20 cs.CL cs.HC 50%

Critical or Compliant? The Double-Edged Sword of Reasoning in Chain-of-Thought Explanations

Eunkyu Park, Wesley Hanwen Deng, Vasudha Varadarajan, Mingxi Yan, Gunhee Kim, Maarten Sap, Motahhare Eslami

机构 * Seoul National University(首尔国立大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学)

专题命中 视觉推理 :vision language model(abstract)

Comments Under review; 16 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13327 2025-11-18 cs.RO 50%

ZeroDexGrasp: Zero-Shot Task-Oriented Dexterous Grasp Synthesis with Prompt-Based Multi-Stage Semantic Reasoning

Juntao Jian, Yi-Lin Wei, Chengjie Mou, Yuhao Lin, Xing Zhu, Yujun Shen, Wei-Shi Zheng, Ruizhen Hu

机构 * Shenzhen University(深圳大学) Sun Yat-sen University(中山大学) Ant Group(蚂蚁集团)

专题命中 视觉推理 :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17582 2025-11-13 cs.HC cs.GR cs.MM 50%

Crafting Dynamic Virtual Activities with Advanced Multimodal Models

Changyang Li, Qingan Yan, Minyoung Kim, Zhan Li, Yi Xu, Lap-Fai Yu

专题命中 视觉推理 :multimodal large language model(abstract)

Journal ref C. Li, Q. Yan, M. Kim, Z. Li, Y. Xu and L. -F. Yu, "Crafting Dynamic Virtual Activities with Advanced Multimodal Models," 2025 IEEE International Symposium on Mixed and Augmented Reality (ISMAR), pp. 120-130

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11639 2025-11-12 cs.IR 50%

OneRec-Think: In-Text Reasoning for Generative Recommendation

Zhanyu Liu, Shiyao Wang, Xingmei Wang, Rongzhou Zhang, Jiaxin Deng, Honghui Bao, Jinghao Zhang, Wuchao Li, Pengfei Zheng, Xiangyu Wu, Yifei Hu, Qigen Hu, Xinchen Luo, Lejian Ren, Zixing Zhang, Qianqian Wang, Kuo Cai, Yunfan Wu, Hongtao Cheng, Zexuan Cheng, Lu Ren, Huanjie Wang, Yi Su, Ruiming Tang, Kun Gai, Guorui Zhou

专题命中 视觉推理 :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏