GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning
GeoReason: 通过逻辑一致性强化学习对遥感视觉-语言模型中的思考与回答进行对齐
Wenshuai Li, Xiantai Xiang, Zixiao Wen, Guangyao Zhou, Ben Niu, Feng Wang, Lijia Huang, Qiantong Wang, Yuxin Hu
机构
*
Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所)
;
Key Laboratory of Target Cognition and Application Technology, Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
机构
*
Fudan University(复旦大学)
;
NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队)
;
University of Science and Technology of China(中国科学技术大学)
;
Kuaishou Technology(快手科技)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Shanghai Jiao Tong University(上海交通大学)
;
Fudan University(复旦大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
University of Science and Technology Beijing(北京科技大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.LG
机构
*
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
专题命中
视觉定位与Grounding
:visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
VERSE: Visual Embedding Reduction and Space Exploration. Clustering-Guided Insights for Training Data Enhancement in Visually-Rich Document Understanding
VERSE:视觉嵌入减少与空间探索。用于视觉丰富文档理解的训练数据增强的聚类引导洞察
Ignacio de Rodrigo, Alvaro J. Lopez-Lopez, Jaime Boal
机构
*
Institute for Research in Technology, ICAI School of Engineering, Comillas Pontifical University(技术研究所、ICAI工程学院、科利马斯天主教大学)
$π_0$: A Vision-Language-Action Flow Model for General Robot Control
π₀:一种面向通用机器人控制的视觉-语言-动作流模型
Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn, Niccolo Fusai, Lachy Groom, Karol Hausman, Brian Ichter, Szymon Jakubczak, Tim Jones, Liyiming Ke, Sergey Levine, Adrian Li-Bell, Mohith Mothukuri, Suraj Nair, Karl Pertsch, Lucy Xiaoyang Shi, James Tanner, Quan Vuong, Anna Walling, Haohuan Wang, Ury Zhilinsky
Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering
视觉-语言反思:通过可解释的双因果引导减轻大语言模型中的过度自信幻觉
Shuliang Liu, Songbo Yang, Dong Fang, Sihang Jia, Yuqi Tang, Lingfeng Su, Ruoshui Peng, Yibo Yan, Xin Zou, Xuming Hu
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
;
The Hong Kong University of Science and Technology(香港理工大学)
;
LIGHTSPEED
专题命中
幻觉与鲁棒性
:multimodal large language model(abstract);分类 cs.CV、cs.AI
The Forgotten Shield: Safety Grafting in Parameter-Space for Medical MLLMs
被遗忘的盾牌:参数空间中的医疗大语言模型安全性移植
Jiale Zhao, Xing Mou, Jinlin Wu, Hongyuan Yu, Mingrui Sun, Yang Shi, Xuanwu Yin, Zhen Chen, Zhen Lei, Yaohua Wang
机构
*
National University of Defense Technology(国防科技大学)
;
Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统(MAIS))
;
Multimedia Department, Xiaomi Inc(小米公司多媒体部门)
;
Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong(香港科学院人工智能与机器人中心)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences, UCAS(中国科学院大学人工智能学院)
专题命中
幻觉与鲁棒性
:multimodal large language model(abstract);分类 cs.AI、cs.LG