EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation
欧洲医学问答研究协议:一个多语言、多模态的医学考试数据集用于语言模型评估
Francesco Andrea Causio, Vittorio De Vita, Olivia Riccomi, Michele Ferramola, Federico Felizzi, Alessandro Tosi, Antonio Cristiano, Lorenzo De Mori, Chiara Battipaglia, Melissa Sawaya, Luigi De Angelis, Marcello Di Pumpo, Alessandra Piscitelli, Pietro Eric Risuleo, Alessia Longo, Giulia Vojvodic, Mariapia Vassalli, Bianca Destro Castaniti, Nicolò Scarsi, Manuel Del Medico
Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment
通过几何奖励信用分配强化点-视觉-语言模型的3D理解
Jingkun Chen, Ruoshi Xu, Mingqi Gao, Shengda Luo, Jungong Han
机构
*
Northwestern Polytechnical University(西北工业大学)
;
Southern University of Science and Technology(南方科技大学)
;
The University of Sheffield(谢菲尔德大学)
;
Hengqin Laboratory(横琴实验室)
;
Tsinghua University(清华大学)
机构
*
East China Normal University(东中国师范大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
Huawei Noah's Ark Lab(华为诺亚实验室)
;
Independent Researcher(独立研究者)
;
University College London(伦敦大学学院)
机构
*
Zhejiang University(浙江大学)
;
State Key Laboratory of CAD & CG(计算机辅助设计与图形学国家重点实验室)
;
Ant Group(蚂蚁集团)
;
Westlake University(西湖大学)
;
Zhejiang University of Technology(浙江工业大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments
XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型
Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang
机构
*
Tsinghua University(清华大学)
;
Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技)
;
National University of Singapore(新加坡国立大学)
;
McGill University(麦吉尔大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
机构
*
School of Computer Science, University of Nottingham Ningbo China, China(诺丁汉大学宁波校区计算机科学学院)
;
Nottingham Ningbo China Beacons of Excellence Research and Innovation Institute, China(诺丁汉宁波中国卓越研究与创新研究所)
;
School of Artificial Intelligence, Shenzhen University, China(深圳大学人工智能学院)
SkillGraph: Self-Evolving Multi-Agent Collaboration with Multimodal Graph Topology
SkillGraph: 基于多模态图拓扑的自进化多智能体协作
Zheng Nie, Ruolin Shen, Xinlei Yu, Bo Yin, Jiangning Zhang, Xiaobin Hu
机构
*
National University of Singapore, Singapore(新加坡国立大学)
;
Technical University of Munich, Munich, Germany(慕尼黑技术大学)
;
Zhejiang University, China(浙江大学)
SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning
SpatialImaginer: 向空间推理的自适应视觉想象迈进
Yian Li, Yang Jiao, Bin Zhu, Tianwen Qian, Shaoxiang Chen, Jingjing Chen, Yu-Gang Jiang
机构
*
College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)
;
School of Computing and Information Systems, Singapore Management University(新加坡管理大学 computing 与信息学院)
;
School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)
;
MiniMax
;
Institute of Trustworthy Embodied Al, Fudan University(复旦大学可信具身人工智能研究院)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction
PestVL-Net: 通过细粒度视觉-语言交互实现多模态害虫学习
Xueheng Li, Tao Hu, Ke Cao, Runsheng Qi, Huixin Zhang, Rui Li, Jie Zhang, Chengjun Xie
机构
*
Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院)
;
University of Science and Technology of China(中国科学技术大学)
;
Zhongke Hefei Institute of Technology Innovation Engineering(中科合肥技术创新工程研究院)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
机构
*
Southeast University(东南大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
R3A: Reinforced Reasoning for Relevance Assessment for RAG in User-Generated Content Platforms
R3A:强化推理用于用户生成内容平台中的RAG相关性评估
Xiaowei Yuan, Lei Jin, Haoxin Zhang, Ziyang Huang, Yan Gao, Yi Wu, Yao Hu, Jun Zhao, Kang Liu
机构
*
The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(复杂系统认知与决策智能重点实验室,自动化研究所,中国科学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Xiaohongshu Inc.(小红书公司)
Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement
Q-DeepSight:利用图像激励思考用于图像质量评估与细化
Xudong Li, Jiaxi Tan, Ziyin Zhou, Yan Zhong, Zihao Huang, Jingyuan Zheng, Yan Zhang, Xiawu Zheng, Rongrong Ji
机构
*
Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)
;
Peking University(北京大学)
;
Beijing Institute of Technology(北京理工大学)
Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning
Omni-R1:迈向多模态推理的统一生成范式
Dongjie Cheng, Yongqi Li, Zhixin Ma, Hongru Cai, Yupeng Hu, Wenjie Wang, Liqiang Nie, Wenjie Li
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
Singapore Management University(新加坡国立大学)
;
Shandong University(山东大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.AI
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Central South University(中南大学)
;
Huawei Technologies Co., Ltd(华为技术有限公司)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区)
专题命中
视觉推理
:vision language model(abstract);分类 cs.CV
Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language
几何解析:一种统一形式语言用于平面和立体几何的图表解析
Peijie Wang, Ming-Liang Zhang, Jun Cao, Chao Deng, Dekang Ran, Hongda Sun, Pi Bu, Xuan Zhang, Yingyao Wang, Jun Song, Bo Zheng, Fei Yin, Cheng-Lin Liu
机构
*
MAIS, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Future Living Lab of Alibaba(阿里巴巴未来生活实验室)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV