PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
PsOCR:用于低资源帕什托语言光学字符识别的大型多模态模型基准测试
Ijazul Haq, Yingjie Zhang, Irfan Ali Khan
机构
*
organization= Shien-Ming Wu School of Intelligent Manufacturing, South China University of Technology , city= Guangzhou , postcode= 511442 , country= China
;
organization= Artificial Intelligence Department, Guangdong CAS Angels Biotechnology Co. Ltd. , city= Foshan , country= China
;
organization= Department of Software Engineering, Faculty of Electrical \& Computer Engineering, University of Engineering \& Technology , city= Peshawar , postcode= 25000 , country= Pakistan
AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning
AtomThink: 多模态慢思考与原子步骤推理
Kun Xiang, Zhili Liu, Terry Jingchen Zhang, Yinya Huang, Yunshuang Nie, Kaixin Cai, Yiyang Yin, Runhui Huang, Hanhui Li, Yihan Zeng, Yu-Jie Yuan, Jianhua Han, Lanqing Hong, Hang Xu, Xiaodan Liang
机构
*
Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
;
ETH Zurich(苏黎世联邦理工学院)
;
Hong Kong University of Science and Technology(香港科技大学)
;
University of Hong Kong(香港大学)
;
Noah’s Ark Lab(诺亚实验室)
;
Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司)
The Magni Human Motion Dataset: Accurate, Complex, Multi-Modal, Natural, Semantically-Rich and Contextualized
Magni 人类运动数据集:准确、复杂、多模态、自然、语义丰富且上下文化的
Tim Schreiter, Tiago Rodrigues de Almeida, Yufei Zhu, Eduardo Gutierrez Maestro, Lucas Morillo-Mendez, Andrey Rudenko, Tomasz P. Kucner, Oscar Martinez Mozos, Martin Magnusson, Luigi Palmieri, Kai O. Arras, Achim J. Lilienthal
Commentsin SIRRW Workshop held in conjunction with 31st IEEE International Conference on Robot & Human Interactive Communication, 29/08 - 02/09 2022, Naples (Italy)
Journal refInternational Journal of Robotics Research (IJRR), 2025