I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning
我在视频中寻找你:面向以人为中心的视频推理的身份条件查询
Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang
机构
*
Beijing Jiaotong University(北京交通大学)
;
HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团)
;
MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
机构
*
College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院)
;
School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院)
;
State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)
;
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
School of Automation, Southeast University(东南大学自动化学院)
;
Department of Geography, National University of Singapore(新加坡国立大学地理系)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding
利用记忆进行推理:一种用于免训练长视频理解的时间粒度自适应框架
Linghao Meng, Qiankun Li, Junyuan Mao, Pujin Liao, Zhicheng He, Enbo Zhang, Kun Wang, Yang Liu, Huazhu Fu, Yueming Jin
机构
*
National University of Singapore(新加坡国立大学)
;
Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科学、技术与研究机构(A*STAR))
;
Nanyang Technological University(南洋理工大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Jilin University(吉林大学)
专题命中
视觉推理
:LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
University of Manchester(曼彻斯特大学)
;
Institute of Metal Research, Chinese Academy of Sciences(中国科学院金属研究所)
;
China University of Geosciences(中国地质大学)
Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation
物理问题场景图:文本到视频生成中物理合理性的细粒度评估
Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal
机构
*
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
AI2(艾伦人工智能研究所)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)
机构
*
University of Maryland, College Park(马里兰大学帕克分校)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Peking University(北京大学)
;
Arena
;
MBZUAI(穆罕默德·本·扎耶德人工智能大学)
Orientation Reading by Production Vision-Language Models on Optotype Charts: A Controlled Multi-Model Evaluation Across Reasoning Modes, Prompts, and Access Modalities
MMIR-TCM: Memory-Integrated Multimodal Inference and Retrieval for TCM Clinical Decision Support
MMIR-TCM:面向中医临床决策支持的记忆集成多模态推理与检索
Lihui Luo, Joongwon Chae, Ziyan Chen, Yang Liu, Siyi Cheng, Weihan Gao, Zelin Zeng, Xiaoming Yin, Samaneh Beheshti Kashi, Dongmei Yu, Lian Zhang, Jing Sui, Zeming Liang, Jiansong Ji, Peter E. Lobie, Peiwu Qin
机构
*
Institute of Biopharmaceutics and Health Engineering, Tsinghua Shenzhen International Graduate School(清华深圳国际研究生院生物医药与健康工程研究院)
;
Chinese Medicine Guangdong Laboratory(广东省中医药实验室)
;
Beijing Normal University(北京师范大学)
;
First Hospital of Hebei Medical University(河北医科大学第一医院)
;
Lishui Hospital of Zhejiang University(浙江大学丽水医院)
;
XiaoMing TCM Hospital(小明中医医院)
专题命中
视觉推理
:MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI
PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking
PixelEyes: 解耦感知与推理以实现精准视觉证据查找
Dengxian Gong, Yuanzheng Wu, Haobo Yuan, Zhengdong Hu, Tao Zhang, Yikang Zhou, Shihao Chen, Quanzhu Niu, Kai Wang, Jason Li, Haochen Wang, Lu Qi, Shunping Ji, Ming-Hsuan Yang