DocVAL: Validated Chain-of-Thought Distillation for Grounded Document VQA
DocVAL:用于基于文档的视觉问答的验证链式思维蒸馏
Pinaki Prasad Guha Neogi, Ahmad Mohammadshirazi, Ser-Nam Lim, Rajiv Ramnath
机构
*
Department of Computer Science(计算机科学系)
;
Engineering, Ohio State University, Ohio, US(工程系,俄亥俄州立大学,俄亥俄,美国)
;
Department of Computer Science, University of Central Florida, Florida, US(计算机科学系,中央佛罗里达大学,佛罗里达,美国)
Chunze Yang, Qidong Liu, Wenjie Zhao, Yue Tang, Jiusong Ge, Di Zhang, Jiashuai Liu, Lei Wu, Junbo Lu, Ni Zhang, Xian Wu, Zeyu Gao, Chen Li
机构
*
School of Comp. Science & Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)
;
Tencent Jarvis Lab(腾讯Jarvis实验室)
;
University of Cambridge(剑桥大学)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
MedVIGIL: Evaluating Trustworthy Medical VLMs Under Broken Visual Evidence
MedVIGIL: 在视觉证据受损下评估可信的医学视觉语言模型
Hanqi Jiang, Junhao Chen, Mingyu Kang, Hyeokjae Kwon, Yi Pan, Lifeng Chen, Weihang You, Haozhen Gong, Ruiyu Yan, Jinglei Lv, Lin Zhao, Hui Ren, Quanzheng Li, Tianming Liu, Xiang Li
机构
*
University of Georgia(佐治亚大学)
;
Harvard Medical School(哈佛医学院)
;
Chungbuk National University(Chungbuk国立大学)
;
Chungnam National University Hospital(Chungnam国立大学医院)
;
National University of Singapore(新加坡国立大学)
;
New York University(纽约大学)
;
University of Sydney(悉尼大学)
;
New Jersey Institute of Technology(新泽西理工学院)
机构
*
The Chinese University of Hong Kong Shanghai AI Laboratory(香港中文大学上海人工智能实验室)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
Shanghai Innovation Institute(上海创新研究院)
专题命中
视觉推理
:VLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract);MLLM(abstract_cn)
机构
*
Tsinghua University, SIGS(清华大学 SIGS)
;
Meituan(美团)
;
The Chinese University of Hong Kong(香港中文大学)
;
National University of Singapore(新加坡国立大学)
;
LMMs-Lab(LMMs实验室)
;
University of California, Los Angeles(加州大学洛杉矶分校)
DDX-TRACE: A Benchmark for Medical Diagnostic Trajectories in VLMs
DDX-TRACE: 视觉语言模型中医学诊断轨迹的基准
Jiazhen Pan, Weixiang Shen, Jun Li, Julian Canisius, Felix Bitzer, Paula Roßmüller, Jiancheng Yang, Virginie Kreutzinger, Daniel Rueckert, Benedikt Wiestler
机构
*
Technical University of Munich(慕尼黑技术大学)
;
TUM University Hospital(TUM大学医院)
;
Munich Center for Machine Learning(慕尼黑机器学习中心)
;
LMU Munich(慕尼黑大学)
;
Aalto University(阿尔托大学)
;
Imperial College London(伦敦帝国学院)
Metacognition as Reward: Reinforcing LLM Reasoning via Knowledge and Regulation Signals
元认知作为奖励:通过知识和调节信号强化LLM推理
Sirui Chen, Lei Xu, Yuying Zhao, Yutian Chen, Yu Wang, Beier Zhu, Hanwang Zhang, Shengjie Zhao, Chaochao Lu
机构
*
Tongji University(同济大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Nanyang Technological University(南洋理工大学)
;
University of Science and Technology of China(中国科学技术大学)
;
EPFL(苏黎世联邦理工学院)
;
Wuhan University(武汉大学)
Stephanie Ng, CP Lim, SueJen Looi, Hendrik Zurlinden, David Nguyen, Lei Wei, Saeid Nahavandi, Hailing Zhou
机构
*
Swinburne University of Technology(斯winburne大学)
;
National Transport Research Organisation(国家交通运输研究组织)
;
Google Cloud(谷歌云)
;
Deakin University(德金大学)
VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos
VideoTemp-o3:在智能视频思考中协调时间定位与视频理解
Wenqi Liu, Yunxiao Wang, Shijie Ma, Meng Liu, Qile Su, Tianke Zhang, Haonan Fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Yinwei Wei, Xuemeng Song
机构
*
Shandong University(山东大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Beihang University(北航)
;
Southern University of Science and Technology(南方科技大学)
Graph Alignment Topology as an Inductive Bias for Grounding Detection
图对齐拓扑作为接地检测的归纳偏置
Paul Landes, Pranav Herur, Adam Cross, Jimeng Sun
机构
*
Department of Pediatrics, University of Illinois College of Medicine Peoria(伊利诺伊大学皮奥里亚医学院儿科部)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机与数据科学学院)
;
Carle Illinois College of Medicine, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校卡莱医学院)
Mechanistic Interpretability of EEG Foundation Models via Sparse Autoencoders
基于稀疏自编码器的脑电图基础模型机制可解释性
William Lehn-Schiøler, Magnus Ruud Kjær, Rahul Thapa, Magnus Guldberg Pedersen, Anton Mosquera Storgaard, Nick Williams, Radu Gatej, Tue Lehn-Schiøler, Andreas Brink-Kjær, Sadasivan Puthusserypady, Sándor Beniczky, James Zou, Lars Kai Hansen
机构
*
BrainCapture
;
DTU Health Tech(技术大学丹麦健康技术)
;
DTU Compute(技术大学丹麦计算)
;
Department of Biomedical Data Science(生物医学数据科学系)
;
Department of Computer Science(计算机科学系)
;
Seer Medical(Seer医疗)
;
Filadelfia Epilepsy Hospital(菲拉德尔菲亚癫痫医院)
;
University Hospital of Copenhagen(哥本哈根大学医院)
AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery
AutoResearch AI:迈向人工智能驱动的科研自动化以实现科学发现
Guiyao Tie, Jiawen Shi, Dingjie Song, Yixiao Huang, Ziji Sheng, Xueyang Zhou, Daizong Liu, Pan Zhou, Yongchao Chen, Ran Xu, Lifang He, Qingsong Wen, Manling Li, Cong Lu, Shuai Li, Pengtao Xie, Yixuan Yuan, Rui Meng, Lei Xing, Lichao Sun, Caiming Xiong, Philip S. Yu, Jianfeng Gao
机构
*
Huazhong University of Science and Technology(华中科技大学)
;
Lehigh University(莱斯大学)
;
Tsinghua University(清华大学)
;
Wuhan University(武汉大学)
;
Salesforce Research(Salesforce研究)
;
Squirrel AI Learning(Squirrel AI学习)
;
Northwestern University(西北大学)
;
Independent(独立)
;
Shanghai Jiao Tong University(上海交通大学)
;
University of California San Diego(加州大学圣地亚哥分校)
;
Chinese University of Hong Kong(香港中文大学)
;
University of Illinois Chicago(伊利诺伊大学香槟分校)
;
Stanford University(斯坦福大学)
;
Google Cloud AI Research(谷歌云AI研究)
;
Recursive Superintelligence(递归超级智能)
;
Microsoft Research(微软研究院)