Physics Knowledge in Frontier Models: A Diagnostic Study of Failure Modes
专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments 8 pages, 7 figures. Preprint. v2: Updated experiments and diagnostics; formatting fixes
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 幻觉与鲁棒性 :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments 8 pages, 7 figures. Preprint. v2: Updated experiments and diagnostics; formatting fixes
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted at AAAI 2026
机构 * Fudan University(复旦大学) ; City University of Hong Kong(香港城市大学) ; Singapore Management University(新加坡管理大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; MiLM Plus, Xiaomi Inc.(小米公司)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV
机构 * Hangzhou Institute of Technology, Xidian University, China(杭州科技学院,西安电子科技大学,中国) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Nankai University(南开大学) ; New York University(纽约大学) ; East China Normal University(华东师范大学) ; Hikvision Digital Technology Co., Ltd(海康威视数字技术有限公司) ; Shanghai Industrial Control Safety Innovation Tech. Co., Ltd(上海工业控制安全创新技术有限公司)
专题命中 幻觉与鲁棒性 :visual language model(abstract);分类 cs.CV
机构 * IPAI, Seoul National University(IPAI,首尔国立大学) ; Dept. of ECE, Seoul National University(电子工程系,首尔国立大学) ; LG AI Research(LG人工智能研究)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
Comments EMNLP 2025 Main (21pgs, 12 Tables, 9 Figures)
机构 * Zhejiang University(浙江大学) ; Tencent Hunyuan(腾讯文言) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.CV
机构 * University of Oxford, UK(牛津大学) ; CODE University of Applied Sciences, Germany(应用科学学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Journal ref Proceedings of the The European Workshop on Trustworthy AI (Trust-AI) at ECAI 2025
机构 * Shandong University(山东大学) ; MBZUAI ; New York University Abu Dhabi(纽约大学阿布扎赫分校) ; University of Surrey(塞雷尔大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted by AAAI 2026
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by AAAI 2025. Hongyang Wang and Yichen Shi contribute equally. Corresponding author: Zitong Yu
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
Comments AAAI 2026
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
机构 * University of Southern California(南加州大学) ; Intel Labs(英特尔实验室)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
机构 * MIT(麻省理工学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
机构 * New York University(纽约大学) ; Cornell Tech(康奈尔科技) ; Vanderbilt University(范德比尔特大学) ; Weill Cornell Medicine(韦尔医学院) ; Northwell Health(北well健康)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Journal ref Proceedings of SPIE Medical Imaging 2026
机构 * New York University(纽约大学) ; Cornell Tech(康奈尔科技) ; Vanderbilt University(范德比大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Regensburg(莱茵河畔大学) ; Weill Cornell Medicine(韦尔·科恩医学中心) ; Northwell Health(北well健康)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
机构 * Project leader(项目负责人)
专题命中 VLM训练与架构 :MLLM(abstract,comments);multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments Accepted by AAAI Conference on Artificial Intelligence (AAAI) 2026. Code available at https://github.com/bcmi/D3ToM-Diffusion-MLLM
机构 * University of Michigan(密歇根大学)
专题命中 VLM训练与架构 :VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted by AAAI 2026
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments 10 pages, 7 figures. Accepted by AAAI 2026
机构 * University of Waterloo(滑铁卢大学) ; Vector Institute(向量研究所) ; Google(谷歌)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
Comments Project page: https://physx-anything.github.io/
机构 * Rutgers University(罗切斯特大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI
Comments 13 pages, 3 figures,The 40th Annual AAAI Conference on Artificial Intelligence(AAAI 2026),Paper has been accepted for a poster presentation
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
Comments IEEE Transactions on Medical Imaging (Early Access) July 2025
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI