Deconstructing Attention: Investigating Design Principles for Effective Language Modeling
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV
Comments 16 pages, 9 figures
专题命中 视觉定位与Grounding :grounding(abstract)
Comments 9 pages, 5 figures. Revised version accepted for publication in The Physics Educator (World Scientific, in press)
机构 * MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能联合实验室、X-LANCE实验室、上海交通大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 视觉定位与Grounding :grounding(abstract)
Comments Demo page: https://HiRookie9.github.io/PicoAudio2-Page
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI
机构 * ETH Zürich(苏黎世联邦理工学院) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract)
Comments 7 pages, 4 figures, accepted to the OWN workshop at IROS 2025
机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) ; Hunan University(湖南大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 GUI与屏幕智能体 :multimodal large language model(title);MLLM(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track. Dataset and Code: https://github.com/RuipingL/Situat3DChange
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
机构 * McGill University(麦吉尔大学) ; Mila – Quebec AI Institute(魁北克AI研究所)
专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted to ICCV 2025 Workshop CVAMD
机构 * University of Science and Technology of China(中国科学技术大学) ; NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV、cs.LG
Comments NeurIPS 2025 Datasets and Benchmarks Track. Github link: https://github.com/TomSheng21/tta-vlm
机构 * Arizona State University(亚利桑那州立大学) ; Intel Lab(英特尔实验室)
专题命中 幻觉与鲁棒性 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.LG
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Inner Mongolia Research Institute, Shanghai Jiao Tong University(上海交通大学内蒙古研究院)
专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.AI
机构 * Ruizhe Zhu(独立研究者)
专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV
机构 * MAPLE Lab, Westlake University(西溪大学MAPLE实验室)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * University of Minnesota(明尼苏达大学)
专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract);分类 cs.AI
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG
Comments Submitted to MLSys 2026
专题命中 幻觉与鲁棒性 :vision language model(abstract)
Comments The experiments in the paper need to be further supplemented, and more methods should be considered for expansion
机构 * School of Physics, Engineering and Technology, University of York(物理、工程与技术学院,约克大学) ; Department of Engineering, King’s College London(工程学院,伦敦国王学院)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(title,abstract);分类 cs.AI
Comments Accepted to IEEE Robotics and Automation Letters (RAL)
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; ByteDance US(字节跳动美国公司) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI
机构 * Adobe Research(Adobe研究院) ; Tel Aviv University(特拉维夫大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
Comments Project page at: https://shelley-golan.github.io/VLM-Guided-Creative-Generation/
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
机构 * Korea University(韩国大学)
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.AI
机构 * Shanghai Jiao Tong University(上海交通大学) ; SenseTime Research(商汤科技研究院) ; Central South University(中南大学) ; Tongji University(同济大学) ; Beihang University(北航) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 VLM训练与架构 :vision-language model(title);InternVL(abstract);分类 cs.AI
Comments Accepted in ICML 2025
机构 * University of Southern Queensland(昆士兰南方大学) ; University of Queensland(昆士兰大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted to the journal Pattern Recognition in 2025
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments NeurIPS 2025
机构 * Boston University(波士顿大学)
专题命中 VLM训练与架构 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Accepted to ICCV 2025
机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) ; Amazon(亚马逊)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Accepted at ECCV 2024
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.AI
机构 * University of Zurich(苏黎世大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)