TimeSoccer: An End-to-End Multimodal Large Language Model for Soccer Commentary Generation
机构 * East China Normal University(东华大学)
专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * East China Normal University(东华大学)
专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :MLLM(title,abstract);VLM(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.AI
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments 9 pages, 5 figures
专题命中 视觉定位与Grounding :vision-language model(title,abstract);visual reasoning(abstract);grounding(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :vision-language model(title,abstract);vision language model(abstract);VLM(abstract);分类 cs.CV
Comments Codes are available at https://github.com/wkfdb/MarvelOVD
专题命中 视觉定位与Grounding :vision-language model(title,abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.AI
Comments 9 pages, 7 figures. Presented at ICML 2023
专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV
Comments Accepted to ICLR2023
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV、cs.AI、cs.LG
Comments ICCV 2025 VLM 3d Workshop
机构 * The University of Tokyo(东京大学) ; S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; Duke University(杜克大学) ; Salesforce AI Research(Salesforce人工智能研究) ; Nanyang Technological University(南洋理工大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Tokyo University of Science(东京科学大学)
专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract,comments);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at TMLR2025. Survey paper. We welcome questions, issues, and paper requests via https://github.com/AtsuMiyai/Awesome-OOD-VLM
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV、cs.AI、cs.LG
Comments NIPS 2024 Camera Ready, Codes are available at \url{https://github.com/YBZh/OpenOOD-VLM}
MedPlex:用于临床基础医学分割的深度视觉-语言协同适配
机构 * Wayne State University(韦恩州立大学) ; Henry Ford Health(亨利福特医疗集团) ; Institute for AI and Data Science Wayne State University(韦恩州立大学人工智能与数据科学研究院)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 MedPlex是一种端到端VLM框架,通过双向融合和两级概念对齐,实现医学图像分割的视觉-语言协同适配,在CT、MR的多类医学分割任务中达到最优性能。
Comments Accepted By BMVC-2026
开放词汇BEV分割:基于3D感知几何约束的方法
机构 * KAIST AI(韩国科学技术院人工智能) ; NAVER LABS(NAVER实验室)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 针对开放词汇BEV分割中2D VLM语义到BEV的3D几何不一致问题,提出OVBEVSeg框架,通过三阶段几何约束(伪标签、场景优化、知识蒸馏)实现高效在线推理,在nuScenes上未见类别mIoU超越闭集方法15.3,推理速度提升2.5倍。
Comments This paper has been accepted to ECCV 2026
基于自主虚拟现实的危险环境态势感知风险检测
机构 * Interactive Robotics and Language Lab, University of Maryland Baltimore County(马里兰大学巴尔的摩县分校交互式机器人与语言实验室) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(abstract);分类 cs.CV、cs.AI
AI总结 研究在高风险环境中,提出基于VR的人机交互框架,利用VLM辅助机器人识别潜在危险并标注兴趣点,通过VR界面呈现给操作员,经实验验证该方法能有效支持态势感知,提升交互体验。
Comments 7 Pages, Accepted to RO-MAN 2026
Symbal:检测模型生成字幕中的系统性对齐错误
专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究多模态大语言模型生成图像字幕时的系统性对齐错误检测问题,提出利用现成基础模型的结构化双阶段设置的Symbal方法,引入SymbalBench基准,Symbal在基准上表现出色,可辅助审核MLLM生成的字幕。
Comments ICML 2026
代理分析:作为条件编码器的视觉语言模型中的定位信号
机构 * Tel Aviv University, Tel Aviv, Israel(特拉维夫大学) ; Google DeepMind(谷歌DeepMind)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究视觉语言模型(VLMs)作条件编码器时编辑管道定位性能差的问题,引入代理分析框架,通过训练代理模型分析VLM中间表示来揭示编码定位信息的表示,发现现有条件提取策略缺陷,为条件架构设计提供新思路。
Comments Accepted as a Spotlight at the ICML 2026 Mechanistic Interpretability Workshop
Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理
机构 * Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))
专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。
边界框作为目标:通过神经符号规划实现语言条件抓取
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出GRASP框架,利用预训练VLM将自然语言查询转化为神经符号目标状态,通过边界框检测实现零样本桌面操作,无需任务特定训练。
Comments Project website: https://allisonandreyev.github.io/grasp.github.io/
Sci-Rho:面向STEM问题的多语言视觉基础符号基准
机构 * Independent Researcher(独立研究员) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Binus University(比努斯大学) ; Bandung Institute of Technology(万隆理工学院)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出Sci-Rho,一个多语言、视觉基础的STEM问题动态基准,包含4242个模板和42420个实例,评估17个VLM发现最差精度与平均精度存在差距,且小模型跨语言性能下降。
Comments 22 pages
你能相信你所见的吗?人类与AI对合成法律证据的检测
机构 * Faculty of Law, McGill University(麦吉尔大学法学院)
专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究人类和前沿多模态大模型在民事纠纷场景中区分真实照片与AI生成图像的能力,发现两者均不可靠,提出结合人工审查、MLLM筛查和来源认证的解决方案。
多时相指代分割的开源基准与基线
机构 * University of Science and Technology of China(中国科学技术大学) ; Institute of Artificial Intelligence (TeleAI)(人工智能研究所) ; China Telecom(中国电信) ; School of Artificial Intelligence, Optics and Electronics (iOPEN)(人工智能、光学与电子学院) ; Northwestern Polytechnical University(西北工业大学)
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract);grounding(abstract)
AI总结 提出多时相指代分割任务,通过自动化数据构建管道CRAFT-Agent生成首个基准MTRefSeg-21K,并设计两阶段训练的变化感知LVLM框架MTRefSeg-R1,实现优于现有基线的性能。
GRASP:学习多个人非语言互动中的社会推理
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Georgia Institute of Technology(佐治亚理工学院) ; Amazon AGI Korea University(亚马逊AGI韩国大学)
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 GRASP通过连接高层社会问答与细粒度目光和指代手势事件,提升多个人非语言互动的社会推理能力,包含290万对问题-答案对,提出Social Grounding Reward提升模型性能。
Comments Project page: https://social-reaoning.github.io/grasp/
洞穴的寓言:基于测量的视觉-语言学习
机构 * Xidian University(西电大学) ; Southwest University of Science and Technology(西南科技大学)
专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文研究了视觉-语言模型在更接近底层相机测量的视觉接口下,基于测量的视觉-语言学习是否能提升性能。PRISM-VL模型结合RAW数据、相机条件接地和曝光括号监督聚合,通过高质量数据集和基准测试,提升了BLEU、ROUGE-L和LLM-Judge的准确率。
增长市场中的定位增强:减轻跨本地化行为偏差在学习到排序中的影响
机构 * Adobe
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种多目标框架,结合行为监督、VLM相关性信号和本地化增强,以改善学习到排序中的本地内容可见性。
重新思考患者教育作为多轮多模态交互
机构 * VA Bedford Health Care(VA贝德福德医疗中心) ; UMass Amherst(马萨诸塞大学阿默斯特分校) ; UMass Lowell(马萨诸塞大学洛厄尔分校) ; Yale University(耶鲁大学) ; National University of Singapore(新加坡国立大学) ; Yale School of Medicine(耶鲁医学院)
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出MedImageEdu基准,通过多轮多模态交互提升患者教育效果,评估咨询过程和最终响应质量,发现多模态模型在视觉 grounding、安全性和情绪互动方面存在不足。
Comments Equal contribution for the first two authors
CLBench-V:评估从基础到知识获取的多模态上下文学习
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; Zhongguancun Academy(中关村科学城创新中心) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究多模态上下文学习问题,引入CLBench-V基准,围绕上下文基础、新信息应用和新知识学习三个维度组织任务,结合公共基准与新数据集,经自动化程序构建,测试六个模型,分析相关因素,揭示多模态上下文学习远未饱和及各模型表现情况。