Binary Verification for Zero-Shot Vision
零样本视觉的二元验证
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种无需训练的二元验证流程,通过量化和二元化步骤提升零样本视觉任务性能,适用于引用表达定位、空间推理和BLINK-Jigsaw等任务。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
零样本视觉的二元验证
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种无需训练的二元验证流程,通过量化和二元化步骤提升零样本视觉任务性能,适用于引用表达定位、空间推理和BLINK-Jigsaw等任务。
超越准确度:引入符号-机械方法进行可解释性评估
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出符号-机械方法,通过结合任务相关符号规则与机械可解释性,评估模型在小数据下的泛化能力,揭示传统准确度指标无法检测的缺陷。
短语-实例对齐用于通用指称分割
机构 * Stony Brook University(石溪大学) ; UNC Charlotte(北卡罗来纳州立大学 Charlotte 分校)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG
AI总结 本文提出通过短语-实例对齐解决通用指称分割问题,通过实例级推理和POA损失实现精确对应,提升分割性能。
Comments Accepted to PVUW - CVPR 2026 Workshop. Webpage: https://eronguyen.github.io/InstAlign/
超越窗口:用于无训练开放词汇语义分割的全局-局部对齐CLIP
机构 * Sungkyunkwan University(全北大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出GLA-CLIP框架,通过增强窗口间信息交换解决传统滑动窗口方法的语义不一致问题,引入代理锚点和动态归一化方案提升小目标检测性能。
Comments 18 pages, 13 figures, 12 tables, Accepted to CVPR 2026
具有曲率引导自适应路由的几何混合专家用于图表示学习
机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(智能与计算学院,天津大学,天津,中国)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出GeoMoE框架,通过Ollivier-Ricci曲率指导的自适应路由融合不同黎曼空间的节点表示,提升多尺度拓扑结构的建模能力。
目标力:教视频模型实现物理条件化的目标
机构 * Brown University(布朗大学) ; Cornell University(康奈尔大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出Goal Force框架,通过显式力矢量和中间动力学定义目标,使视频模型能零样本泛化到复杂现实场景,实现基于物理的视频生成与规划。
Comments Camera ready version (CVPR 2026). Code and interactive demos at https://goal-force.github.io/
通过跨模态注意力可区分性理解视频-语言模型中的时间逻辑一致性
机构 * School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学与技术学院,北京,中国) ; Beijing Engineering Research Center of High Volume Language Information Processing and Cloud Computing Applications, Beijing Institute of Technology, Beijing, China(高性能语言信息处理与云计算应用北京工程研究中心,北京理工大学,北京,中国)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究探讨视频-语言模型在时间逻辑一致性问题上的核心原因,提出TCAS方法提升跨模态注意力的时序分辨能力,实验验证了方法对时间逻辑一致性的提升效果。
Comments Accepted by CVPR 2026
PREBA:通过PCA加权检索增强LLMs和贝叶斯平均聚合进行手术持续时间预测
机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院) ; First People’s Hospital of Yunnan Province(云南省第一人民医院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 PREBA通过PCA加权检索增强和贝叶斯平均聚合,结合机构特定临床证据和统计先验,提升手术持续时间预测的准确性和稳定性,实验显示其性能显著优于零样本推理方法。
Comments 13 pages
通过概念检索增强的LLM实现自动化形式化
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国) ; Ant Research, Ant Group, Beijing, China(蚂蚁集团北京蚂蚁研究院,中国) ; Department of Computer Science, Aalborg University, Denmark(丹麦奥尔堡大学计算机科学系) ; Software College, Northeastern University, Shenyang 110819, China(东北大学软件学院,沈阳 110819,中国)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出CRAMF框架,通过检索数学概念定义提升LLM形式化能力,解决模型幻觉和语义鸿沟问题,在三个基准测试中实现显著提升。
通过查询词进行视觉分割:用于半监督图像分割的语言锚点
机构 * University of Regina, Canada(里嘉大学) ; The University of Western Australia, Australia(西澳大学) ; University Canada West, Canada(加拿大西大学)
专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出HVLFormer,通过生成多尺度文本查询和引入跨视角一致性正则化,提升视觉与文本对齐,以实现更准确的半监督图像分割。
从基础模型学习:无需人工标注的水果检测模型
机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ; ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) ; Faculty of Science, National University of Singapore(新加坡国立大学科学学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG
AI总结 本文提出SDM-D框架,通过SDM和知识蒸馏技术,在无标注数据下训练高效的小模型,实现水果检测的高精度与速度,超越现有开放集检测方法。
Comments 35 pages, 11figures, conference or other essential info
FB-CLIP:基于前景-背景解耦的细粒度零样本异常检测
机构 * Xi’an Institute of Optics and Precision Mechanics, Chinese Academy of Sciences(西安光学精密机械研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Xi’an Jiaotong University(西安交通大学) ; Zhongnan Hospital of Wuhan University(武汉大学中南医院)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出FB-CLIP框架,通过多策略文本表示和前景-背景分离,提升细粒度零样本异常检测的准确性和定位能力。
dinov3.seg: 基于DINOv3的开放词汇语义分割
机构 * IITB-Monash Research Academy(IITB-莫纳什研究学院) ; IIT Bombay(印度理工学院班加罗尔) ; Monash University(莫纳什大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出dinov3.seg,通过改进DINOv3模型实现开放词汇语义分割,结合文本嵌入与视觉特征,提升复杂场景下的分割精度与鲁棒性。
基于假设的查询重写用于决策有用的检索
机构 * Graduate School of AI, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) ; School of Electrical Engineering, KAIST, Republic of Korea(韩国科学技术院电气工程学院) ; Department of Industrial Engineering, Yonsei University, Republic of Korea(延世大学工业工程系)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出HCQR框架,通过重写查询获取证据支持假设、区分替代方案和验证关键线索,提升检索与答案选择的对齐度,实验表明在MedQA和MMLU-Med上优于传统RAG方法。
MRD:多分辨率检索-检测融合用于高分辨率图像理解
机构 * HITSZ(哈尔滨工业大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出MRD框架,通过多分辨率语义融合和开放词汇检测提升高分辨率图像理解,实现局部和全局视角的增强,取得单目标和多目标理解任务的最先进性能。
Comments Accepted to CVPR 2026
无视位置,语言偏见:探测视觉语言编码器中中间层表征偏见以实现零样本语言基础空间理解
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; Samsung Electronics(三星电子)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究探讨了视觉语言编码器中间层中位置和语言相关信息的偏见,通过层间分析发现常规最终层多模态嵌入优先考虑全局语义对齐,导致视觉嵌入对位置线索敏感性低,多语言文本嵌入在共享空间中形成语言依赖的几何偏移,提出构建空间地图的方法提升零样本图像分割性能。
Comments 61 pages, 28 Figures, 15 Tables
探索无需额外训练的水下世界分割
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国) ; University of Science and Technology of China, China(中国科学技术大学,中国) ; Northwestern Polytechnical University, China(西北工业大学,中国)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出AquaOV255水下分割数据集及Earth2Ocean框架,通过几何引导视觉掩码生成和类别-视觉语义对齐模块,在无需额外训练的情况下实现高效的水下开放词汇分割。
表现美:迈向一种参与但客观的潜在美学
机构 * Digital Humanities Laboratory(数字人文实验室) ; École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑分校)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文探讨神经网络如何表征美,通过跨模型表征收敛研究,发现美能产生更相似的表示,而不美的图像则不能。研究提出美的现实基础,并强调人类感知与创作在塑造深度学习模型潜在空间中的作用。
IMAIA:交互式地图AI助手用于旅行规划和地理空间智能
机构 * Microsoft(微软) ; Amazon(亚马逊)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 IMAIA通过自然语言交互整合矢量地图和卫星影像,结合地理空间信息提升地图相关问答和摄像头到地点的关联能力,实现空间感知的对话式地图系统。
Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
VAD4Space:行星表面影像的视觉异常检测
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VAD4Space框架,用于自动化发现行星探索中的异常现象,通过实测评估了最先进的基于特征的VAD方法,并建立了两个基准数据集以支持行星科学中的异常检测应用。
一种混合的Tsallis-极化杂质度量用于决策树:理论基础和经验评估
机构 * Emergency Department, Lille University Hospital(里尔大学医院急诊科) ; Lille University(里尔大学) ; LIRMM Montpellier University(蒙彼利埃大学LIRMM) ; UMontpellier(蒙彼利埃大学) ; CRISTAL UMR CNRS 9189 Lille University(里尔大学CRISTAL UMR CNRS 9189)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种结合归一化Tsallis熵与指数极化成分的混合杂质度量ITC,理论分析与实验验证显示其在决策树学习中具有良好的理论基础和实用性。
直击核心:一种无需训练的多模态摘要方法 via 事件链
机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) ; School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) ; School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 无需训练的多模态摘要方法CoE通过事件链和层次事件图实现跨模态整合与时间推理,提升摘要质量与领域适应性。
Comments Accepted to CVPR 2026
关于数据在开放集具身助益中的优势与劣势
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了多模态基础模型在开放集辅助任务中的泛化能力,通过合成数据集评估模型在新用户行为和新配置中的表现,揭示了辅助数据集设计对模型性能的关键影响。
生成模型在决策中的应用:综述
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文综述提出了一种基于概率框架的控制作为推理的系统分类,将生成决策置于其中,通过变分因子分解轨迹后验,概念化了四个功能角色,并探讨了生成模型在高风险领域的应用及挑战。
Comments Project page:https://github.com/xyshao23/Awesome-Generative-Models-for-Decision-Making-Taxonomy
通过锚定描述实现的判别感知用于推理分割
机构 * Northwestern Polytechnical University(西北工业大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出DPAD方法,通过生成描述性标题来增强推理分割的判别能力,提升推理链的聚焦性和效率。
Comments Accepted by CVPR 2026
神经符号解码神经活动
机构 * Columbia University(哥伦比亚大学) ; Stanford University(斯坦福大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 NEURONA通过结合符号推理与fMRI基础,提升神经活动解码的准确性和泛化能力。
Comments ICLR 2026. First two authors contributed equally
鲁棒性权重印刻:来自神经坍缩和基于代理的聚合的见解
机构 * DATEXIS, Berliner Hochschule für Technik (BHT), Germany(DATEXIS,柏林技术学院(BHT)) ; KI-Werkstatt, University of Applied Sciences Berlin, Merantix Momentum, Germany(KI工作室,柏林应用技术大学,Merantix Momentum) ; Hochschule für Technik und Wirtschaft Berlin (HTW)(柏林技术与经济高等学院(HTW))
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出IMPRINT框架,通过神经坍缩现象和代理聚合改进迁移学习,实现4%的性能提升。
Journal ref Transactions on Machine Learning Research (2025)
GlassMol:通过概念瓶颈模型实现可解释的分子属性预测
机构 * Northwestern University(西北大学) ; AbbVie(阿比维)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 GlassMol通过自动化概念整理和LLM引导的概念选择,解决分子属性预测中的可解释性与性能权衡问题。
CloDS: 未知条件下的视觉-only 无监督布料动力学学习
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; School of Engineering Science, University of Chinese Academy of Sciences(中国科学院大学工程科学学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 CloDS通过无监督学习从多视角视觉数据中学习布料动力学,解决未知条件下的动态模拟问题。
Comments ICLR 2026
基于参考的技能发现
机构 * School of Interactive Computing(交互计算学院) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 RGSD通过语义有意义的潜在空间实现技能发现,有效模仿和发现多样行为,在运动任务中优于模仿学习基线。