When Cultures Meet: Multicultural Text-to-Image Generation
当文化相遇:多文化文本到图像生成
机构 * Santa Clara University(圣克拉拉大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出多文化文本到图像生成任务,构建首个评估基准,分析先进模型在多文化场景下的表现,提出MosAIG框架提升图像生成质量与文化准确性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
当文化相遇:多文化文本到图像生成
机构 * Santa Clara University(圣克拉拉大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出多文化文本到图像生成任务,构建首个评估基准,分析先进模型在多文化场景下的表现,提出MosAIG框架提升图像生成质量与文化准确性。
前馈3D场景建模:以问题为导向的视角
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Monash University(墨尔本大学) ; ETH Zurich(苏黎世联邦理工学院) ; University of Tübingen(图宾根大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文探讨了前馈3D重建的通用方法,提出以模型设计为核心的分类体系,涵盖特征增强、几何意识、模型效率等五个核心问题,旨在推动3D场景建模的标准化与可扩展性。
Comments 67 pages, 395 references. Project page: https://ff3d-survey.github.io. Code: https://github.com/ziplab/Awesome-Feed-Forward-3D. This work has been submitted to Springer for possible publication
IAD-Unify:一种基于区域的统一模型用于工业异常分割、理解和生成
机构 * Zhejiang University(浙江大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出IAD-Unify模型,通过双重编码框架实现工业异常的分割、理解和生成,构建了统一的评估平台,并展示了其在跨类别泛化上的强大性能。
MolMem:基于记忆的代理强化学习用于样本高效的分子优化
机构 * Northwestern University(西北大学) ; AbbVie(阿比维)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 MolMem通过双记忆系统提升分子优化的样本效率,利用静态示例记忆和进化技能记忆,实现90%的成功率和52%的多属性任务表现。
GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架
机构 * University of Southern California(南加州大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。
Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)
基于案例的证据验证:构建证据敏感监督的框架
机构 * RWTH Aachen University(亚琛工业大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出案例 grounded 的证据验证框架,通过生成支持与非支持示例,提升模型对证据依赖性的学习能力,实验显示其在医学影像领域表现优异。
RecaLLM:通过显式上下文检索解决‘思维迷失’现象
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 RecaLLM通过交替推理与显式上下文检索解决推理过程中因长上下文导致的检索性能下降问题,显著提升了RULER和HELMET基准测试表现。
Comments Code, data, and models available at https://github.com/kswhitecross/RecaLLM
VSI:视觉字幕整合用于关键帧选择以增强长视频理解
机构 * AI Thrust, HKUST(GZ)(香港科技大学(广州)) ; Shandong University(山东大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 VSI通过融合视觉与文本信息提升长视频关键帧检索精度,实现在文本相关任务中的突破性表现。
Comments Accepted to CVPR 2026 Findings, 10 pages
低数据监督适应在云分割领域优于提示
机构 * University of Georgia(佐治亚大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文研究了在遥感影像云分割任务中,低数据监督微调优于提示方法,发现使用少量标注数据可显著提升性能,而提示方法效果有限。
Comments 10 pages, 6 figures, to be published in EarthVision @ CVPR 2026
RewardFlow: 通过优化所奖励的内容生成图像
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Sony Research, India(索尼印度研究院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 RewardFlow通过多奖励Langevin动力学优化预训练扩散和流匹配模型,统一了语义对齐、感知保真度等不同可微奖励,并引入基于VQA的可微奖励提升语义监督。
Comments CVPR 2026. Project page: https://plan-lab.github.io/rewardflow
InstAP:面向空间-时间理解的实例感知视觉-语言预训练
机构 * Woven by Toyota
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 InstAP通过结合全局视觉-文本对齐与细粒度实例级对比对齐,提升实例级推理能力,在InstVL数据集上实现优于现有VLP模型的实例检索性能,并在零样本视频基准中表现优异。
PASK:迈向具有长期记忆的意图感知主动代理
机构 * Pask-Core(Pask核心) ; NTU(南洋理工大学) ; NUS(新加坡国立大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出PASK框架,通过意图流模型和混合记忆系统实现主动代理,在现实场景中识别更深层用户意图。
Comments Technical report; Work in progress
AgriPath:作物疾病分类架构权衡的系统探索
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文系统比较了CNN、对比视觉语言模型和生成式VLM在作物疾病分类中的表现,揭示了不同架构在不同场景下的性能差异,强调部署环境对架构选择的影响。
Comments 11 pages main text, 24 pages total including references and appendix. 6 figures, 14 tables. Code and dataset will be released upon publication
像苏格拉底提问:苏格拉底帮助VLMs理解遥感图像
机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) ; Baidu Inc.(百度公司) ; School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出RS-EoT方法,通过迭代视觉证据寻求机制和两阶段强化学习策略,解决遥感图像中伪推理问题,提升视觉证据基础的推理能力。
Comments Accepted by CVPR 2026
批量损失评分用于动态数据剪枝
机构 * Northwestern Polytechnical University(西北工业大学) ; The University of Hong Kong(香港大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG
AI总结 本文提出批量损失评分(BLS),通过指数移动平均法高效计算样本重要性,简化代码集成并提升复杂模型的数据剪枝效果。
Comments CVPR2026 accepted
ZINA:多模态细粒度幻觉检测与编辑
机构 * Keio AI Research Center(庆应义塾大学人工智能研究中心) ; Keio University(庆应义塾大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出ZINA方法,用于多模态大语言模型的细粒度幻觉检测与编辑,通过构建VisionHall数据集验证了其在检测和编辑任务中的优越性。
Comments CVPR 2026 Main Conference
StoryBlender: 具有时空动态的跨镜头一致且可编辑的3D分镜
机构 * Independent Researcher(独立研究员) ; Australia National University(澳大利亚国立大学) ; Central South University(中南大学) ; University of New South Wales(新南威尔士大学) ; Vertex Lab(Vertex实验室) ; National University of Singapore(新加坡国立大学) ; University of Technology Sydney(悉尼科技大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 StoryBlender通过三阶段流程实现跨镜头一致性和可编辑性,结合语义空间接地、资产材料化和时空动态,提升3D分镜生成的连续性和编辑精度。
在RAG中扩展DPPs:密度与多样性
机构 * Southwestern University of Finance and Economics(西南财经大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ScalDPP,通过轻量级P-Adapter整合DPPs,实现RAG中密度与多样性的联合优化,通过DML损失确保互补证据链的优先级,实验验证其有效性。
月梦分割:从词语到掩码
机构 * M87 Labs, San Francisco, CA, USA(M87实验室,美国加利福尼亚州旧金山)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 月梦分割基于Moondream 3扩展,通过自回归解码生成掩码并迭代优化,引入强化学习阶段提升分割精度,实现RefCOCO和LVIS数据集的高精度分割结果。
Comments Demo: https://moondream.ai/me/playground
通过掩码条件生成式AI生成卫星图像数据用于野火检测
机构 * Department of Intelligent Systems and Robotics, University of West Florida(西佛罗里达大学智能系统与机器人系) ; IHMC(人类与机器认知研究所)
专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI
AI总结 本文探讨了基于地球观测扩散模型EarthSynth生成野火后Sentinel-2 RGB图像的可能性,通过不同实验配置评估生成效果,发现修补生成优于全图生成,且VLM辅助修补与手工提示效果相当。
Comments 22 pages, 7 figures
适应性引导的检索增强掩码扩散模型
机构 * KAIST(韩国科学技术院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ARAM框架,通过动态校准引导尺度提升检索增强扩散模型在知识密集型问答中的性能。
Curia-2:用于放射学基础模型的自监督学习扩展
机构 * Raidium ; Department of Vascular and Oncological Interventional Radiology, Hôpital Européen Georges Pompidou, AP-HP, Paris, France(巴黎欧洲乔治·蓬皮杜医院血管与肿瘤介入放射科,AP-HP) ; Faculté de Santé, Université Paris-Cité, Paris, France(巴黎西岱大学健康学院)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 Curia-2通过改进预训练策略和表征质量,提升了放射学数据的捕捉能力,首次实现了多模态CT和MRI基础模型的亿参数视觉变换器架构,并在两个新评估轨道中验证了其性能。
从骨架到语义:一种混合边缘基于的动作检测系统在公共安全中的设计与部署
机构 * Sopra Steria Germany(Sopra Steria德国) ; Sopra Steria India(Sopra Steria印度)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种混合边缘动作检测系统,结合骨架运动分析与视觉语言模型,以提升公共安全中的实时视频分析能力,通过系统级对比展示两种方法在边缘计算中的互补性与局限性。
Comments Preprint version of a manuscript currently under review at IEEE Access
用于交互式森林变化分析的视觉-语言代理
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种基于大语言模型的视觉-语言代理,用于处理遥感图像变化解释任务,通过多级变化解释框架和交互式查询提升森林变化分析的准确性与效率。
Comments 5 pages, 4 figures, Accepted into IGARSS 2026
FigEx2: 科学复合图像的视觉条件化面板检测与标注
机构 * University of Pittsburgh(匹兹堡大学) ; UPMC Hillman Cancer Center(UPMC希尔曼癌症中心)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 针对科学复合图像中缺乏标注的问题,FigEx2通过视觉条件化框架直接从图像生成面板标注,提升下游预训练和检索性能,同时引入噪声感知门控融合模块和分阶段SFT+RL策略。
从观察到行动:用于工业场景中VLA预训练的基于动作的潜在原始分割
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种无监督框架,利用连续工业视频流中的大量未标记人类示范数据进行VLA模型预训练。方法首先训练了一个轻量级运动分词器来编码运动动态,然后利用新的'潜在动作能量'度量来发现和分割语义连贯的动作原始片段。
Comments 10 pages, 5 figures, Accepted to CVPR 2026
双向多模态提示学习与尺度感知训练用于少样本多类异常检测
机构 * Yonsei University(延世大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出AnoPLe框架,通过双向交互文本与视觉提示,实现高效多类异常检测,在MVTec-AD等数据集上超越现有方法,且具备良好的泛化能力。
Comments accepted to CVPR 2026
MoD-DPO:通过模态解耦偏好优化缓解多模态幻觉
机构 * University of Southern California(南加州大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG
AI总结 本文提出MoD-DPO框架,通过引入模态感知正则化项和语言先验去偏惩罚,提升多模态大模型的模态对齐能力,实验表明其在多模态幻觉基准测试中表现优异。
Comments CVPR 2026. Project Page: https://mod-dpo.github.io/
守护天空:反无人机方法的全面调查、基准测试与未来方向
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文综述了反无人机领域,探讨了分类、检测与跟踪等核心方法,分析了数据合成、多模态融合等新兴技术,并指出实时性能、 stealth 检测等领域的不足,旨在推动下一代防御策略的发展。
Comments Accepted to CVPR 2025 Anti-UAV Workshop (Best Paper Award), 16 pages
像素与词语之间的桥梁:面向多模态媒体验证的掩码感知局部语义融合
机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出MaLSF框架,通过主动双向验证和层次语义聚合模块,解决多模态虚假信息检测中的局部语义不一致问题,实现像素与词语的语义连接。
Comments Accepted by CVPR 2026