arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2606.30458 2026-06-30 cs.CV 57%

Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance

跨分辨率语义迁移用于低分辨率监控下的鲁棒文本-图像检索

Wenjie Qian, Bin Yang, Xiao Wang, Wenke Huang, Ling Mei, Xin Xu, Mang Ye

机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) School of Computer Science, National Engineering Research Center for Multimedia Software, Wuhan University(武汉大学计算机学院,国家多媒体软件工程技术研究中心) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System, Wuhan University of Science and Technology(湖北省智能信息处理与实时工业系统重点实验室,武汉科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对低分辨率监控场景中文本-图像检索的可靠性崩溃和排序漂移问题,提出CLIP框架CRST,通过分辨率条件推理、文本引导精炼和跨分辨率邻域迁移,在三个数据集上平均提升超低分辨率Rank-1和mAP分别5.7%和5.3%。

Comments 10 pages,8 figures,conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30288 2026-06-30 cs.CV 57%

VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context

VisReflect: 用于长视觉上下文中细粒度感知的潜在视觉反射

Xiaoqian Shen, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布斯大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 针对长视觉上下文中细粒度感知的挑战,提出VisReflect框架,通过潜在空间中的连续视觉反射选择性强调相关区域,无需显式定位或额外前向传播,在图像和视频基准上分别提升4.1%和1.8%,并减少约44%推理时间。

Comments Accepted to ECCV 2026; Project page: https://xiaoqian-shen.github.io/VisReflect

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29850 2026-06-30 cs.CV 57%

Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction

面向具身AI的高效视觉指代:智能体驱动数据合成、跨块注意力与迭代校正

Zijian Hong, Qi Lv, Yuxiang Xie, Jianming Xing, Xiang Deng, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出PointArena 2026解决方案,通过智能体驱动数据合成、确定性可操控数据流水线、跨块注意力与迭代校正模块,实现77.2%总体准确率,排名第二。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29377 2026-06-30 cs.AI 57%

Diagnosing and Repairing Factual Errors in RAG under Budget Constraints

预算约束下RAG中事实性错误的诊断与修复

Soroush Hashemifar, Havva Alizadeh Noughabi, Fattane Zarrinkalam, Ali Dehghantanha

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出D2R-RAG框架,通过轻量级诊断和自适应修复,在预算约束下提升检索增强生成的事实性,实现准确性与效率的更好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28804 2026-06-30 cs.CV cs.RO 57%

ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models

ViPSim: 协同视觉与参数空间实现一致的长时程具身世界模型

Longyu Chen, Heng Li, Wei Yang, Manqi Zhao, Dongsheng Jiang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出ViPSim框架,通过协同视觉空间(显式空间先验)和参数空间(数值驱动)解决长时程视频生成中的轨迹漂移和不一致问题,实现高保真具身世界模型。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28781 2026-06-30 cs.AI cs.MA 57%

HyphaeDB: A Living Knowledge Topology for Agent-First Memory

HyphaeDB: 面向智能体优先记忆的活知识拓扑

Krishna Halaharvi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出HyphaeDB,一种将HNSW图拓扑重新解释为多智能体通信结构的记忆基础设施,通过八卦协议和能量衰减实现知识传播,支持矛盾检测、模式结晶和共识形成等涌现行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28425 2026-06-30 cs.CR cs.AI 57%

Tool Use Enables Undetectable Steganography in Multi-Agent LLM Systems

工具使用使多智能体LLM系统中的隐写术无法检测

Jimmy Laurence Rippin, Simon C. Marshall, David Demitri Africa, Christian Schroeder de Witt

机构 * Oxford University(牛津大学) Artificial Intelligence Security Institute (AISI)(人工智能安全研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文研究多智能体AI系统中通过工具使用(如代码执行、网络搜索)实现无法检测的隐写通信,发现智能体可自适应构建隐写系统,并提出协调度量评估无事先约定的隐写协调风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28358 2026-06-30 cs.IR cs.AI cs.CL 57%

How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation

LLM如何引用?检索增强生成中归因的机制解释

Ian van Dort, Maria Heuss

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 通过激活修补方法,发现LLM的引用机制并非单一组件,而是由注意力头和MLP层组成的分布式“归因集成”,调控这些组件可修复大部分错误引用。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution is published in Advances in Information Retrieval, ECIR 2026, Lecture Notes in Computer Science, vol. 16485, pp. 458-473, and is available online at https://doi.org/10.1007/978-3-032-21324-2_35

Journal ref Advances in Information Retrieval, ECIR 2026. Lecture Notes in Computer Science, vol. 16485, pp. 458-473. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03253 2026-06-30 cs.CV 57%

LaVPR: Benchmarking Language and Vision for Place Recognition

LaVPR:语言与视觉用于位置识别的基准测试

Ofer Idan, Dan Badur, Yosi Keller, Yoli Shavit

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 LaVPR通过引入超过65万条自然语言描述扩展现有VPR数据集,研究多模态融合与跨模态检索,证明语言描述在视觉退化条件下提升性能,尤其对小模型效果显著。

Comments Accepted to ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27483 2026-06-29 cs.AI 新提交 57%

Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning

内化未来:一种统一的世界模型规划智能体训练范式

Xuan Zhang, Zhijian Zhou, Lingfeng Qiao, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出一种三阶段训练范式(WM-AMT、FE-SFT、FC-RL),使LLM智能体内化世界模型以进行前瞻性规划,在搜索和数学推理任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26907 2026-06-29 cs.CV 新提交 57%

Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation

Qwen-Image-Agent:弥合真实世界图像生成中的上下文差距

Zekai Zhang, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiaoyue Chen, Xiao Xu, Yan Shu, Yanran Zhang, Yixian Xu, Yuxiang Chen, Zhendong Wang, Zihao Liu, Zikai Zhou, Huishuai Zhang, Dongyan Zhao, Chenfei Wu

机构 * Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation(Qwen-Image-Agent:弥合现实世界图像生成中的上下文缺口)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出Qwen-Image-Agent框架,通过上下文感知规划和上下文接地,整合规划、推理、搜索、记忆和反馈,弥合用户上下文与生成上下文之间的差距,在IA-Bench等基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09774 2026-06-29 cs.AI cs.CL 新提交 57%

Auto-Configuring Scientific Simulators with Lightweight Coding-Agent Adapters

SIGA: 用于科学模拟的自演化编码智能体适配器

Matthew Ho, Brian Liu, Jixuan Chen, Audrey Wang, Lianhui Qin

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出SIGA适配器,通过检索、程序记忆、轨迹内验证和验证强制终止,将通用编码智能体转化为科学模拟软件操作员,在GEOS上实现36倍加速,并支持自演化提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20094 2026-06-29 cs.AI 版本更新 57%

CausalFlip: A Benchmark for LLM Causal Judgment Beyond Semantic Matching

CausalFlip: 超越语义匹配的LLM因果判断基准

Yuzhe Wang, Yaochen Zhu, Jundong Li

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出CausalFlip基准,通过构建语义相似但因果答案相反的问题对和噪声前缀评估,揭示LLM依赖语义匹配而非因果推理,并验证内化因果推理方法可提升因果基础。

Comments 8 pages plus references, 3 figures, 3 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03217 2026-06-29 cs.CL cs.AI cs.CY cs.IR 版本更新 57%

Hybrid Fact-Checking that Integrates Knowledge Graphs, Large Language Models, and Search-Based Retrieval Agents Improves Interpretable Claim Verification

混合事实核查:集成知识图谱、大语言模型和基于搜索的检索代理提高可解释的声明验证

Shaghayegh Kolli, Richard Rosenbaum, Timo Cavelius, Lasse Strothe, Andrii Lata, Jana Diesner

机构 * Technical University Munich(慕尼黑工业大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出一种混合事实核查方法,集成知识图谱、大语言模型和实时搜索代理,通过三步流水线(KG检索、LM分类、Web搜索)在FEVER基准上达到0.93 F1分数,无需微调,并有效处理信息不足情况。

Comments Paper has been accepted at 9th wiNLP workshop at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07460 2026-06-29 cs.CV cs.CL 版本更新 57%

SIGNER: Temporally Grounded Sign Language Generation via Time-Resolved Conditioning

SIGNER: 通过时间分辨条件实现时间对齐的手语生成

Taeryung Lee, Hyeongjin Nam, Gyeongsik Moon, Kyoung Mu Lee

机构 * IPAI Dept. of ECE & ASRI, Seoul National University(首尔大学电子与计算机工程系及ASRI) Dept. of CSE, Korea University(高丽大学计算机科学与工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出SIGNER框架,通过时间分辨条件(时间-词汇条件与局部时间融合)确保手语生成中词汇顺序正确和语义准确,在Phoenix-2014T和CSL-Daily上达到最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27325 2026-06-26 cs.CV 新提交 57%

Not All Actions Are Equal: Rethinking Conditioning for Dexterous World Model

并非所有动作都同等重要:重新思考灵巧世界模型的条件化

Zizhao Yuan, Zhengtu Liang, Taowen Wang, Qiwei Liang, Yichi Wang, Yunheng Wang, Yuetong Fang, Lusong Li, Zecui Zeng, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学) Beijing University of Technology(北京工业大学) JD Explore Academy(京东探索研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对高自由度灵巧动作中不同分量重要性不均导致优化失衡的问题,提出DexAC-WM,通过动作标记化保留维度级语义,结合局部细化与全局调制对齐动作与视觉动态,并引入语义分支提供物体场景先验,显著提升视频预测的真实感和动作一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27307 2026-06-26 cs.CV 新提交 57%

See & Sniff: Learning Visuo-Olfactory Representations

See & Sniff: 学习视觉-嗅觉表征

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Hankuk University of Foreign Studies(韩国外国语大学) Ulsan National Institute of Science and Technology(蔚山科学技术院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出SmellNet-V数据集和See & Sniff自监督框架,通过密集局部对齐学习联合视觉-嗅觉表征,实现气味分类、跨模态检索和气味定位,性能提升7%。

Comments ECCV 2026. Project Page: https://mm.kaist.ac.kr/projects/SeeandSniff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26807 2026-06-26 cs.AI cs.CL 新提交 57%

KARLA: Knowledge-base Augmented Retrieval for Language Models

KARLA:基于知识库增强的语言模型检索

Francois Crespin, Fabian M. Suchanek, Nils Holzenberger

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出一种新方法,使LLM在生成过程中自动从知识库提取事实知识,支持知识更新、可追溯性和小模型的高事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26741 2026-06-26 cs.RO cs.CV 新提交 57%

PressMimic: Pressure-Guided Motion Capture and Control for Humanoid Robot Imitation

PressMimic: 压力引导的动作捕捉与控制用于人形机器人模仿

Yi Lu, Shenghao Ren, Tianyu Xiong, Zhaoxiang Li, Jiaqi Li, He Zhang, Tao Yu, Qiu Shen, Xun Cao

机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) Key Laboratory of Optoelectronic Devices and Systems with Extreme Performances of MOE, Nanjing University(南京大学极端性能光电技术与系统教育部重点实验室) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出PressMimic框架,通过压力模态融合RGB估计3D姿态和全局运动,并利用压力监督策略实现物理一致的接触模式,提升人形机器人模仿的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26458 2026-06-26 cs.AI 新提交 57%

MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation

MKG-RAG-Bench:多模态知识图谱增强生成中的检索基准

Xiaochen Wang, Bao Hoang, Han Liu, Ting Wang, Fenglong Ma

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Michigan State University(密歇根州立大学) Dalian University of Technology(大连理工大学) Stony Brook University(石溪大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出MKG-RAG-Bench基准,通过构建跨领域多模态知识图谱和问答数据集,系统评估多模态知识图谱增强生成中的检索性能,揭示检索质量对生成结果的决定性作用。

Comments Accepted by KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26437 2026-06-26 cs.CL cs.AI 新提交 57%

ConflictScore: Identifying and Measuring How Language Models Handle Conflicting Evidence

ConflictScore: 识别和衡量语言模型如何处理冲突证据

Siyi Liu, Aaron Halfaker, Dan Roth, Patrick Xia

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出ConflictScore指标,通过将回答分解为原子声明并与证据文档对比,量化模型对冲突证据的识别程度,实验表明该指标能有效检测过度自信声明并提升真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21097 2026-06-26 cs.CL cs.LG 新提交 57%

GRAG: Generic Response-Augmented Generation Framework for Personalized Conversational Systems

GRAG:面向个性化对话系统的通用响应增强生成框架

Junfeng Liu, Christopher T. Symons, Ranga Raju Vatsavai

机构 * North Carolina State University(北卡罗来纳州立大学) Lirio, Inc.(Lirio公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出GRAG框架,通过离线通用响应解耦内容基础与个性化,使小模型在资源受限环境中专注于个性化注入,性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24498 2026-06-24 cs.CV 新提交 57%

VistaRef: Boosting Visual Spatial Orientation Awareness for Pointing-to-Object Detection

VistaRef: 提升指向目标检测的视觉空间方位感知能力

Ling Li, Zhizhen Cai, Xinkun Wu, Ziyu Zhu, Jiaqing Lyu, Bowen Liu, Zhidong Deng

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Dalian University of Technology(大连理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出VistaRef框架,通过局部手部实体建模和几何射线建模模块增强空间方位感知,并引入方向一致性对齐损失,在指向目标检测任务中实现14个绝对点的精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24464 2026-06-24 cs.CV 新提交 57%

Boosting Text-Driven Video Segmentation via Geometry-Aware Distillation

通过几何感知蒸馏提升文本驱动视频分割

Tianyu Zhu, Yingping Liang, Hesong Li, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出GeoLaV两阶段框架,通过单目几何预训练和几何感知蒸馏,将3D几何知识从图像迁移到视频,提升文本驱动视频分割的时空一致性和语言定位能力,在多个基准上达到最优。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24414 2026-06-24 cs.AI 新提交 57%

Cycle-Consistent Neural Explanation of Formal Verification Certificates

形式验证证书的循环一致性神经解释

Andoni Rodriguez, Alberto Pozanco, Daniel Borrajo

机构 * J.P. Morgan AI Research(摩根大通人工智能研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出循环一致性神经架构,通过前向和逆向网络结合符号验证器,生成忠实于形式验证证书的自然语言解释,在金融合规领域测试中达到90.0%的循环验证正确性,比多LLM基线高13.9个百分点。

Comments 15 pages of main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24333 2026-06-24 cs.CV 新提交 57%

UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation

UniTranslator:一种用于端到端图像内机器翻译的统一多模态框架

Jiahao Lyu, Pei Fu, Zhenhang Li, Shaojie Zhang, Jiahui Yang, Yu Zhou, Can Ma, Zhenbo Luo, Jian Luan

机构 * MiLM Plus, Xiaomi Inc(小米公司MiLM Plus) Binghamton University(宾汉姆顿大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出UniTranslator统一框架,通过理解-生成对齐模块和空间掩码解码器解决翻译理解与文本编辑的冲突及空间错位问题,在多个基准上实现最先进性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23915 2026-06-24 cs.CL cs.IR cs.LG 新提交 57%

Do LLM Attribution Metrics Transfer? Auditing Retrieval-Augmented Generation Evaluation Across Datasets and Constructs

LLM归因指标是否可迁移?跨数据集和构念的检索增强生成评估审计

Tianyu Ding, Aditya Nannapaneni, Juan Pablo De la Cruz Weinstein

机构 * Amazon Web Services(亚马逊云服务)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本研究审计了八种自动归因评分器在三个评估构念上的表现,发现没有评分器能在所有数据集上保持最佳性能,指标排名会反转,且简单选择最佳平均评分器会导致显著遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22775 2026-06-24 stat.ME cs.LG 新提交 57%

Target-Aware Linear Regression Under Distribution Shift

分布漂移下的目标感知线性回归

Zhewen Hou, Tian Zheng

机构 * Department of Statistics(统计学系) Columbia University(哥伦比亚大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 针对训练与部署间的分布漂移,提出混合损失估计器作为目标感知基准,并开发了约束矩匹配和两阶段估计两种计算可行方案,推导渐近均方误差并比较性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23448 2026-06-23 cs.LG 新提交 57%

Selective Time Series Forecasting via Metalearning

通过元学习进行选择性时间序列预测

Ricardo Inácio, Vitor Cerqueira, Marília Barandas, Carlos Soares

机构 * Faculdade de Engenharia da Universidade do Porto(波尔图大学工程学院) University of Coimbra(科英布拉大学) Fraunhofer Portugal AICOS(弗劳恩霍夫葡萄牙AICOS)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 提出基于元学习的框架,利用滞后结构特征建模误差百分位数,实现跨域选择性预测,在域内和迁移学习中提升预测精度。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23270 2026-06-23 cs.CV 新提交 57%

BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing

BoxCtrl: 面向几何图像编辑的3D感知视觉提示

Feifei Wang, Shiyuan Yang, Xiaoyu Li, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 提出BoxCtrl框架,通过投影到2D的RGB 3D边界框作为视觉提示,结合监督微调与强化学习两阶段训练,实现精确的3D几何编辑(平移、旋转、缩放等),达到最先进性能。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏