arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11875
2603.16429 2026-03-18 astro-ph.IM cs.AI cs.CV

LenghuSky-8: An 8-Year All-Sky Cloud Dataset with Star-Aware Masks and Alt-Az Calibration for Segmentation and Nowcasting

LenghuSky-8: 一个8年全天云数据集,配备星 aware 掩码和 altitude-azimuth 校准,用于分割和现在预测

Yicheng Rui, Xiao-Wei Duan, Licai Deng, Fan Yang, Zhengming Dang, Zhengjun Du, Junhao Peng, Wenhao Chu, Umut Mahmut, Kexin Li, Yiyun Wu, Fabo Feng

机构 * State Key Laboratory of Dark Matter Physics, Tsung-Dao Lee Institute & School of Physics and Astronomy, Shanghai Jiao Tong University(暗物质物理国家重点实验室、李政道研究所及物理天文学院、上海交通大学) National Astronomical Observatories, Chinese Academy of Sciences(中国科学院国家天文台) School of Computer Technology and Application, Qinghai University(青海大学计算机技术与应用学院)

AI总结 本文提出LenghuSky-8数据集,包含8年全天影像,提供星 aware 掩码和Alt-Az校准,用于云分割和现在预测,通过线性探针训练获得高分割精度,并引入短周期现在预测基准测试。

Comments CVPR Findings accepted. 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16129 2026-03-18 cs.CV

Boosting Quantitive and Spatial Awareness for Zero-Shot Object Counting

提升零样本物体计数的定量与空间意识

Da Zhang, Bingyu Li, Feiyu Wang, Zhiyuan Zhao, Junyu Gao

机构 * Northwestern Polytechnical University(西北工业大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学)

AI总结 本文提出QICA框架,通过引入协同提示策略和成本聚合解码器,提升零样本物体计数的定量感知和空间聚合能力,实验表明其在多个数据集上具有优越的泛化性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16092 2026-03-18 cs.CV cs.AI cs.LG

Parallel In-context Learning for Large Vision Language Models

大规模视觉语言模型的并行上下文学习

Shin'ya Yamaguchi, Daiki Chijiwa, Tamao Sakao, Taku Hasegawa

机构 * NTT(日本电信电话研究所)

AI总结 本文提出并行上下文学习方法,通过将长上下文分割为短片段并行处理,提升大视觉语言模型的推理效率,同时保持性能与传统多模态上下文学习相当。

Comments Accepted to CVPR 2026 (Findings); Code is available at https://github.com/yshinya6/parallel-icl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16001 2026-03-18 cs.CV cs.CL cs.LG

Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models

大部分文本,智能视觉:不对称文本-视觉剪枝用于大型视觉-语言模型

Sijie Li, Biao Qian, Jungong Han

机构 * University of Sheffield, UK(英国谢菲尔德大学) Tsinghua University, China(清华大学)

AI总结 本文提出不对称文本-视觉剪枝方法,通过解耦文本和视觉token的权重,发现文本路径需用文本token校准,视觉路径可实现50%稀疏率,验证了其在多模态基准上的优越性。

Comments CVPR 2026. Code available here: https://github.com/LezJ/ATV-Pruning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14610 2026-03-18 cs.CV eess.IV

Make it SING: Analyzing Semantic Invariants in Classifiers

使分类器具备语义不变性:分析分类器中的语义不变性

Harel Yadid, Meir Yossef Levi, Roy Betser, Guy Gilboa

机构 * Viterbi Faculty of Electrical and Computer Engineering(电气与计算机工程学院)

AI总结 本文提出SING方法,通过构建等价图像并赋予语义解释,揭示分类器中语义不变性,分析不同模型在保持语义方面的差异。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13858 2026-03-18 cs.CV

Learning through Creation: A Hash-Free Framework for On-the-Fly Category Discovery

通过创造学习:一种无哈希的实时类别发现框架

Bohan Zhang, Weidong Tang, Zhixiang Chi, Yi Jin, Zhenbo Li, Yang Wang, Yanan Wu

机构 * College of Information and Electrical Engineering(信息与电气工程学院) China Agricultural University(中国农业大学) Department of Electrical and Computer Engineering(电气与计算机工程系) University of Toronto(多伦多大学) School of Computer and Information Technology(计算机与信息科技学院) Beijing Jiaotong University(北京交通大学) Department of Computer Science and Software Engineering(计算机科学与软件工程系) Concordia University(Concordia大学)

AI总结 本文提出LTC框架,通过在线伪未知生成器实现实时类别发现,提升模型对未知区域的识别能力,在七个基准测试中取得显著提升。

Comments Accepted to CVPR 2026 Findings. Code available at https://github.com/brandinzhang/LTC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06289 2026-03-18 cs.CV

FlowMotion: Training-Free Flow Guidance for Video Motion Transfer

FlowMotion: 无需训练的视频运动迁移流动引导

Zhen Wang, Youcan Xu, Jun Xiao, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) State key lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 本文提出FlowMotion,一种无需训练的视频运动迁移框架,通过直接利用基于流动的T2V模型预测输出,实现高效灵活的运动迁移。通过提取潜在预测的运动表示,对齐源视频与生成视频的运动模式,并引入速度正则化策略以稳定优化。

Comments CVPR 2026, Code: https://github.com/HKUST-LongGroup/FlowMotion

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00512 2026-03-18 cs.CV

Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding

基于语义边界的小波帧选择用于长视频理解

Wang Chen, Yuhui Zeng, Yongdong Luo, Tianyu Xie, Luojun Lin, Jiayi Ji, Yan Zhang, Xiawu Zheng

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

AI总结 本文提出WFS-SB方法,通过小波变换检测语义边界,提升长视频中大视觉语言模型的性能,实验显示在多个基准上均优于现有方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24144 2026-03-18 cs.CV

Fixed Anchors Are Not Enough: Dynamic Retrieval and Persistent Homology for Dataset Distillation

固定锚点不足以:动态检索与持续同调用于数据集蒸馏

Muquan Li, Hang Gou, Yingyi Ma, Rongzheng Wang, Ke Qin, Tao He

机构 * The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室)

AI总结 本文提出RETA框架,通过动态检索和持续同调改进数据集蒸馏,提升合成图像的多样性和泛化能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21637 2026-03-18 cs.CV

CARE: A Molecular-Guided Foundation Model with Adaptive Region Modeling for Whole Slide Image Analysis

CARE:一种具有自适应区域建模的分子引导基础模型用于全切片图像分析

Di Zhang, Zhangpeng Gong, Xiaobo Pang, Jiashuai Liu, Junbo Lu, Hao Cui, Jiusong Ge, Zhi Zeng, Kai Yi, Yinghua Li, Si Liu, Tingsong Yu, Haoran Wang, Mireia Crispin-Ortuzar, Weimiao Yu, Chen Li, Zeyu Gao

机构 * Xi’an Jiaotong University(西安交通大学) University of Cambridge(剑桥大学) KingMed(康方生物) BGI Research(贝登基因研究院) A ⋆ STAR

AI总结 CARE通过自适应区域建模和分子引导,提升全切片图像分析的性能,实现对病理区域的精准识别与分类,优于现有基础模型。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16635 2026-03-18 cs.CV cs.LG

SARMAE: Masked Autoencoder for SAR Representation Learning

SARMAE:用于SAR表示学习的遮蔽自动编码器

Danxu Liu, Di Wang, Hebaixu Wang, Haoyang Chen, Wentao Jiang, Yilin Cheng, Haonan Guo, Wei Cui, Jing Zhang

机构 * School of Information and Electronics, Beijing Institute of Technology, Beijing, China(北京理工大学信息与电子学院,北京,中国) School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,武汉,中国) School of Electronic Information, Wuhan University, Wuhan, China(武汉大学电子信息学院,武汉,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院,上海,中国) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University, Wuhan, China(武汉大学测绘遥感信息工程国家重点实验室,武汉,中国)

AI总结 本文提出SARMAE,通过构建SAR-1M数据集和引入Speckle-Aware Representation Enhancement与Semantic Anchor Representation Constraint,提升SAR图像在多任务中的表现。

Comments The paper is accepted by CVPR 2026! Code and models will be available at https://github.com/MiliLab/SARMAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11237 2026-03-18 cs.CV cs.GR

WildCap: Facial Albedo Capture in the Wild via Hybrid Inverse Rendering

WildCap:通过混合反向渲染实现野外面部铝含量捕获

Yuxuan Han, Xin Ming, Tianxiao Li, Zhuofan Shen, Qixuan Zhang, Lan Xu, Feng Xu

机构 * School of Software and BNRist, Tsinghua University(软件学院和BNRist,清华大学) ShanghaiTech University(上海科技大学) Deemos Technology(德摩斯技术)

AI总结 本文提出WildCap,一种通过混合反向渲染在野外从手机视频中实现高质量面部铝含量捕获的方法,解决了复杂光照下的铝含量分离问题。

Comments CVPR 2026. project page: https://yxuhan.github.io/WildCap/index.html; code: https://github.com/yxuhan/WildCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04761 2026-03-18 cs.CV

Order Matters: 3D Shape Generation from Sequential VR Sketches

顺序至关重要:从连续VR草图生成3D形状

Yizi Chen, Sidi Wu, Tianyi Xiao, Nina Wiedemann, Loic Landrieu

AI总结 本文提出VRSketch2Shape框架,通过顺序感知的草图编码器和扩散生成器,提升从VR草图生成3D形状的几何精度与泛化能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21083 2026-03-18 cs.RO

Dual-Agent Reinforcement Learning for Adaptive and Cost-Aware Visual-Inertial Odometry

双代理强化学习用于自适应和成本感知的视觉惯性里程计

Feiyang Pan, Shenghe Zheng, Chunyan Yin, Guangbin Dou

机构 * Southeast University(东南大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出双代理强化学习框架,通过智能选择代理和融合代理优化视觉惯性里程计的运行时机和信任度,提升精度与效率的平衡。

Comments Accepted to the CVPR 2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19117 2026-03-18 cs.CV physics.optics

3M-TI: High-Quality Mobile Thermal Imaging via Calibration-free Multi-Camera Cross-Modal Diffusion

3M-TI: 通过无校准多相机跨模态扩散实现高质量移动热成像

Minchong Chen, Xiaoyun Yuan, Junzhe Wan, Jianing Zhang, Jun Zhang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能联合实验室,人工智能研究院,上海交通大学) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 本文提出3M-TI,一种无需校准的多相机跨模态扩散框架,通过跨模态自注意力模块提升热成像的分辨率和细节,验证其在实际应用中的优越性能。

Comments Accepted by CVPR 2026, Code: https://github.com/work-submit/3MTI, Project page: https://lab.xiaoyunyuan.net/index.html?project=3m-ti

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18444 2026-03-18 cs.CV

SineProject: Machine Unlearning for Stable Vision Language Alignment

SineProject:用于稳定视觉语言对齐的机器反遗忘

Arpit Garg, Hemanth Saratchandran, Simon Lucey

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

AI总结 SineProject通过在冻结的投影器中加入正弦调制的可训练参数,提升Jacobian的谱条件数,稳定反遗忘过程中的视觉语言对齐,减少无害查询拒绝并实现目标信息遗忘。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10376 2026-03-18 cs.CV cs.RO

MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation

MSGNav: 释放多模态3D场景图在零样本具身导航中的潜力

Xun Huang, Shijia Zhao, Yunxiang Wang, Xin Lu, Wanfa Zhang, Rongsheng Qu, Weixin Li, Yunhong Wang, Chenglu Wen

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建智能感知与计算重点实验室) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算重点实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院)

AI总结 MSGNav通过多模态3D场景图实现零样本具身导航,引入关键子图选择模块、自适应词汇更新模块和闭环推理模块,解决开放词汇和视觉证据保留问题,实验表明其在GOAT-Bench和HM3D-ObjNav基准上表现优异。

Comments 18 pages, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02580 2026-03-18 cs.CV cs.AI cs.GR cs.LG

TAUE: Training-free Noise Transplant and Cultivation Diffusion Model

TAUE:无需训练的噪声移植与培育扩散模型

Daichi Nagai, Ryugo Morita, Shunsuke Kitada, Hitoshi Iyatomi

机构 * Faculty of Science and Engineering, Hosei University(恒河大学科学与工程学院) RPTU Kaiserslautern-Landau & DFKI GmbH(凯撒斯劳滕-兰道大学与DFKI GmbH)

AI总结 TAUE提出无需训练的噪声移植与培育扩散模型,通过嵌入全局结构信息和语义线索,实现多层图像生成,提升跨层一致性并支持新应用。

Comments Accepted to CVPR 2026 Findings. The first two authors contributed equally. Project Page: https://iyatomilab.github.io/TAUE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09881 2026-03-18 cs.CV

LTGS: Long-Term Gaussian Scene Chronology From Sparse View Updates

LTGS: 从稀疏视角更新中获取长期高斯场景时间线

Minkwan Kim, Seungmin Lee, Junho Kim, Young Min Kim

机构 * Dept. of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Interdisciplinary Program in Artificial Intelligence and INMC, Seoul National University(人工智能跨学科项目及INMC,首尔国立大学)

AI总结 本文提出LTGS方法,通过稀疏视角更新高效表示日常场景变化,利用模板高斯作为结构先验,提升3D环境的时间演化可扩展性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13911 2026-03-18 cs.CV

PhysGM: Large Physical Gaussian Model for Feed-Forward 4D Synthesis

PhysGM:用于前馈4D合成的大型物理高斯模型

Chunji Lv, Zequn Chen, Donglin Di, Weinan Zhang, Hao Li, Wei Chen, Yinjie Lei, Changsheng Li

机构 * Beijing Institute of Technology(北京理工大学) Li Auto(利汽车) Harbin Institute of Technology(哈尔滨工业大学) Sichuan University(四川大学) Suzhou Research Institute, Harbin Institute of Technology(哈尔滨工业大学苏州研究院)

AI总结 PhysGM通过单图像联合预测3D高斯表示和物理属性,实现高效4D渲染。该方法采用物理感知重建模型和直接偏好优化,提升模拟精度并降低计算成本。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13353 2026-03-18 cs.CV cs.AI

VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding

VideoITG: 多模态视频理解中的指导性时间定位

Shihao Wang, Guo Chen, De-an Huang, Zhiqi Li, Minghan Li, Guilin Liu, Jose M. Alvarez, Lei Zhang, Zhiding Yu

机构 * The Hong Kong Polytechnic Univ(香港理工大学) Nanjing Univ(南京大学) NVIDIA(NVIDIA公司) Harvard Univ(哈佛大学)

AI总结 VideoITG通过设计VidThinker流水线,自动生成指令条件化描述,检索相关视频片段并选择关键帧,提升多模态视频理解任务的性能。

Comments Accepted by CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20107 2026-03-18 cs.LG cs.CV

Refining Few-Step Text-to-Multiview Diffusion via Reinforcement Learning

通过强化学习细化少步文本到多视图扩散模型

Ziyi Zhang, Li Shen, Deheng Ye, Yong Luo, Huangxuan Zhao, Meng Liu, Wei Yu, Lefei Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(计算机学院、多媒体软件国家工程研究中心和湖北多媒体与网络通信工程重点实验室、武汉大学) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学信息科学与技术学院深圳校区) Tencent Inc.(腾讯公司) Xiaomi Inc., China(小米公司,中国)

AI总结 本文提出MVC-ZigAL框架,通过联合视图奖励模型和自适应优化策略,提升少步多视图扩散模型的生成质量和一致性。

Comments Accepted to CVPR 2026

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11192 2026-03-18 cs.CV cs.AI

FALCON: False-Negative Aware Learning of Contrastive Negatives in Vision-Language Alignment

FALCON:视觉-语言对齐中对比负样本的假阴性感知学习

Myunsoo Kim, Seongwoong Shim, Byung-Jun Lee

机构 * Korea University(韩国大学)

AI总结 FALCON通过动态选择合适难度的负样本平衡硬负样本与假阴性,提升视觉-语言对齐性能,验证其在多种框架和任务中的有效性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03442 2026-03-18 cs.CV

High-Quality Facial Geometry and Appearance Capture at Home

在家中的高质量面部几何与外观捕捉

Yuxuan Han, Junfeng Lyu, Feng Xu

机构 * School of Software and BNRist, Tsinghua University(软件学院和BNRist,清华大学)

AI总结 本文提出了一种易用的系统,能够在暗室中通过手机闪光灯序列捕捉高质量的完整面部模型,包括皮肤、口腔、头发和眼睛。

Comments CVPR 2024. Project page: https://yxuhan.github.io/CoRA/index.html ; Github repo: https://github.com/yxuhan/CoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15800 2026-03-18 cs.CV cs.CL cs.CR

Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化

Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。

Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15780 2026-03-18 cs.CV cs.AI cs.GR cs.LG

Parallelised Differentiable Straightest Geodesics for 3D Meshes

并行可微的3D网格最直测地线

Hippolyte Verninas, Caner Korkmaz, Stefanos Zafeiriou, Tolga Birdal, Simone Foti

机构 * Imperial College London(帝国理工学院伦敦分校)

AI总结 本文提出一种并行可微的3D网格最直测地线方法,通过GPU实现并设计两种不同求导方案,提升在非欧几里得域上的学习与优化性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15656 2026-03-18 cs.LG cs.AI cs.CV

Attribution-Guided Model Rectification of Unreliable Neural Network Behaviors

基于归因的不可靠神经网络行为模型修正

Peiyu Yang, Naveed Akhtar, Jiantong Jiang, Ajmal Mian

机构 * The University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

AI总结 本文提出基于归因的模型修正框架,通过秩一模型编辑有效定位并修正模型不可靠行为,减少对清洁样本的依赖,提升模型鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06993 2026-03-18 cs.AI cs.CV

IMAIA: Interactive Maps AI Assistant for Travel Planning and Geo-Spatial Intelligence

IMAIA:交互式地图AI助手用于旅行规划和地理空间智能

Jieren Deng, Zhizhang Hu, Ziyan He, Aleksandar Cvetkovic, Pak Kiu Chung, Dragomir Yankov, Chiqun Zhang

机构 * Microsoft(微软) Amazon(亚马逊)

AI总结 IMAIA通过自然语言交互整合矢量地图和卫星影像,结合地理空间信息提升地图相关问答和摄像头到地点的关联能力,实现空间感知的对话式地图系统。

Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15616 2026-03-17 cs.CV

GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering

GlyphPrinter: 基于区域分组的直接偏好优化用于精确的视觉文本渲染

Xincheng Shuai, Ziye Li, Henghui Ding, Dacheng Tao

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(大数据研究院,计算机科学与人工智能学院,复旦大学) Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,计算与数据科学学院,南洋理工大学)

AI总结 本文提出GlyphPrinter,通过区域分组直接偏好优化提升文本渲染的字形准确性,引入区域级字形偏好标注和区域优化目标,有效解决复杂或非领域字符的字形误差问题。

Comments CVPR 2026, Project Page: https://henghuiding.com/GlyphPrinter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15475 2026-03-17 cs.CV cs.LG cs.RO eess.IV

Seeing Beyond: Extrapolative Domain Adaptive Panoramic Segmentation

超越视界:外推式领域自适应全景分割

Yuanfan Zheng, Kunyu Peng, Xu Zheng, Kailun Yang

机构 * Hunan University(湖南大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) HKUST(GZ)(香港科技大学(广州))

AI总结 本文提出EDA-PSeg框架,通过局部视角训练和全360度全景测试,解决跨领域几何视角扭曲和语义不确定性问题,实现先进性能和鲁棒性。

Comments Accepted to CVPR 2026. The code is available at https://github.com/zyfone/EDA-PSeg

详情

展开后加载摘要…

URL PDF HTML 收藏