arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

共收录 552
2606.31100 2026-07-01 cs.CV 新提交

TaxoMIL: Taxonomy-Constrained Learning for Hierarchical Whole Slide Image Analysis

TaxoMIL:用于层次化全切片图像分析的分层约束学习

Chaeyeon Lee, Khang Nguyen Quoc, Jinsol Song, Yosep Chong, Kwangil Yim, Jin Tae Kwak

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Hospital Pathology, The Catholic University of Korea College of Medicine(韩国天主教大学医学院医院病理学系)

AI总结 提出TaxoMIL框架,将WSI诊断重构为多粒度文本生成任务,通过双头Transformer解码器和分类学引导目标,实现层次感知的准确预测。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31096 2026-07-01 cs.CV 新提交

Horizon3D: Sparse Radar-Camera Fusion for Long-Range 3D Perception in Autonomous Driving

Horizon3D: 用于自动驾驶远距离3D感知的稀疏雷达-相机融合

Geonho Bang, Geunju Baek, Dongyoung Lee, Wonjun Jeong, Jun Won Choi

机构 * Seoul National University(首尔大学)

AI总结 提出Horizon3D框架,通过高斯原语与稀疏BEV特征融合,结合双路径时序融合,实现远距离雷达-相机3D检测,在TruckScenes上达到SOTA性能。

Comments Accepted to ECCV 2026. Project page: https://geonhobang.github.io/horizon3d-project-page. Code: https://github.com/geonhobang/ECCV2026_Horizon3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31071 2026-07-01 cs.CV cs.RO 新提交

Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation

层次化3D场景图构建与基于信念的语义导航规划

Bing Wu, Zuyao Chen, Changwen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

AI总结 提出零样本语义导航框架,通过在线维护层次化3D场景图(HSG)实现多粒度语义拓扑,并基于信念规划进行有限视野推演,在长距离导航中显著提升成功率与路径效率。

Comments Camera-ready version accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31065 2026-07-01 cs.CV 新提交

Diffusion-Based Material Regularization for Physics-Based Inverse Rendering

基于扩散的材料正则化用于物理逆渲染

Jingwang Ling, Lifan Wu, Feng Xu, Shuang Zhao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达) BNRist and School of Software, Tsinghua University(清华大学软件学院及北京国家信息科学与技术研究中心)

AI总结 提出将扩散模型预测作为相似性核,通过正则化损失约束材料优化,联合重建几何、材质和光照,在多个数据集上显著优于现有方法。

Comments Accepted to ECCV 2026. Includes supplementary material. Project page: https://gerwang.github.io/diffusion-regularized-inverse-rendering/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31054 2026-07-01 cs.CV cs.AI cs.CL cs.MM 新提交

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Ltd.(华为技术有限公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)

AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31050 2026-07-01 cs.CV cs.AI 新提交

Learning Video Dynamics with Predictive Differentiable Rendering

基于预测可微渲染的视频动态学习

Yujin Tang, Tian Zhou, Xin Lin, Cheng Tan, Yifan Hu, Rong Jin, SouYoung Jin, Liang Sun

机构 * Dartmouth College(达特茅斯学院) DAMO Academy, Alibaba Group(阿里巴巴达摩院) University of California, San Diego(加州大学圣地亚哥分校) Westlake University(西湖大学) Tsinghua University(清华大学) Ant Group(蚂蚁集团)

AI总结 提出预测可微渲染(PDR)框架,通过2D高斯表示的轻量适配器PredGS和CUDA加速渲染器predgsplat,结合L1和SSIM损失优化,在离散像素与连续表示间架桥,显著提升视频预测的细节保真度和准确性。

Comments Accepted by ECCV 2026. 18 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31029 2026-07-01 cs.CV 新提交

TerraDiT-$Ω$: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive

TerraDiT-$\Omega$:任意地理基元的卫星图像合成统一空间控制

Brian Wei, Srikumar Sastry, Daniel Cher, Eric Xing, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

AI总结 提出TerraDiT-Ω框架,通过几何感知局部注意力机制,支持从任意原生地理基元(多边形、折线、边界框、点)直接生成卫星图像,在多种控制格式下优于密集和稀疏控制基线,并提升下游任务性能。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31026 2026-07-01 cs.LG cs.AI 新提交

OTCache: Optimal Transport for Geometry-Aware Caching in Diffusion Models

OTCache: 扩散模型中的几何感知缓存的最优传输

Huanlin Gao, Fang Zhao, Qiang Hui, Fuyuan Shi, Shaoan Zhao, Yantao Li, Chao Tan, Ting Lu, Yuren You, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通联通数据智能) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

AI总结 提出OTCache,一种无需训练的扩散采样加速框架,通过最优传输预测缓存调度,在低NFE区域优于图方法,实现4.5倍以上加速并保持生成质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31018 2026-07-01 cs.CV 新提交

WarpI2I: Image Warping for Image-to-Image Translation

WarpI2I:用于图像到图像翻译的图像扭曲

Shen Zheng, Anurag Ghosh, Gaurav Parmar, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出一种基于显著性的扭曲-反扭曲框架,通过重新分配空间表示至显著区域,在不增加潜在分辨率的情况下保留图像细节,适用于人体重光照、驾驶场景翻译等任务。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30875 2026-07-01 cs.CV cs.AI cs.LG 新提交

The Label Imitation Game: Turing Test Network for Zero-Shot Pseudo-Label Pruning

标签模仿游戏:用于零样本伪标签剪枝的图灵测试网络

Brent A. Griffin, Jason J. Corso

AI总结 提出图灵测试网络(TTN)作为任务无关的“裁判”,通过对抗性交互在数据集上下文中评估伪标签,无需监督或重训练即可提升标签准确性,并实现零样本任务迁移。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30849 2026-07-01 cs.CV cs.SD eess.AS 新提交

SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation

SyncCache: 利用非对称动力学实现快速音频驱动肖像动画

Juncheng Ma, Yuxuan Du, Yanan Sun, Zhening Xing, Changlin Li, Zhenyu Tang, Bo Li, Peng-Tao Jiang, Li Yuan, Daquan Zhou, Yonghong Tian

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Shanghai AI Laboratory(上海人工智能实验室) Tencent Hunyuan(腾讯混元) vivo

AI总结 提出SyncCache,一种针对DiT肖像动画的无训练缓存加速方法,通过空间非对称探测和模态解耦缓存利用非对称动力学,实现高达4.12倍加速且保持视觉保真度和音频对齐。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30811 2026-07-01 cs.CV cs.MM cs.SD eess.AS 新提交

AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

AVTok: 用于整体音视频生成的1D统一分词化

Kien T. Pham, I Chieh Chen, Qifeng Chen, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出AVTok统一分词器,采用双流Transformer架构和分层训练策略,将音视频对编码为紧凑的一维潜在表示,在音视频重建及下游生成任务中表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30777 2026-07-01 cs.CV 新提交

Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings

通过潜在场景嵌入揭示轨迹预测中的可迁移性

Theodor Westny, David Axelsson, Björn Olofsson, Erik Frisk

机构 * Linköping University(林雪平大学) Lund University(隆德大学)

AI总结 提出一个学习数据集潜在表示并用量化分布指标衡量相似性的框架,在24个数据集上验证迁移分数与跨数据集模型性能强相关,为数据集选择、预训练和基础模型提供指导。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28142 2026-07-01 cs.LG 新提交

MixTTA: Low-Rank Cross-Channel Mixing for Reliable Test-Time Adaptation

MixTTA: 用于可靠测试时自适应的低秩跨通道混合

Mansoo Jung, Youngwook Kim, Jungwoo Lee

机构 * Seoul National University(首尔大学) Kookmin University(国民大学) HodooAI Labs(HodooAI实验室)

AI总结 提出MixTTA模块,通过低秩跨通道变换增强归一化层,解决分布偏移下通道间结构变化问题,提升测试时自适应方法的鲁棒性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27922 2026-07-01 cs.CV cs.AI 新提交

Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding

Reflect-R1:长视频理解中基于证据驱动的自纠正反思

Shuimu Chen, Yuteng Chen, Yuanshen Guan, Zebang Cheng, Zeyu Zhang, Shengqian Qin, Bin Xia, Jiaran Li, Wenming Yang, Fei Ma

机构 * Tsinghua University(清华大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) University of California(加利福尼亚大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出Reflect-R1框架,通过直觉、验证、仲裁三阶段管道动态检索客观视觉证据,并设计阶段解耦强化学习算法SD-GRPO解决策略耦合,在长视频理解基准上达到最优性能。

Comments 2026 ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27313 2026-07-01 cs.CV 新提交

ViQ: Text-Aligned Visual Quantized Representations at Any Resolution

ViQ: 任意分辨率下的文本对齐视觉量化表示

Xumin Yu, Zuyan Liu, Zhenyu Yang, Yuhao Dong, Shengsheng Qian, Jiwen Lu, Han Hu, Yongming Rao

机构 * Tencent HY Vision Team(腾讯HY视觉团队) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Chinese Academy of Sciences(中国科学院)

AI总结 提出ViQ框架,通过文本对齐预训练和特征离散化两阶段量化学习,平衡离散表示中的语义与细节,支持原生分辨率输入,在多模态任务中取得与连续高维特征编码器相当的性能,并实现20%-70%的训练加速。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22158 2026-07-01 cs.CV 新提交

Improving Reasoning in Vision-Language Models via Perception Verified Self-Training

通过感知验证自训练提升视觉-语言模型的推理能力

Sourabh Sharma, Sonam Gupta, Sadbhawna

机构 * Malaviya National Institute of Technology Jaipur(马拉维亚国家理工学院斋浦尔分校) IBM Research(IBM研究院)

AI总结 提出感知验证自训练框架,通过解耦感知与推理的CoT模板和无监督评估方法PerceptEval,结合两阶段课程学习,提升视觉-语言模型在视觉推理中的准确性并减少幻觉。

Comments Accepted at The European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21162 2026-07-01 cs.GR cs.CV 新提交

PIAvatar: Physically Interactive Avatars via Deformation Gradient Decoupling

PIAvatar: 通过变形梯度解耦实现物理交互的虚拟化身

Sang-Hun Han, Min-Gyu Park, Jisu Shin, Seunghyun Shin, Jin-Hwi Park, Hae-Gon Jeon

机构 * GIST(韩国科学技术院) KETI(韩国电子信息技术院) Chung-Ang Univ.(Chung-Ang 大学) Yonsei Univ.(延世大学)

AI总结 提出PIAvatar框架,通过解耦运动速度与变形梯度,结合骨骼框架和物质点法,实现化身间及化身与环境间的物理交互和非刚性变形模拟。

Comments Project page: https://sanghunhan92.github.io/conference/PIAvatar/, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20196 2026-07-01 cs.CV 新提交

Distill Once, Adapt Life-Long: Exploring Dataset Distillation for Continual Test-Time Adaptation

一次蒸馏,终身适应:探索数据集蒸馏用于持续测试时适应

Hyun-Kurl Jang, Jihun Kim, Hyeokjun Kweon, Kuk-Jin Yoon

机构 * KAIST, Visual Intelligence Lab(韩国科学技术院,视觉智能实验室) Chung-Ang University, FOV Lab(中央大学,FOV实验室)

AI总结 提出DO-ALL框架,通过数据集蒸馏生成紧凑的合成锚点,在持续测试时适应中提供稳定参考,无需保留原始源数据,提升长期鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14307 2026-07-01 cs.CV 新提交

Pano3D: Unified 3D Reconstruction and Panoptic Segmentation

Pano3D:统一的3D重建与全景分割

Victor Barberteguy, Ahmet Iscen, Mathilde Caron, Alireza Fathi, Gül Varol, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind) LIGM, École des Ponts, IP Paris, Univ Gustave Eiffel, CNRS(LIGM, 巴黎高科桥梁学院, 巴黎理工学院, 古斯塔夫·埃菲尔大学, 法国国家科学研究中心)

AI总结 提出统一框架,在3D前馈重建网络中集成全景分割,通过联合训练几何与语义损失实现互惠提升,在多个数据集上达到最优性能。

Comments Accepted at ECCV 2026. Project page: https://victorbbt.github.io/Pano3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28266 2026-06-29 cs.CV 新提交

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

RSICCLLM:用于遥感图像变化描述的多模态大语言模型

Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) Great Bay University, Dongguan, China(东莞Great Bay大学,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院,中国) Dongguan Key Laboratory for Intelligence and Information Technology, Dongguan, China(东莞智能与信息科技重点实验室,中国)

AI总结 提出首个针对遥感图像变化描述任务的大视觉语言模型后训练框架RSICCLLM,通过数据生成范式、差异感知微调和双负偏好优化,仅7B参数即超越更大规模模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28215 2026-06-29 cs.CV cs.AI cs.GR 新提交

HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration

HAT-4D: 通过人机协作从单目视频提升4D多物体交互

Jiaxin Li, Yuxiang Wu, Zhenkai Zhang, Xinrui Shi, Haoyuan Wang, Yichen Zhao, Su Linxiang, Chenyang Yu, Mingyu Zhang, Yifan Ding, Boran Wen, Li Zhang, Ruiyang Liu, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) Math Magic

AI总结 提出HAT-4D框架,结合视觉大模型与多级人工反馈,从单目视频重建多物体的3D几何、时序动态和物理交互,解决遮挡和深度歧义,无需多相机系统。

Comments Accepted to ECCV 2026. 15 pages of main text and 39 pages of appendices. Project page: https://lijiaxin0111.github.io/HAT4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28144 2026-06-29 cs.CV 新提交

Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading

基于级联扩散先验和UV空间可微分着色的单目虚拟人重建

Hong Li, Minqi Meng, Yanjun Liang, Chongjie Ye, Houyuan Chen, Weiqing Xiao, Xianda Guo, Guojun Lei, Xuhui Liu, Chaojie Yang, Yanlun Peng, Hao Zhao, Baochang Zhang

机构 * Beihang University(北航) Great Wall Motors(长城汽车) CUHK-Shenzhen(香港科技大学深圳研究院) HKUST(香港科技大学) Nanjing University(南京大学) Wuhan University(武汉大学) Zhejiang University(浙江大学) KAUST(王国 Abdullah 基础科学研究院) Tsinghua University(清华大学)

AI总结 提出数据高效框架,利用统一预训练扩散模型的鲁棒先验,通过级联LoRA依次处理纹理补全、去光照和材质分解,结合UV空间可微分BRDF着色损失,从单张野外图像重建高保真可重光照3D虚拟人。

Comments Accepted by ECCV 2026. Project page: https://luh1124.github.io/MARCUS-Avatar-Projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28077 2026-06-29 cs.CV 新提交

TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts

TextDS: 分布偏移下场景文本检测的参数高效表示对齐

Boyuan Chen, Zichen Dang, Chuang Yang, Lap-Pui Chau, Yi Wang

机构 * School of Electrical Engineering, Xi’an Jiaotong University(西安交通大学电气工程学院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系)

AI总结 提出TextDS框架,通过视觉基础模型、逐步LoRA适应和公共子空间融合,仅用4.9M参数实现跨域和退化条件下的鲁棒场景文本检测。

Comments Accepted by ECCV 2026. Project page: https://github.com/ZChenDang/TextDS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28026 2026-06-29 cs.CV 新提交

EMOSH: Expressive Motion and Shape Disentanglement for Human Animation

EMOSH:用于人体动画的表现性运动与形状解耦

Dongbin Zhang, Hao Liu, Binquan Dai, Kangjie Chen, Chuming Wang, Chen Li, Jing Lyu, Haoqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) WeChat Vision, Tencent Inc.(腾讯微信视觉)

AI总结 提出EMOSH框架,通过可表现人体模型解耦形状与姿态,结合粗细混合运动注入和空间对齐条件机制,实现高保真、可控的人体视频生成,解决运动-形状纠缠问题。

Comments Accepted to ECCV 2026, Project Page: https://eastbeanzhang.github.io/EMOSH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27988 2026-06-29 cs.CV 新提交

Latent Visual Diffusion Reasoning with Monte Carlo Tree Search

潜在视觉扩散推理与蒙特卡洛树搜索

Xirui Teng, Nan Xi, Junsong Yuan

机构 * Beijing Jiaotong University(北京交通大学) Virginia Commonwealth University(弗吉尼亚联邦大学) University at Buffalo(布法罗大学)

AI总结 提出LVDR框架,结合关键点引导的蒙特卡洛树搜索,实现细粒度技能活动的可解释视觉推理,在多个体育和手术数据集上取得竞争性表现。

Comments Accepted to ECCV 2026. Project page: https://github.com/XiruiTeng/LVDR_Official.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27905 2026-06-29 cs.CV 新提交

There and Back Again: A Flexible-Frame Transformer for Multi-Exposure Fusion

去而复返:用于多曝光融合的灵活帧数Transformer

Lishen Qu, Yao Liu, Shihao Zhou, Jie Liang, Hui Zeng, Lei Zhang, Jufeng Yang

机构 * Nankai International Advanced Research Institute (SHENZHEN·FUTIAN)(南开国际先进研究院(深圳·福田)) Peng Cheng Laboratory(鹏城实验室) College of Computer Science, Nankai University(南开大学计算机学院) The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

AI总结 提出FreeMEF,首个灵活帧数多曝光融合Transformer,通过循环状态空间模块和全局特征引导块,无需重训练即可处理任意数量输入帧,在三个基准数据集上取得最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27784 2026-06-29 cs.CV cs.AI cs.LG 新提交

Improving Adversarial Robustness via Activation Amplification and Attenuation

通过激活放大与衰减提升对抗鲁棒性

Taïga Gonçalves, Yongsong Huang, Tomo Miyazaki, Shinichiro Omachi

机构 * Graduate School of Engineering, Tohoku University(东北大学工学研究科)

AI总结 提出激活放大与衰减(A3)轻量模块,通过可学习缩放机制动态调整激活值,利用放大信号构建对比损失,在衰减模式下提升对抗鲁棒性,计算开销小。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27779 2026-06-29 cs.CV 新提交

MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations

MindFlow:调和认知语义与声学动态的对话面部动画生成

Hejia Chen, Haoxian Zhang, Xu He, Xiaoqiang Liu, Pengfei Wan, Shoulong Zhang, Shuai Li

机构 * Beihang University(北京航空航天大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Zhongguancun Laboratory(中关村实验室)

AI总结 提出双路径生成框架MindFlow,受神经科学腹侧-背侧通路模型启发,通过Chunk-State方法建模上下文感知情感状态链,结合条件自回归流匹配网络与选择性声学注入器,实现高保真面部动画,在语义适切性和运动自然度上超越现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27729 2026-06-29 cs.CV 新提交

Learning 1-Bit LiDAR-based Localization with Auxiliary Objective

学习基于1比特LiDAR的定位与辅助目标

Kaijie Yin, Zhiyuan Zhang, Tian Gao, Wentao Zhu, Cheng-zhong Xu, Hui Kong

机构 * University of Macau(澳门大学) Singapore Management University(新加坡管理大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学)

AI总结 提出首个二值神经网络框架BiLoc用于6-DoF LiDAR定位,通过信息瓶颈原理和辅助目标缓解二值化信息损失,实现轻量高效定位。

Comments European Conference on Computer Vision(ECCV)

详情

展开后加载摘要…

URL PDF HTML 收藏