arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-04-07 至 2026-04-07 共收录 37
2604.04642 2026-04-07 cs.RO

WaterSplat-SLAM: Photorealistic Monocular SLAM in Underwater Environment

WaterSplat-SLAM:水下环境中的光实单目SLAM

Kangxu Wang, Shaofeng Zou, Chenxing Jiang, Yixiang Dai, Siang Chen, Shaojie Shen, Guijin Wang

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Key Laboratory of Marine Robotics, Shenyang(沈阳海洋机器人重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子及计算机工程学系)

AI总结 本文提出WaterSplat-SLAM,通过语义介质过滤和语义引导渲染实现水下高保真密集映射,提升水下单目SLAM的鲁棒性与可视化效果。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04573 2026-04-07 cs.ET cs.LG

SAIL: Scene-aware Adaptive Iterative Learning for Long-Tail Trajectory Prediction in Autonomous Vehicles

SAIL:面向场景的自适应迭代学习用于自动驾驶车辆的长尾轨迹预测

Bin Rao, Haicheng Liao, Chengyue Wang, Keqiang Li, Zhenning Li, Hai Yang

机构 * State Key Laboratory of Internet of Things for Smart City and Department of Civil and Environmental Engineering, University of Macau(澳门大学智慧城市物联网国家重点实验室及土木与环境工程系) State Key Laboratory of Internet of Things for Smart City and Department of Computer and Information Science, University of Macau(澳门大学智慧城市物联网国家重点实验室及计算机与信息科学系) Department of Automotive Engineering, Tsinghua University(清华大学汽车工程系) State Key Laboratory of Internet of Things for Smart City and Departments of Civil and Environmental Engineering and Computer and Information Science, University of Macau(澳门大学智慧城市物联网国家重点实验室及土木与环境工程系和计算机与信息科学系) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科技大学土木与环境工程系)

AI总结 本文提出SAIL框架,通过定义和建模轨迹的三个关键属性维度,结合属性引导增强与自适应对比学习策略,提升自动驾驶车辆在长尾场景下的轨迹预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04502 2026-04-07 cs.RO

Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation?

Veo-Act:前沿视频模型在通用机器人操作中能走多远?

Zhongru Zhang, Chenghan Yang, Qingzhou Lu, Yanjiang Guo, Jianke Zhang, Yucheng Hu, Jianyu Chen

机构 * Tsinghua University(清华大学)

AI总结 本文探讨前沿视频模型如Veo-3在通用机器人操作中的应用,提出Veo-Act框架结合高阶运动规划与低阶执行器,提升指令跟随性能。

Comments 16 pages, 12 figures. Equal contribution by Zhongru Zhang, Chenghan Yang, Qingzhou Lu and Yanjiang Guo. Project lead: Yanjiang Guo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04487 2026-04-07 cs.CV

Training-Free Image Editing with Visual Context Integration and Concept Alignment

无需训练的图像编辑与视觉上下文整合与概念对齐

Rui Song, Guo-Hua Wang, Qing-Guo Chen, Weihua Luo, Tongda Xu, Zhening Liu, Yan Wang, Zehong Lin, Jun Zhang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院(AIR)) School of Data Science, Lingnan University(岭南大学数据科学学院)

AI总结 本文提出VicoEdit,一种无需训练和反向扩散的图像编辑方法,通过视觉上下文直接转换源图像至目标图像,提升编辑一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04419 2026-04-07 cs.CV

BoxComm: Benchmarking Category-Aware Commentary Generation and Narration Rhythm in Boxing

BoxComm:基于 boxing 的类别感知评论生成与叙述节奏基准测试

Kaiwen Wang, Kaili Zheng, Rongrong Deng, Yiming Shi, Chenyi Guo, Ji Wu

机构 * Tsinghua University(清华大学) Beijing Sport University(北京体育大学)

AI总结 本文提出 BoxComm 数据集,包含 445 场世界拳击锦标赛视频及 52000 多条专业评论,通过分类注解和两项新评估方法,解决拳击评论生成中的节奏与类别准确性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04145 2026-04-07 cs.AI

Solar-VLM: Multimodal Vision-Language Models for Augmented Solar Power Forecasting

Solar-VLM:用于增强太阳能发电预测的多模态视觉语言模型

Hang Fan, Haoran Pei, Runze Liang, Weican Liu, Long Cheng, Wei Wei

机构 * North China Electric Power University(华北电力大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Solar-VLM框架,通过融合时序观测、卫星图像和文本天气信息,提升太阳能发电预测的准确性,采用多模态编码器和图注意力网络捕捉空间依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28532 2026-04-07 cs.LG cs.AI stat.AP

Detecting low left ventricular ejection fraction from ECG using an interpretable and scalable predictor-driven framework

通过可解释且可扩展的预测驱动框架从ECG检测低左心室射血分数

Ya Zhou, Tianxiang Hao, Ziyi Cai, Haojie Zhu, Kejun He, Jia Liu, Xiaohan Fan, Jing Yuan

机构 * Fuwai Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院阜外医院、北京协和医学院) The Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) National Center for Cardiovascular Diseases(国家心血管病中心) Function Test Center, Fuwai Hospital(阜外医院功能检测中心)

AI总结 本文提出ECGPD-LEF框架,结合基础模型诊断概率与可解释模型,有效检测ECG中的低左心室射血分数,优于现有方法,且具备高可解释性。

Comments This version includes minor typographical corrections. The results and conclusions remain unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10421 2026-04-07 cs.CV

Neural Collapse in Test-Time Adaptation

测试时适应中的神经塌陷

Xiao Chen, Zhongjing Du, Jiazhen Huang, Xu Jiang, Li Lu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peking University(北京大学) Sichuan University(四川大学) Shenzhen Technology University(深圳技术大学)

AI总结 本文基于神经塌陷理论,提出NCTTA方法,通过特征与分类器对齐缓解域偏移影响,实验证明其在ImageNet-C上优于Tent。

Comments Aceepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13851 2026-04-07 cs.CL cs.LG

EvoEdit: Evolving Null-space Alignment for Robust and Efficient Knowledge Editing

EvoEdit:基于空域对齐的鲁棒高效知识编辑

Sicheng Lyu, Yu Gu, Xinyu Wang, Jerry Huang, Sitao Luan, Yufei Cui, Xiao-Wen Chang, Peng Lu

机构 * Institute for Clarity in Documentation(文档清晰度研究所) Inria Paris-Rocquencourt(法国国家信息与自动化研究所巴黎-罗康库尔中心) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕默研究实验室)

AI总结 EvoEdit通过序列空域对齐缓解知识编辑中的灾难性干扰,实现稳定高效的模型更新,实验显示其性能优于现有方法且速度提升达3.53倍。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22095 2026-04-07 cs.CL

Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitation

基于推理引导的多模态知识利用的检索专家混合

Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Yishan Li, Yukun Yan, Shuo Wang, Yu Gu, Minghe Yu, Ge Yu, Maosong Sun

机构 * Northeastern University(东北大学) Tsinghua University(清华大学)

AI总结 本文提出MoRE框架,通过动态选择检索专家提升多模态大语言模型的知识利用效率,实验表明在开放领域问答基准上性能提升超过7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14202 2026-04-07 cs.LG

MSDformer: Multi-scale Discrete Transformer For Time Series Generation

MSDformer:多尺度离散Transformer用于时间序列生成

Shibo Feng, Zhicheng Chen, Xi Xiao, Zhong Zhang, Qing Li, Xingyu Gao, Peilin Zhao

机构 * Nanyang Technological University(南洋理工大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent(腾讯) Peng Cheng Laboratory(鹏城实验室) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

AI总结 MSDformer通过多尺度离散Transformer方法,解决传统DTM在捕捉复杂时间序列多尺度特征和理论指导方面的不足,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06991 2026-04-07 eess.IV cs.CV

Ray-driven Spectral CT Reconstruction Based on Neural Base-Material Fields

基于神经基材场的射线驱动光谱CT重建

Ligen Shi, Ping Yang, Chang Liu, Wei Zhang, Xing Zhao, Jun Qiu

机构 * College of Computer Science (College of Software), Inner Mongolia University(内蒙古大学计算机学院(软件学院)) Institute of Nuclear and New Energy Technology, Collaborative Innovation Center of Advanced Nuclear Energy Technology, Key Laboratory of Advanced Reactor Engineering and Safety of Ministry of Education, Tsinghua University(清华大学核能与新能源技术研究院,先进核能技术协同创新中心,先进反应堆工程与安全教育部重点实验室) Institute of Computational Imaging, Beijing Information Science and Technology University(北京信息科技大学计算成像研究所) National Key Laboratory of Strength and Structural Integrity, Aircraft Strength Research Institute of China(中国飞机强度研究所强度与结构完整性全国重点实验室) School of Mathematical Sciences, Capital Normal University(首都师范大学数学科学学院)

AI总结 本文提出基于神经基材场的射线驱动光谱CT重建方法,通过神经场表示参数化物体的衰减系数,避免了像素驱动投影系数矩阵的复杂计算,提高了积分近似精度,实验验证了方法在光谱CT重建中的有效性。

Comments 12 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04063 2026-04-07 cs.CV

4C4D: 4 Camera 4D Gaussian Splatting

4C4D: 4台相机的4维高斯点散布

Junsheng Zhou, Zhifan Yang, Liang Han, Wenyuan Zhang, Kanle Shi, Shenkun Xu, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Kuaishou Technology(快手科技)

AI总结 本文提出4C4D框架,通过极稀疏相机拍摄实现高保真4维高斯点散布,解决视频中4维动态场景重建问题,提升几何建模能力。

Comments Accepted by CVPR 2026. Project page: https://junshengzhou.github.io/4C4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04018 2026-04-07 cs.CV

1.x-Distill: Breaking the Diversity, Quality, and Efficiency Barrier in Distribution Matching Distillation

1.x-Distill: 突破分布匹配蒸馏中的多样性、质量和效率壁垒

Haoyu Li, Tingyan Wen, Lin Qi, Zhe Wu, Yihuang Chen, Xing Zhou, Lifei Zhu, Xueqian Wang, Kai Zhang

机构 * Tsinghua University(清华大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

AI总结 本文提出1.x-Distill框架,通过引入教师CFG修改和分阶段聚焦蒸馏方法,突破传统整数步蒸馏限制,实现更高质量和多样性的蒸馏扩散模型生成。

Comments Project page: https://thu-accdiff.github.io/1.x-distill-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03999 2026-04-07 cs.RO

Dynamic Whole-Body Dancing with Humanoid Robots -- A Model-Based Control Approach

动态全身体舞与人形机器人——一种基于模型的控制方法

Shibowen Zhang, Jiayang Wu, Guannan Liu, Helin Zhu, Junjie Liu, Zhehan Li, Junhong Guo, Xiaokun Leng, Hangxin Liu, Jingwen Zhang, Jikai Wang, Zonghai Chen, Zhicheng He, Jiayi Wang, Yao Su

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Xidian University(西安电子科技大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出了一种基于模型的框架,用于生成和执行人形机器人上的动态全身体舞动作。框架分为离线动作生成和在线动作执行两个阶段,利用未来状态预测实现鲁棒且动态的舞动动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03972 2026-04-07 cs.CV

Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detection

具有自适应补丁代码书的分层点-补丁融合用于3D形状异常检测

Xueyang Kang, Zizhao Li, Tian Lan, Dong Gong, Kourosh Khoshelham, Liangliang Nan

机构 * The University of Melbourne(墨尔本大学) Tsinghua University(清华大学) The University of New South Wales(新南威尔士大学) Delft University of Technology(代尔夫特理工大学)

AI总结 本文提出一种分层点-补丁异常评分网络,通过联合建模区域部分特征和局部点特征,提升3D形状异常检测的鲁棒性。采用自适应补丁化模块捕捉复杂结构偏差,并在公开和工业数据集上取得优越的AUC-ROC和AUC-PR性能。

Comments 10 pages, 5 figures, 6 tables

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03957 2026-04-07 cs.LG cs.CL

BWTA: Accurate and Efficient Binarized Transformer by Algorithm-Hardware Co-design

BWTA:通过算法-硬件协同设计实现准确且高效的二值化Transformer

Yifu Ding, Xianglong Liu, Shenghao Jin, Jinyang Guo, Jiwen Lu

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出BWTA量化方案,通过算法-硬件协同设计实现低比特精度下的高效准确推理,实验显示在BERT和LLM上均达到全精度性能,同时显著提升推理效率。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03773 2026-04-07 cs.CV

M2StyleGS: Multi-Modality 3D Style Transfer with Gaussian Splatting

M2StyleGS:多模态3D风格迁移与高斯点散技术

Xingyu Miao, Xueqi Qiu, Haoran Duan, Yawen Huang, Xian Wu, Jingjing Deng, Yang Long

机构 * Durham University(杜伦大学) Tsinghua University(清华大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Bristol University(布里斯托大学)

AI总结 M2StyleGS通过高斯点散技术与CLIP多模态知识融合,实现基于文本和图像的实时3D风格迁移,提升视觉质量和一致性表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03748 2026-04-07 cs.GR cs.CV

Real-time Neural Six-way Lightmaps

实时神经六方向光图

Wei Li, Hanxiao Sun, Tao Huang, Haoxiang Wang, Tongtong Wang, Zherong Pan, Kui Wu

机构 * Shanghai Jiao Tong University(上海交通大学) LIGHTSPEED Tsinghua University(清华大学)

AI总结 本文提出神经六方向光图方法,通过生成指导图和训练神经网络,实现动态与视觉真实性的平衡,支持实时交互和烟雾效果渲染。

Comments 11 Pages, 16 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03738 2026-04-07 cs.CV

Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation

重新思考位置嵌入作为多参考和多镜头视频生成的上下文控制器

Binyuan Huang, Yuning Lu, Weinan Jia, Hualiang Wang, Mu Liu, Daiqing Yang

机构 * Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

AI总结 本文提出PoCo方法,通过引入位置嵌入作为额外的上下文控制,解决多参考和多镜头视频生成中参考混淆问题,提升跨镜头一致性和参考保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03674 2026-04-07 cs.CV

DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity

DiffSparse: 通过学习的令牌稀疏性加速扩散变换器

Haowei Zhu, Ji Liu, Ziqiong Liu, Dong Li, Junhai Yong, Bin Wang, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(超威半导体公司) Tsinghua University(清华大学) BNRist(北京信息科学与技术国家研究中心)

AI总结 本文提出DiffSparse框架,通过学习令牌稀疏性优化扩散变换器的推理效率,减少计算成本并提升生成质量。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03657 2026-04-07 cs.CV cs.IR cs.MM

Love Me, Love My Label: Rethinking the Role of Labels in Prompt Retrieval for Visual In-Context Learning

爱我,爱我的标签:重新思考标签在视觉上下文学习中的提示检索中的作用

Tianci Luo, Haohao Pan, Jinpeng Wang, Niu Lian, Xinrui Chen, Bin Chen, Shu-Tao Xia, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

AI总结 本文提出LaPR框架,通过增强标签信息提升视觉上下文学习中提示检索的性能,实验表明其在分割、检测和着色任务中表现优异。

Comments Accepted to CVPR 2026. 10 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03653 2026-04-07 cs.CV cs.IR cs.MM

Imagine Before Concentration: Diffusion-Guided Registers Enhance Partially Relevant Video Retrieval

想象之前聚焦:扩散引导的寄存器增强部分相关视频检索

Jun Li, Xuhang Lou, Jinpeng Wang, Yuting Wang, Yaowei Wang, Shu-Tao Xia, Bin Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出DreamPRVR,通过粗到细的表示学习范式,利用扩散模型生成全局语义寄存器,提升部分相关视频检索的准确性与鲁棒性。

Comments Accepted to CVPR 2026. 15 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03582 2026-04-07 cs.LG

Simple yet Effective: Low-Rank Spatial Attention for Neural Operators

简单而有效:神经算子中的低秩空间注意力

Zherui Yang, Haiyang Xin, Tao Du, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院)

AI总结 本文提出低秩空间注意力模块,通过压缩高维特征到紧凑潜在空间,实现高效全局交互,提升神经算子在求解偏微分方程中的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03340 2026-04-07 cs.CV cs.AI

Learning Additively Compositional Latent Actions for Embodied AI

学习可加性组合的潜在动作以实现具身AI

Hangxing Wei, Xiaoyu Chen, Chuheng Zhang, Tim Pearce, Jianyu Chen, Alex Lamb, Li Zhao, Jiang Bian

机构 * Wuhan University(武汉大学) Tsinghua University(清华大学) Microsoft Research(微软研究院)

AI总结 本文提出AC-LAM模型,通过强制潜在动作空间上的可加性组合结构,提升动作表示的结构性和准确性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03338 2026-04-07 econ.GN cs.AI cs.CY q-fin.EC

The Ideation Bottleneck: Decomposing the Quality Gap Between AI-Generated and Human Economics Research

想法瓶颈:分解人工智能生成与人类经济学研究之间的质量差距

Ning Li

机构 * Tsinghua University(清华大学) Social Catalyst Lab at the University of Zurich(苏黎世大学社会催化剂实验室)

AI总结 本文通过分析953篇经济学论文,发现人工智能生成的研究想法质量显著低于人类,占整体质量差异的71%,执行质量差距较小,但机制分析深度不足仍是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03321 2026-04-07 cs.LG cs.AI math.AP physics.med-ph

General Explicit Network (GEN): A novel deep learning architecture for solving partial differential equations

通用显式网络(GEN):一种用于求解偏微分方程的新深度学习架构

Genwei Ma, Ting Luo, Ping Yang, Xing Zhao

机构 * National Center for Applied Mathematics Beijing, Capital Normal University(首都师范大学北京国家应用数学中心) The Academy for Multidisciplinary Studies, Capital Normal University(首都师范大学多学科交叉研究院) Academy of Information Network Security, People’s Public Security University of China(中国人民公安大学信息网络安全学院) Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) School of Mathematical Sciences, Capital Normal University(首都师范大学数学科学学院)

AI总结 本文提出通用显式网络(GEN),通过基于偏微分方程的基函数构建函数组件,实现点到函数的PDE求解,提升了求解的鲁棒性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03310 2026-04-07 cs.CV

Diffusion Path Alignment for Long-Range Motion Generation and Domain Transitions

扩散路径对齐用于长程运动生成与领域转换

Haichao Wang, Alexander Okupnik, Yuxing Han, Gene Wen, Johannes Schneider, Kyriakos Flouris

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute of Information Systems, Universität Liechtenstein(列支敦士登大学信息系统研究所) Department of Computer Science, New York University(纽约大学计算机科学系) MRC Biostatistics Unit, University of Cambridge(剑桥大学MRC生物统计单元)

AI总结 本文提出基于扩散的优化框架,通过控制能量目标实现运动领域间流畅过渡,提升长程人类运动生成的连贯性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03305 2026-04-07 cs.CV

HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis

HVG-3D: 联接真实与仿真领域用于3D条件手-物体交互视频合成

Mingjin Chen, Junhao Chen, Zhaoxin Fan, Yujian Lee, Zichen Dang, Lili Wang, Yawen Cui, Lap-Pui Chau, Yi Wang

机构 * Dept. of EEE, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院未来区块链与隐私计算北京高精尖创新中心) Tsinghua University(清华大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院虚拟现实技术与系统国家重点实验室)

AI总结 HVG-3D提出一种统一框架,通过显式3D表示条件生成3D-aware手-物体交互视频,结合3D ControlNet与扩散架构,实现高保真度与时空可控性。

Comments Project page: https://hvg3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29773 2026-04-07 cs.CV

Beyond Ground-Truth: Leveraging Image Quality Priors for Real-World Image Restoration

超越真实数据:利用图像质量先验进行现实场景图像修复

Fengyang Xiao, Peng Hu, Lei Xu, XingE Guo, Guanyi Qin, Yuqi Shen, Chengyu Fang, Rihan Zhang, Chunming He, Sina Farsiu

机构 * Duke University(杜克大学) Tsinghua University(清华大学) EPFL(瑞士联邦理工学院洛桑分校)

AI总结 本文提出IQPIR框架,通过引入图像质量先验指导图像修复,提升感知质量。方法整合代码本先验,采用Transformer和双分支结构优化修复效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏