arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2025-12-02 至 2025-12-02 共收录 15
2512.02013 2025-12-02 cs.RO

ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation

ManualVLA: 一种统一的VLA模型用于链式思维手动生成和机器人操作

Chenyang Gu, Jiaming Liu, Hao Chen, Runzhong Huang, Qingpo Wuwu, Zhuoyang Liu, Xiaoqi Li, Ying Li, Renrui Zhang, Peng Jia, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The Chinese University of Hong Kong(香港中文大学) Simplexity Robotics Project(Simplexity机器人项目)

AI总结 ManualVLA通过融合多模态手册生成与动作执行,提升机器人长周期任务中的规划与操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01820 2025-12-02 stat.ML cs.LG math.PR math.ST stat.TH

Dimension-free error estimate for diffusion model and optimal scheduling

扩散模型的无维误差估计与最优调度

Valentin de Bortoli, Romuald Elie, Anna Kazeykina, Zhenjie Ren, Jiacheng Zhang

机构 * Google DeepMind(谷歌DeepMind) Université Paris Saclay(巴黎萨克雷大学) Université Evry - Paris Saclay(埃夫里-巴黎萨克雷大学) Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出了一种无维误差界,用于评估扩散模型生成与真实数据分布的差异,并通过变分问题推导出最优时间调度策略以减少离散化误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21309 2025-12-02 cs.CV

CaliTex: Geometry-Calibrated Attention for View-Coherent 3D Texture Generation

CaliTex: 用于视图一致3D纹理生成的几何校准注意力

Chenyu Liu, Hongze Chen, Jingzhi Bao, Lingting Zhu, Runze Zhang, Weikai Chen, Zeyu Hu, Yingda Yin, Keyang Luo, Xin Wang

机构 * PKU(北京大学) HKUST(香港科技大学) CUHK(SZ)(香港中文大学(深圳)) HKU(香港大学) LIGHTSPEED

AI总结 CaliTex通过几何校准注意力机制,解决3D纹理生成中的跨视图不一致问题,提升纹理的视图一致性与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01396 2025-12-02 cs.SE cs.CL cs.CR

BackportBench: A Multilingual Benchmark for Automated Backporting of Patches

BackportBench: 一种多语言的自动化补丁回退基准测试

Zhiqing Zhong, Jiaming Huang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳))

AI总结 BackportBench是一个多语言基准测试,用于评估自动化补丁回退技术,展示了代理方法在处理复杂补丁回退任务中的优越性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01357 2025-12-02 cs.DC cs.AI cs.AR

Tangram: Accelerating Serverless LLM Loading through GPU Memory Reuse and Affinity

Tangram: 通过GPU内存重用和亲和力加速无服务器LLM加载

Wenbin Zhu, Zhaoyan Shen, Zili Shao, Hongjun Dai, Feng Chen

机构 * Shandong University(山东大学) The Chinese University of Hong Kong(香港中文大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

AI总结 Tangram通过GPU内存重用和亲和力调度技术,显著提升无服务器LLM的加载速度和冷启动性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01061 2025-12-02 cs.RO cs.CV

Opening the Sim-to-Real Door for Humanoid Pixel-to-Action Policy Transfer

为人类oid像素到动作策略转移打开仿真到现实的大门

Haoru Xue, Tairan He, Zi Wang, Qingwei Ben, Wenli Xiao, Zhengyi Luo, Xingye Da, Fernando Castañeda, Guanya Shi, Shankar Sastry, Linxi "Jim" Fan, Yuke Zhu

机构 * NVIDIA UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学) CUHK(香港中文大学)

AI总结 本文提出了一种基于教师-学生-Bootstrap框架的人形机器人仿真到现实策略转移方法,通过分阶段重置探索策略和GRPO微调程序,实现了在多样化可动物体交互任务中的高效零样本性能。

Comments https://doorman-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00473 2025-12-02 cs.CV cs.AI

RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards

RealGen:通过检测器引导的奖励实现逼真文本到图像生成

Junyan Ye, Leiqi Zhu, Yuncheng Guo, Dongzhi Jiang, Zilong Huang, Yifan Zhang, Zhiyuan Yan, Haohuan Fu, Conghui He, Weijia Li

机构 * Shanghai AI Lab(上海人工智能实验室) Sun Yat-Sen University(中山大学) Nanjing University(南京大学) CUHK MMLab(香港中文大学多模态实验室) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 RealGen通过检测器引导的奖励机制提升文本到图像生成的真实感和细节,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07931 2025-12-02 cs.SD cs.AI cs.CL

SpeechJudge: Towards Human-Level Judgment for Speech Naturalness

SpeechJudge: 向人类水平的语音自然度判断迈进

Xueyao Zhang, Chaoren Wang, Huan Liao, Ziniu Li, Yuancheng Wang, Li Wang, Dongya Jia, Yuanzhe Chen, Xiulin Li, Zhuo Chen, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 SpeechJudge通过构建大规模人类反馈数据集和生成奖励模型,提升语音自然度判断的准确性,显著优于现有方法。

Comments Dataset, Model, and Code: https://github.com/AmphionTeam/SpeechJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22213 2025-12-02 cs.CV

DynamicTree: Interactive Real Tree Animation via Sparse Voxel Spectrum

DynamicTree: 通过稀疏体素光谱实现交互式真实树动画

Yaokun Li, Lihe Ding, Xiao Chen, Guang Tan, Tianfan Xue

机构 * Sun Yat-sen University(中山大学) CUHK MMLab(香港中文大学多媒体实验室) CPII under InnoHK(创新科技署CPII)

AI总结 DynamicTree通过稀疏体素光谱实现交互式真实树动画,首次在3DGS重建中生成长期动态,提升视觉质量和效率。

Comments Project Page: https://dynamictree-dev.github.io/DynamicTree.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08594 2025-12-02 cs.CV cs.LG

PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction

PointNSP: 通过下一尺度细节预测实现自回归3D点云生成

Ziqiao Meng, Qichao Wang, Zhiyang Dou, Zixing Song, Zhipeng Zhou, Irwin King, Peilin Zhao

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Hong Kong(香港大学) University of Cambridge(剑桥大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 PointNSP通过下一尺度细节预测实现自回归3D点云生成,首次在自回归范式中达到最先进的生成质量,并在参数、训练和推理效率上超越扩散基线。

Comments 24 pages; Previously this version appeared as arXiv:2510.05613 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05808 2025-12-02 cs.CV cs.MM

SizeGS: Size-aware Compression of 3D Gaussian Splatting via Mixed Integer Programming

SizeGS: 通过混合整数规划实现3D高斯点云的尺寸感知压缩

Shuzhao Xie, Jiahang Liu, Weixiang Zhang, Shijia Ge, Sicheng Pan, Chen Tang, Yunpeng Bai, Cong Zhang, Xiaoyi Fan, Zhi Wang

机构 * SIGS, Tsinghua University(清华大学SIGS实验室) Harbin Institute of Technology(哈尔滨工业大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Jiangxing Intelligence Inc.(江行智能有限公司)

AI总结 SizeGS通过混合整数规划优化3DGS的超参数,实现高效尺寸感知压缩,提升压缩效率和视觉质量。

Comments Automatically compressing 3DGS into the desired file size while maximizing the visual quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00352 2025-12-02 cs.LG stat.ML

Sample-Efficient Tabular Self-Play for Offline Robust Reinforcement Learning

样本高效的目标导向自博弈用于离线鲁棒强化学习

Na Li, Zewu Zheng, Wei Ni, Hangguan Shan, Wenjie Zhang, Xinyu Li

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Edith Cowan University(埃迪斯·科温大学) University of New South Wales(新南威尔士大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出RTZ-VI-LCB算法,通过乐观鲁棒值迭代和数据驱动的伯恩斯坦惩罚项,实现离线鲁棒双人零和马尔可夫游戏的最优样本复杂性保证。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00308 2025-12-02 cs.CV

Optimizing Distributional Geometry Alignment with Optimal Transport for Generative Dataset Distillation

基于最优传输的分布几何对齐优化用于生成数据集蒸馏

Xiao Cui, Yulei Qin, Wengang Zhou, Hongsheng Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) CUHK MMLab(香港中文大学多媒体实验室) Independent Researcher(独立研究者)

AI总结 本文提出基于最优传输的分布几何对齐方法,通过优化传输距离提升数据集蒸馏效果,实验表明在ImageNet-1K上准确率提升至少4%。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16177 2025-12-02 cs.GR cs.CV

OccluGaussian: Occlusion-Aware Gaussian Splatting for Large Scene Reconstruction and Rendering

OccluGaussian:面向大场景重建与渲染的遮挡感知高斯点云技术

Shiyong Liu, Xiao Tang, Zhihao Li, Yingfan He, Chongjie Ye, Jianzhuang Liu, Binxiao Huang, Shunbo Zhou, Xiaofei Wu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) The University of Hong Kong(香港大学) Huawei Embodied Intelligence Lab(华为具身智能实验室)

AI总结 OccluGaussian通过遮挡感知的场景划分和区域渲染技术,提升大规模场景重建与渲染的质量和效率。

Comments Accepted to ICCV 2025. Project website: https://occlugaussian.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10125 2025-12-02 cs.CV cs.MM

Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation

代理调优:为以主题驱动的图像生成定制多模态自回归模型

Yi Wu, Shengju Qian, Lingting Zhu, Lei Liu, Wandi Qiao, Ziqiang Li, Lequan Yu, Bin Li

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Nanjing University of Information Science and Technology(南京信息工程大学)

AI总结 本文提出代理调优方法,通过扩散模型增强AR模型在主题驱动图像生成中的能力,揭示了弱到强泛化现象,提升了多主题组合和上下文理解的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏