arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-01-09 至 2026-01-09 共收录 14
2601.05239 2026-01-09 cs.CV

Plenoptic Video Generation

光场视频生成

Xiao Fu, Shitao Tang, Min Shi, Xian Liu, Jinwei Gu, Ming-Yu Liu, Dahua Lin, Chen-Hsuan Lin

机构 * NVIDIA The Chinese University of Hong Kong(香港中文大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 PlenopticDreamer通过多输入单输出视频条件模型和相机引导检索策略,实现高质量多视角视频重绘,提升时空一致性和视角转换能力。

Comments Project Page: https://research.nvidia.com/labs/dir/plenopticdreamer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05073 2026-01-09 cs.LG

Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward

几何推理的里程碑:通过子目标可验证奖励解锁几何推理

Jianlong Chen, Daocheng Fu, Shengze Xu, Jiawei Chen, Yuan Feng, Yue Yang, Junchi Yan, Hongyuan Zha, Renqiu Xia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学)

AI总结 本文提出SGVR框架,通过子目标可验证奖励提升多模态大语言模型在几何推理及泛化能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04973 2026-01-09 cs.AI cs.CL

ConMax: Confidence-Maximizing Compression for Efficient Chain-of-Thought Reasoning

ConMax:用于高效思维链推理的置信度最大化压缩

Minda Hu, Zexuan Qiu, Zenan Xu, Kun Li, Bo Zhou, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) LLM Department, Tencent(腾讯机器学习部门)

AI总结 ConMax通过强化学习框架在保持推理模式的同时,高效压缩推理轨迹,提升大规模推理模型的效率与性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04897 2026-01-09 cs.CL cs.CV cs.LG cs.MM

V-FAT: Benchmarking Visual Fidelity Against Text-bias

V-FAT:基于文本偏见的视觉真实性基准测试

Ziteng Wang, Yujie He, Guanliang Li, Siqi Yang, Jiaqi Xiong, Songxiang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Meituan(美团) University of Oxford(牛津大学)

AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03193 2026-01-09 cs.CV cs.AI

UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision

UniCorn:通过自生成监督实现自我改进的统一多模态模型

Ruiyan Han, Zhen Fang, XinYu Sun, Yuchen Ma, Ziheng Wang, Yu Zeng, Zehui Chen, Lin Chen, Wenxuan Huang, Wei-Jie Xu, Yi Cao, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(脑智能基础与应用联合实验室,中国科学技术大学) FDU(复旦大学) ECNU(华东师范大学) CUHK(香港中文大学) NJU(南京大学) SUDA(上海大学)

AI总结 UniCorn通过自生成监督实现统一多模态模型的自我改进,提升多模态生成质量与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21400 2026-01-09 cs.LG cs.IT math.IT math.ST stat.ML stat.TH

Breaking AR's Sampling Bottleneck: Provable Acceleration via Diffusion Language Models

突破生成模型的采样瓶颈:通过扩散语言模型实现可证明的加速

Gen Li, Changxiao Cai

机构 * Department of Statistics and Data Science, Chinese University of Hong Kong, Hong Kong(统计与数据科学系,香港中文大学) Department of Industrial and Operations Engineering, University of Michigan, Ann Arbor, USA(工业与运营管理系,密歇根大学)

AI总结 本文从信息论角度为扩散语言模型提供收敛保证,证明采样误差随迭代次数减少而降低,从而突破自回归模型所需的L步瓶颈,为生成高质量样本提供理论支持。

Comments This is the full version of a paper published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04656 2026-01-09 cs.SD

FlexiVoice: Enabling Flexible Style Control in Zero-Shot TTS with Natural Language Instructions

FlexiVoice: 通过自然语言指令实现零样本语音合成的灵活风格控制

Dekun Chen, Xueyao Zhang, Yuancheng Wang, Kenan Dai, Li Ma, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Technologies Co., Ltd(华为技术有限公司)

AI总结 FlexiVoice通过自然语言指令实现零样本语音合成的灵活风格控制,结合LLM核心和PPT方案,实现风格与音色的精准解耦与可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04648 2026-01-09 cs.GT cs.DC cs.LG

Mechanism Design for Federated Learning with Non-Monotonic Network Effects

联邦学习中非单调网络效应的机制设计

Xiang Li, Bing Luo, Jianwei Huang, Yuan Luo

机构 * Shenzhen Loop Area Institute(深圳河套学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究所) School of Science and Engineering(科学与工程学院) Data Science Research Center(数据科学研究中心) Duke Kunshan University(杜克昆山大学) Shenzhen Key Laboratory of Crowd Intelligence Empowered Low-Carbon Energy Network(深圳 Crowd Intelligence 赋能低碳能源网络重点实验室) CSIJRI Joint Research Centre on Smart Energy Storage(CSIJRI 智能储能联合研究中心) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出了一种考虑非单调网络效应和应用需求的联邦学习激励机制,通过模型交易和共享框架提升社会福利。

Comments Journal extension of Mobihoc conference version, under review of IEEE TMC

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04616 2026-01-09 cs.LG cs.AI

DeepHalo: A Neural Choice Model with Controllable Context Effects

DeepHalo:具有可控上下文效应的神经选择模型

Shuhan Zhang, Zhi Wang, Rui Gao, Shuang Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Toronto(多伦多大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 DeepHalo是一种能够控制上下文效应阶数的神经选择模型,通过显式控制交互阶数和原则性解释上下文效应,提升决策建模的可解释性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04611 2026-01-09 cs.CL

Character-R1: Enhancing Role-Aware Reasoning in Role-Playing Agents via RLVR

Character-R1: 通过RLVR增强角色感知推理

Yihong Tang, Kehai Chen, Xuefeng Bai, Benyou Wang, Zeming Liu, Haifeng Wang, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology(计算与智能研究所,哈尔滨工业大学) Shenzhen Loop Area Institute (SLAI)(深圳环城研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Baidu Inc.(百度公司)

AI总结 Character-R1通过引入三种核心设计提升角色感知推理能力,有效解决角色扮演代理中的认知一致性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04343 2026-01-09 cs.SD cs.AI eess.AS

Summary of The Inaugural Music Source Restoration Challenge

音乐源恢复挑战赛概述

Yongyi Zang, Jiarui Hai, Wanying Ge, Qiuqiang Kong, Zheqi Dai, Helin Wang, Yuki Mitsufuji, Mark D. Plumbley

机构 * Independent Researcher(独立研究者) Johns Hopkins University(约翰霍普金斯大学) The Chinese University of Hong Kong(香港中文大学) Sony AI(索尼人工智能) King's College London(伦敦国王学院)

AI总结 音乐源恢复挑战赛评估了不同系统在恢复退化音频中乐器声部的性能,揭示了不同乐器恢复难度差异及各系统表现

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02356 2026-01-09 cs.CV

Talk2Move: Reinforcement Learning for Text-Instructed Object-Level Geometric Transformation in Scenes

Talk2Move: 基于强化学习的文本指令下场景中物体级几何变换

Jing Tan, Zhaoyang Zhang, Yantao Shen, Jiarui Cai, Shuo Yang, Jiajun Wu, Wei Xia, Zhuowen Tu, Stefano Soatto

机构 * AWS Agentic AI(AWS智能AI) Amazon Web Services(亚马逊网络服务) Amazon Robotics(亚马逊机器人技术) CUHK(香港中文大学)

AI总结 Talk2Move通过强化学习实现文本指令下的场景中物体级几何变换,利用组相对策略优化和空间奖励引导模型,提升学习效率并实现精确且一致的物体变换。

Comments Project page: https://sparkstj.github.io/talk2move

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10991 2026-01-09 cs.CR cs.AI

MCP-Guard: A Multi-Stage Defense-in-Depth Framework for Securing Model Context Protocol in Agentic AI

MCP-Guard: 一种多阶段纵深防御框架,用于保障代理AI中的模型上下文协议安全

Wenpeng Xing, Zhonghao Qi, Yupeng Qin, Yilin Li, Caini Chang, Jiahui Yu, Changting Lin, Zhenzhen Xie, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) The Chinese University of Hong Kong(香港中文大学) Shandong University(山东大学)

AI总结 MCP-Guard通过多阶段防御框架提升LLM与工具交互的安全性,利用E5模型和仲裁器实现高准确率的对抗性提示检测,并通过MCP-ATTACKBENCH验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15361 2026-01-09 cs.CV

Boosting HDR Image Reconstruction via Semantic Knowledge Transfer

通过语义知识迁移提升HDR图像重建

Tao Hu, Longyao Wu, Wei Dong, Peng Wu, Jinqiu Sun, Xiaogang Xu, Qingsen Yan, Yanning Zhang

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院) School of Astronautics, Northwestern Polytechnical University(西北工业大学航天学院) Shaanxi University of Science & Technology(陕西科技大学) Xi’an University of Architecture and Technology(西安建筑科技大学) Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出通过语义知识迁移提升HDR图像重建的方法,利用语义先验知识和自我蒸馏机制改进现有重建模型。

详情

展开后加载摘要…

URL PDF HTML 收藏