arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2025-12-03 至 2025-12-03 共收录 8
2512.03046 2025-12-03 cs.CV

MagicQuillV2: Precise and Interactive Image Editing with Layered Visual Cues

MagicQuillV2: 基于分层视觉提示的精确交互式图像编辑

Zichen Liu, Yue Yu, Hao Ouyang, Qiuyu Wang, Shuailei Ma, Ka Leong Cheng, Wen Wang, Qingyan Bai, Yuxuan Zhang, Yanhong Zeng, Yixuan Li, Xing Zhu, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) NEU(南京大学) ZJU(浙江大学) CUHK(香港中文大学)

AI总结 MagicQuillV2通过分层视觉提示实现精确交互式图像编辑,解决传统生成模型与图形软件间的控制与语义平衡问题。

Comments Code and demo available at https://magicquill.art/v2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03041 2025-12-03 cs.CV

MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

MultiShotMaster: 一种可控的多镜头视频生成框架

Qinghe Wang, Xiaoyu Shi, Baolu Li, Weikang Bian, Quande Liu, Huchuan Lu, Xintao Wang, Pengfei Wan, Kun Gai, Xu Jia

机构 * Dalian University of Technology(大连理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

AI总结 MultiShotMaster通过引入两种新型RoPE变体和自动化数据标注管道,实现多镜头视频的灵活生成与可控性。

Comments Project Page: https://qinghew.github.io/MultiShotMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03036 2025-12-03 cs.CV cs.AI

ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation

ViSAudio:端到端视频驱动的双耳空间音频生成

Mengchen Zhang, Qi Chen, Tong Wu, Zihan Liu, Dahua Lin

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Stanford University(斯坦福大学) Beihang University(北航) The Chinese University of Hong Kong(香港中文大学)

AI总结 ViSAudio通过端到端双耳空间音频生成框架,从静音视频直接生成高质量空间音频,提升空间沉浸感和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02729 2025-12-03 cs.RO

RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning

RoboWheel: 从现实世界人类示范数据中提取的机器人学习跨形态数据引擎

Yuhong Zhang, Zihan Gao, Shengpeng Li, Ling-Hao Chen, Kaisheng Liu, Runqing Cheng, Xiao Lin, Junjia Liu, Zhuoheng Li, Jingyi Feng, Ziyan He, Jintian Lin, Zheyan Huang, Zhifang Liu, Haoqian Wang

机构 * Tsinghua University(清华大学) Synapath CUHK(香港中文大学) HKU(香港大学) PolyU

AI总结 RoboWheel通过高精度HOI重建和强化学习优化,将现实世界人类示范转化为跨形态机器人学习的有效数据,提供轻量级、通用的运动表示,提升机器人学习性能。

Comments 27 Pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02523 2025-12-03 cs.SD cs.LG

Generative Multi-modal Feedback for Singing Voice Synthesis Evaluation

生成式多模态反馈用于歌唱语音合成评估

Xueyan Li, Yuxin Wang, Mengjie Jiang, Qingzi Zhu, Jiang Zhang, Zoey Kim, Yazhe Niu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Columbia University(哥伦比亚大学) Dalian University of Technology(大连理工大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出生成式多模态反馈框架,通过音频-语言模型生成多维语言和音频反馈,提升歌唱语音合成评估的准确性和可解释性。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02515 2025-12-03 cs.SD

VibOmni: Towards Scalable Bone-conduction Speech Enhancement on Earables

VibOmni: 向耳戴设备的可扩展骨传导语音增强迈进

Lixing He, Yunqi Guo, Haozheng Hou, Zhenyu Yan

机构 * department of information engineering, The Chinese University of Hong Kong(信息工程系,香港中文大学)

AI总结 VibOmni通过骨传导振动与音频融合,提升耳戴设备在嘈杂环境中的语音质量与噪声抑制能力。

Comments Submitted to TMC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02485 2025-12-03 cs.CV cs.AI

UCAgents: Unidirectional Convergence for Visual Evidence Anchored Multi-Agent Medical Decision-Making

UCAgents: 视觉证据锚定的多智能体医学决策收敛

Qianhan Feng, Zhongzhen Huang, Yakun Zhu, Xiaofan Zhang, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 UCAgents通过结构化证据审计和单向收敛机制,在医疗视觉问答中提升准确率并降低计算成本,平衡视觉证据揭示与文本干扰避免。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07958 2025-12-03 cs.CV

Detect Anything 3D in the Wild

在野外检测任意3D对象

Hanxue Zhang, Haoran Jiang, Qingsong Yao, Yanan Sun, Renrui Zhang, Hao Zhao, Hongyang Li, Hongzi Zhu, Zetong Yang

机构 * OpenDriveLab at Shanghai AI Laboratory(上海人工智能实验室开放驾驶实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Stanford University(斯坦福大学) CUHK MMLab(香港大学多模态实验室) Tsinghua University(清华大学) GAC R&D Center(广汽研发中心)

AI总结 DetAny3D通过结合2D基础模型知识和3D解释器,实现了在任意相机配置下检测任意新物体的3D检测基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏