arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-02-06 至 2026-02-06 共收录 11
2602.05986 2026-02-06 cs.CV cs.AI

RISE-Video: Can Video Generators Decode Implicit World Rules?

RISE-Video: 视频生成器能否解码隐含的世界规则?

Mingxin Liu, Shuran Ma, Shibei Meng, Xiangyu Zhao, Zicheng Zhang, Shaofeng Zhang, Zhihang Zhong, Peixian Chen, Haoyu Cao, Xing Sun, Haodong Duan, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) Xidian University(西安电子科技大学) Beijing Normal University(北京师范大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 RISE-Video通过多维评估框架评估视频生成模型在隐含世界规则推理能力,揭示其在复杂场景模拟中的不足,推动未来生成模型的发展。

Comments 38 pages, 16 figures, 3 tables; Code: https://github.com/VisionXLab/RISE-Video; HuggingFace: https://huggingface.co/datasets/VisionXLab/RISE-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05943 2026-02-06 cs.LG

Orthogonal Model Merging

正交模型融合

Sihan Yang, Kexuan Shi, Weiyang Liu

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

AI总结 正交模型融合通过在正交群流形上进行融合操作,有效保留模型权重的几何结构,减少灾难性遗忘并提升多任务性能。

Comments Technical report (18 pages, 9 figures, project page: https://spherelab.ai/OrthoMerge/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05927 2026-02-06 stat.ML cs.LG

Transformers Are Born Biased: Structural Inductive Biases at Random Initialization and Their Practical Consequences

Transformer 诞生时的偏见:随机初始化下的结构归纳偏见及其实际影响

Siquan Li, Yao Tong, Haonan Wang, Tianyang Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) National University of Singapore(新加坡国立大学)

AI总结 研究揭示了随机初始化的 Transformer 存在结构偏见,通过 SeedPrint 方法区分初始化差异的模型,并解释了注意力机制导致的汇现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05832 2026-02-06 cs.CV

UI-Mem: Self-Evolving Experience Memory for Online Reinforcement Learning in Mobile GUI Agents

UI-Mem: 为移动GUI代理在线强化学习中的自演化经验记忆

Han Xiao, Guozhi Wang, Hao Wang, Shilong Liu, Yuxiang Chai, Yue Pan, Yufeng Zhou, Xiaoxin Chen, Yafei Wen, Hongsheng Li

机构 * Multimedia Laboratory (MMLab), The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shenzhen Loop Area Institute(深圳河套学院) Shanghai AI Lab(上海人工智能实验室) vivo AI Lab(vivo人工智能实验室) Princeton University(普林斯顿大学)

AI总结 UI-Mem通过自演化经验记忆提升移动GUI代理在线强化学习性能,实现跨任务经验转移与策略优化。

Comments 23 pages, 16 figures. Project page: https://ui-mem.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05633 2026-02-06 cs.CL

CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models

CASTLE:一个评估大语言模型学生定制个性化安全性的综合基准

Rui Jia, Ruiyi Lan, Fengrui Liu, Zhongxiang Dai, Bo Jiang, Jing Shao, Jingyuan Chen, Guandong Xu, Fei Wu, Min Zhang

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Education University of Hong Kong(香港教育大学)

AI总结 CASTLE基准通过评估学生定制个性化安全性,揭示大语言模型在不同学生属性下的安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05423 2026-02-06 cs.CV cs.GR

NeVStereo: A NeRF-Driven NVS-Stereo Architecture for High-Fidelity 3D Tasks

NeVStereo: 一种基于NeRF的NVS-立体架构用于高保真3D任务

Pengcheng Chen, Yue Hu, Wenhao Li, Nicole M Gunderson, Andrew Feng, Zhenglong Sun, Peter Beerel, Eric J Seibel

机构 * University of Washington(华盛顿大学) University of Southern California(南加州大学) CUHK-Shenzhen(香港中文大学(深圳)) USC Institute for Creative Technologies(南加州大学创意技术研究所)

AI总结 NeVStereo通过结合NeRF和多视角深度估计,实现了高保真3D重建,显著提升了深度精度和网格质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05273 2026-02-06 cs.RO

Affordance-Aware Interactive Decision-Making and Execution for Ambiguous Instructions

具有包容性的交互决策与执行以应对模糊指令

Hengxuan Xu, Fengbo Lan, Zhixin Zhao, Shengjie Wang, Mengqiao Liu, Jieqian Sun, Yu Cheng, Tao Zhang

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息学院) Computer Science and Engineering Department, Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

AI总结 AIDE通过双流框架整合交互式探索与视觉-语言推理,实现对模糊指令的高效决策与执行,提升机器人在陌生环境中的任务规划能力。

Comments 14 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05207 2026-02-06 eess.AS cs.AI

ARCHI-TTS: A flow-matching-based Text-to-Speech Model with Self-supervised Semantic Aligner and Accelerated Inference

ARCHI-TTS: 一种基于流匹配的文本到语音模型,配备自监督语义对齐器和加速推理

Chunyat Wu, Jiajun Deng, Zhengxi Liu, Zheqi Dai, Haolin He, Qiuqiang Kong

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学)

AI总结 ARCHI-TTS通过自监督语义对齐器和高效推理策略,实现了高效率的文本到语音合成,优于现有最先进系统。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05004 2026-02-06 cs.CL cs.AI

CoWork-X: Experience-Optimized Co-Evolution for Multi-Agent Collaboration System

CoWork-X:面向多智能体协作系统的经验优化共进化

Zexin Lin, Jiachen Yu, Haoyang Zhang, Yuzhao Li, Zhonghang Li, Yujiu Yang, Junjie Wang, Xiaoqiang Ji

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) Tsinghua University(清华大学) AutoGame Research(AutoGame研究) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人研究院)

AI总结 CoWork-X通过主动共进化框架,优化多智能体协作系统的实时协调与多轮适应,实现稳定性能提升和降低延迟与令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04896 2026-02-06 cs.CR cs.AI

Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models

转向外部性:良性激活转向无意中增加大语言模型的劫持风险

Chen Xiong, Zhiyuan He, Pin-Yu Chen, Ching-Yun Ko, Tsung-Yi Ho

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系)

AI总结 本文研究了大语言模型中良性激活转向对安全性的负面影响,发现其无意中增加劫持风险,并通过实验验证了这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19243 2026-02-06 cs.CV

VisionDirector: Vision-Language Guided Closed-Loop Refinement for Generative Image Synthesis

VisionDirector: 生成图像合成中的视觉-语言引导闭环细化

Meng Chu, Senqiao Yang, Haoxuan Che, Suiyun Zhang, Xichen Zhang, Shaozuo Yu, Haokun Gui, Zhefan Rao, Dandan Tu, Rui Liu, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港理工大学) The Chinese University of Hong Kong(香港中文大学) Huawei Research(华为研究)

AI总结 VisionDirector通过视觉-语言引导闭环细化方法,提升生成图像合成中多目标任务的完成度和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏