arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2025-12-01 至 2025-12-01 共收录 10
2511.23475 2025-12-01 cs.CV

AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement

AnyTalker: 通过交互细化扩展多人物谈话视频生成

Zhizhou Zhong, Yicheng Ji, Zhe Kong, Yiying Liu, Jiarui Wang, Jiasun Feng, Lupeng Liu, Xiangyi Wang, Yanjia Li, Yuqing She, Ying Qin, Huan Li, Shuiyang Mao, Wei Liu, Wenhan Luo

机构 * Hong Kong University of Science and Technology(香港科技大学) Video Rebirth(视频重生) Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

AI总结 AnyTalker通过引入身份感知注意力机制和高效训练流程,实现了多人物谈话视频生成的高可扩展性和自然交互性。

Comments Homepage: https://hkust-c4g.github.io/AnyTalker-homepage

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22805 2025-12-01 cs.CV cs.LG cs.MM

From Pixels to Feelings: Aligning MLLMs with Human Cognitive Perception of Images

从像素到感受:将MLLMs对齐于人类对图像的认知感知

Yiming Chen, Junlin Han, Tianyi Bai, Shengbang Tong, Filippos Kokkinos, Philip Torr

机构 * Oxford University(牛津大学) HKUST(香港科技大学) University College London(伦敦大学学院) New York University(纽约大学)

AI总结 本文提出CogIP-Bench基准,通过后训练提升MLLMs对图像认知属性的对齐能力,并展示其在图像生成中的应用。

Comments Project page with codes/datasets/models: https://follen-cry.github.io/MLLM-Cognition-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19637 2025-12-01 cs.CV

Enhanced Partially Relevant Video Retrieval through Inter- and Intra-Sample Analysis with Coherence Prediction

通过互样本分析和内样本分析增强部分相关视频检索

Junlong Ren, Gangjian Zhang, Yu Hu, Jian Shu, Hui Xiong, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出了一种增强部分相关视频检索的方法,通过互样本分析和内样本分析,结合时间一致性预测模块,提升视频与文本查询的语义对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22471 2025-12-01 cs.CV

Rethinking Cross-Generator Image Forgery Detection through DINOv3

重新思考通过DINOv3进行跨生成器图像伪造检测

Zhenglin Huang, Jason Li, Haiquan Wen, Tianxiao Li, Xi Yang, Lu Qi, Bei Peng, Xiaowei Huang, Ming-Hsuan Yang, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学) Nanyang Technological University(南洋理工大学) HKUST(香港科技大学) UC Merced(加州大学默塞德分校) University of Sheffield(谢菲尔德大学)

AI总结 通过DINOv3发现无需训练即可实现跨生成器图像伪造检测,利用令牌排名策略提升检测准确度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22355 2025-12-01 cs.LG

AutoTailor: Automatic and Efficient Adaptive Model Deployment for Diverse Edge Devices

AutoTailor: 为异构边缘设备实现自动且高效的自适应模型部署

Mengyang Liu, Chenyu Lu, Haodong Tian, Fang Dong, Ruiting Zhou, Wei Wang, Dian Shen, Guangtong Li, Ye Wan, Li Li

机构 * Southeast University(东南大学) Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) University of Macau(澳门大学)

AI总结 AutoTailor通过自动化端到端SuperNet自适应模型部署,显著提升边缘设备的推理效率和模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22147 2025-12-01 cs.CV cs.AI cs.CR

RemedyGS: Defend 3D Gaussian Splatting against Computation Cost Attacks

RemedyGS: 保护3D高斯散射免受计算成本攻击

Yanping Li, Zhening Liu, Zijian Li, Zehong Lin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 RemedyGS通过检测和净化被污染的图像,有效防御3DGS中的计算成本攻击,提升系统安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22080 2025-12-01 cs.LG cs.AI cs.DC

A Fast and Flat Federated Learning Method via Weighted Momentum and Sharpness-Aware Minimization

一种通过加权动量和尖锐意识最小化实现快速且平坦的联邦学习方法

Tianle Li, Yongzhi Huang, Linshan Jiang, Chang Liu, Qipeng Xie, Wenfeng Du, Lu Wang, Kaishun Wu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) National University of Singapore(新加坡国立大学) Nanyang Technological University, Singapore(南洋理工大学,新加坡) Shenzhen University(深圳大学)

AI总结 FedWMSAM通过加权动量和尖锐意识最小化解决非IID联邦学习中的局部-全局曲率不一致和动量-回声振荡问题,提升模型收敛速度和泛化能力。

Journal ref Advances in Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22055 2025-12-01 cs.CV cs.MM

OralGPT-Omni: A Versatile Dental Multimodal Large Language Model

OralGPT-Omni: 一种多功能的牙科多模态大语言模型

Jing Hao, Yuci Liang, Lizhuo Lin, Yuxuan Fan, Wenkai Zhou, Kaixin Guo, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Yanqi Yang, Qiankun Li, Hao Tang, James Kit-Hon Tsoi, Linlin Shen, Kuo Feng Hung

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Singapore University of Technology and Design(新加坡科技与设计大学) University of Auckland(奥克兰大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science, Peking University(北京大学计算机学院) College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

AI总结 OralGPT-Omni是一种专门用于牙科的多模态大语言模型,通过TRACE-CoT数据集和四阶段训练范式,实现了对牙科图像的高效分析和高准确率评估。

Comments 47 pages, 42 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21887 2025-12-01 cs.CV

UniArt: Unified 3D Representation for Generating 3D Articulated Objects with Open-Set Articulation

UniArt: 一种统一的3D表示方法,用于从单张图像生成具有开集关节的3D可动物体

Bu Jin, Weize Li, Songen Gu, Yupeng Zheng, Yuhang Zheng, Zhengyi Zhou, Yao Yao

机构 * Hong Kong University of Science and Technology(香港理工大学) Tsinghua University(清华大学) Nanjing University(南京大学)

AI总结 UniArt通过统一的潜在表示和开集关节预测方法,实现了从单张图像生成高质量可动3D物体的端到端合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02009 2025-12-01 cs.RO

Trust-Preserved Human-Robot Shared Autonomy enabled by Bayesian Relational Event Modeling

基于贝叶斯关系事件建模的信任保留人机协同自主性

Yingke Li, Fumin Zhang

机构 * School of Electrical and Computer Engineering, Georgia Institute of Technology(电子与计算机工程学院,佐治亚理工学院) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科技大学)

AI总结 本文提出基于贝叶斯关系事件建模的信任保留协同自主策略,通过动态推断人类信任提升人机协作效率与用户接受度。

Journal ref in IEEE Robotics and Automation Letters, vol. 9, no. 11, pp. 10716-10723, Nov. 2024

详情

展开后加载摘要…

URL PDF HTML 收藏