arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2025-12-05 至 2025-12-05 共收录 11
2512.05112 2025-12-05 cs.CV cs.AI cs.CL cs.LG

DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation

DraCo: 文本到图像预览与稀有概念生成的草稿作为CoT

Dongzhi Jiang, Renrui Zhang, Haodong Li, Zhuofan Zong, Ziyu Guo, Jun He, Claire Guo, Junyan Ye, Rongyao Fang, Weijia Li, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学 MMLab) CUHK IMIXR(香港中文大学 IMIXR) Sun Yat-Sen University(中山大学) SCUT(华南理工大学) CUHK (Shenzhen)(香港中文大学(深圳))

AI总结 DraCo通过结合文本和视觉内容的交错推理,提升文本到图像生成的精度和稀有概念生成能力。

Comments Project Page: https://github.com/CaraJ7/DraCo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05111 2025-12-05 cs.CV

ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning

ARM-Thinker: 通过智能工具使用和视觉推理强化多模态生成奖励模型

Shengyuan Ding, Xinyu Fang, Ziyu Liu, Yuhang Zang, Yuhang Cao, Xiangyu Zhao, Haodong Duan, Xiaoyi Dong, Jianze Liang, Bin Wang, Conghui He, Dahua Lin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 ARM-Thinker通过智能工具使用和视觉推理提升多模态奖励模型的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05091 2025-12-05 cs.CV

Visual Reasoning Tracer: Object-Level Grounded Reasoning Benchmark

视觉推理追踪器:对象级 grounded 推理基准

Haobo Yuan, Yueyi Sun, Yanwei Li, Tao Zhang, Xueqing Deng, Henghui Ding, Lu Qi, Anran Wang, Xiangtai Li, Ming-Hsuan Yang

机构 * UC Merced(加州大学默塞德分校) PKU(北京大学) NTU(国立台湾大学) CUHK(香港中文大学) WHU(武汉大学) FDU(福建大学)

AI总结 本文提出视觉推理追踪器任务,通过对象级 grounded 推理基准评估模型的推理路径生成能力,并引入了新的评估指标和大规模数据集提升模型推理表现。

Comments Technical Report; Project Page: https://harboryuan.github.io/visual-reasoning-tracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04985 2025-12-05 stat.ML cs.LG math.ST stat.TH

Towards a unified framework for guided diffusion models

迈向引导扩散模型的统一框架

Yuchen Jiao, Yuxin Chen, Gen Li

机构 * Department of Statistics, the Chinese University of Hong Kong, Hong Kong(香港中文大学统计学系) Department of Statistics and Data Science, the Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院统计学与数据科学系)

AI总结 本文提出统一框架,通过引入奖励引导项提升扩散模型奖励表现,并首次理论化无分类器引导的性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04837 2025-12-05 cs.CV

A Sanity Check for Multi-In-Domain Face Forgery Detection in the Real World

多域现实世界面部伪造检测的 sanity 检查

Jikang Cheng, Renye Yan, Zhiyuan Yan, Yaozhong Gan, Xueyi Zhang, Zhongyuan Wang, Wei Peng, Ling Liang

机构 * Peking University(北京大学) Nanjing University(南京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Wuhan University(武汉大学) Stanford University(斯坦福大学)

AI总结 本文提出多域现实世界面部伪造检测范式,通过DevDet框架提升真实伪造区分能力,实现在无域指定条件下的准确判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03783 2025-12-05 cs.AI cs.SD

Omni-AutoThink: Adaptive Multimodal Reasoning via Reinforcement Learning

Omni-AutoThink: 通过强化学习实现自适应多模态推理

Dongchao Yang, Songxiang Liu, Disong Wang, Yuanyuan Wang, Guanglu Wan, Helen Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Meituan(美团)

AI总结 Omni-AutoThink通过强化学习实现自适应多模态推理,提升模型在不同任务难度下的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12723 2025-12-05 cs.CL

On-Policy Optimization with Group Equivalent Preference for Multi-Programming Language Understanding

基于组等价偏好的多编程语言理解的在线优化

Haoyuan Wu, Rui Ming, Jilong Gao, Hangyu Zhao, Xueyi Chen, Yikai Yang, Haisheng Zheng, Zhuolun He, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) ChatEDA Tech(ChatEDA科技)

AI总结 本文提出OORL框架和GEPO方法,通过代码翻译任务提升LLMs对多编程语言代码功能的理解和跨语言关系的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04530 2025-12-05 cs.LG

Explainable Graph Representation Learning via Graph Pattern Analysis

通过图模式分析实现可解释的图表示学习

Xudong Wang, Ziheng Sun, Chris Ding, Jicong Fan

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(数据科学学院,香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院)

AI总结 本文提出PXGL-GNN框架,通过图模式分析实现图表示的可解释性,解决了传统方法在节点特征忽略和高维问题上的局限。

Comments Full version with appendix of the paper published in the Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence (IJCAI-25), Main Track

Journal ref Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence (IJCAI-25), Main Track, pages 3426-3434, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23075 2025-12-05 cs.CV cs.AI

SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models

SpaceMind: 基于摄像头引导的模态融合用于视觉-语言模型中的空间推理

Ruosen Zhao, Zhikang Zhang, Jialei Xu, Jiahao Chang, Dong Chen, Lingyun Li, Weijian Sun, Zizhuang Wei

机构 * Huawei(华为) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

AI总结 SpaceMind通过摄像头引导的模态融合方法,提升视觉-语言模型在空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01903 2025-12-05 cs.SD eess.AS

MelTok: 2D Tokenization for Single-Codebook Audio Compression

MelTok:单代码本音频压缩的2D分token化

Jingyi Li, Zhiyuan Zhao, Zhisheng Zhang, Yunfei Liu, Lijian Lin, Ye Zhu, Jiahao Wu, Qiuqiang Kong, Yu Li

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院) Chinese University of Hong Kong(香港中文大学) Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院)

AI总结 MelTok通过二维分token化和基于分token的vocoder,实现单代码本下的高效音频压缩与高质量重建。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15610 2025-12-05 cs.LG cs.AI

A general language model for peptide function identification

一种用于肽功能识别的通用语言模型

Jixiu Zhai, Zikun Wang, Chupei Tang, Haitian Zhong, Ziyang Xu, Yuhuan Liu, Shengrui Xu, Jingwan Wang, Dan Huang, Tianchi Lu

机构 * School of Mathematics and Statistics, Lanzhou University(兰州大学数学与统计学学院) Department of Computer Science, City University of Hong Kong(城市大学计算机科学系) Shanghai Innovation Institute(上海创新研究院) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室、多模态人工智能系统国家重点实验室、自动化研究所、中国科学院) Department of Mathematics, The Chinese University of Hong Kong(香港中文大学数学系) Cuiying Honors College, Lanzhou University(崔莹荣誉学院,兰州大学) Department of Mathematics, Harbin Engineering University(哈尔滨工程大学数学系)

AI总结 PDeepPP是一种整合预训练蛋白质语言模型与混合Transformer-CNN架构的通用语言模型,用于高效识别多种肽类和PTM位点,实现高精度和可解释的肽表示。

Comments 15 pages, 5 figures, 3 tables, submitted to arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏