arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-08-28 至 2026-08-28 共收录 13
2608.27456 2026-08-28 cs.CV 新提交

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

UrbanGround:从局部感知到真实城市中的空间能动性

Tianjie Ju, Zheng Wu, Yueqing Sun, Yuhan Cui, Bobo Li, Shengqiong Wu, Pengzhou Cheng, Haodong Zhao, Zongru Wu, Xinbei Ma, Doris Zhang, Kunling Li, Mong-Li Lee, Wynne Hsu, Hao Fei, Qi Gu, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Meituan(美团) The Chinese University of Hong Kong(香港中文大学) Shanghai University(上海大学) University of Oxford(牛津大学)

AI总结 本文提出首个基于香港3D地理空间数据构建的UrbanGround沙盒,探究MLLM智能体在真实城市中从局部感知转化为可靠行动的程度,发现其长时间探索时错误累积的缺陷,为相关研究提供支撑。

Comments 35 pages, 11 figures, 7 tables. Project Page: this https URL (https://urbanground.github.io), Code Repository: this https URL (https://github.com/UrbanGround/UrbanGround)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27181 2026-08-28 cs.CV 新提交

SSMB: Self-Supervised Local Feature Detection under Motion Blur

SSMB:运动模糊下的自监督局部特征检测

Zhenjun Zhao, Fabio Bellavia, Wenting Wang, Fan Zhu, Jiajun Wu, Suryansh Kumar, Mingqiang Wei, Haoang Li, Javier Civera

机构 * University of Zaragoza(萨拉戈萨大学) University of Palermo(巴勒莫大学) The Chinese University of Hong Kong(香港中文大学) Tohoku University(东北大学) Central South University(中南大学) Texas A&M University(德克萨斯农工大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对运动模糊下关键点检测的挑战,提出无去模糊的自监督关键点检测器SSMB,通过LDE模块及两阶段训练实现,在多项任务上优于现有基线,达到稀疏关键点检测的新最优性能。

Comments 20 pages, 11 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27065 2026-08-28 cs.CV 新提交

Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models

Video-OPSD:利用特权视觉证据实现视频大语言模型中的在线自蒸馏

Ziyue Wang, Shiqi Huang, Weiwen Xu, Bihan Wen, Xudong Jiang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) The Chinese University of Hong Kong(香港中文大学)

AI总结 该研究提出Video-OPSD框架,利用视频内特权视觉证据构建自教师并优化令牌级蒸馏,在多个视频基准上优于标准OPSD,性能接近GRPO且训练时间大幅缩短,为Video-LLMs提供高效后训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27035 2026-08-28 cs.CL 新提交

Representing and Parsing Korean Constituency Structure at Different Levels of Granularity

不同粒度层级下的韩语成分结构表示与分析

Jungyeul Park, KyungTae Lim, Zihao Huang, Eunkyul Leah Jo, Yige Chen, Chulwoo Park

机构 * Korea Advanced Institute of Science & Technology(韩国科学技术院) The University of British Columbia(不列颠哥伦比亚大学) The Chinese University of Hong Kong(香港中文大学) Anyang University(安阳大学)

AI总结 该研究对比三种韩语成分分析表示,评估不同顺序的转换式分析器,发现细粒度的语素+XPOS表示表现最优,同时明确eojeol作为表层标注域的合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26747 2026-08-28 cs.AI 新提交

AgentFold: Closed-Loop Agentic Search for Protein Folding Model Design

AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索

Mingquan Liu, Jiangyu Chen, Hanqun Cao, Xujun Zhang, Pengsen Ma, Xiangru Tang, Shuting Jin, Zhuo Yang, Tianfan Fu, Fang Wu, Xiangxiang Zeng

机构 * Hunan University(湖南大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Wuhan University of Science and Technology(武汉科技大学) Southeast University(东南大学) Stanford University(斯坦福大学)

AI总结 AgentFold是将蛋白质折叠模型开发转化为闭环搜索的多智能体框架,以ESMFold为起点,通过MCTS策略分配计算资源,在匹配预算下较Codex提案提升lDDT 7.5%,优于随机搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26645 2026-08-28 cs.RO 新提交

FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation

FLARE:一种面向视觉-语言机器人操纵中自主修正与恢复的故障感知框架

Ganlong Zhao, Zijia Tang, Xingping Chen, Zhanghui Kuang, Ye Tian, Guanbin Li

机构 * The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Duke University(杜克大学) Sun Yat-sen University(中山大学) TengenX(天工科技) Tencent Robotics X(腾讯Robotics X实验室) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

AI总结 针对视觉-语言机器人操纵中VLAs无法从执行错误恢复的问题,提出含“重试”“重置”范式的FLARE框架,结合MLLM实现故障恢复,显著提升接触密集型操纵任务的成功率与鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26583 2026-08-28 cs.RO 新提交

SOLO: Stable Omni-terrain Long-Horizon Perceptive Humanoid Locomotion

SOLO:稳定全地形长视距感知类人机器人运动

Pihai Sun, Gang Han, Jingkai Sun, Jiahao Ma, Zeran Su, Zelin Tao, Peiran Liu, Shuai Shi, Wei Cui, Zifan Wang, Jialin Yu, Wen Zhao, Kangning Yin, Jiaxu Wang, Jiahang Cao, Lingfeng Zhang, Hao Cheng, Jian Tang, Yijie Guo, Qiang Zhang

机构 * Artificial General Intelligence Institute, University of Science and Technology of China(中国科学技术大学通用人工智能研究院) X-Humanoid(X-人形机器人) The University of Hong Kong(香港大学) The Australian National University(澳大利亚国立大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 SOLO是解决长视距类人机器人运动脆弱性的统一框架,通过QR与TA-MSE蒸馏提升地形感知与策略学习,仿真及实际测试中通行成功率显著优于基线方法,可零样本完成长距离复杂地形任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26517 2026-08-28 cs.CV 新提交

HUG-VIS: A Multimodal Benchmark for Human-centered Understanding and Generation in Visual Intelligence

HUG-VIS:面向视觉智能中以人为中心的理解与生成的多模态基准

Fei Ma, Zebang Cheng, Minghui Li, Hongbo Xu, Yuyong Tan, Yihua Shao, Hanling Wang, Zhou Liu, Yuqing Gao, Dong Wang, Long Ma, Laizhong Cui, Nicu Sebe, Qi Tian

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen University(深圳大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) Tongji University(同济大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) University of Trento(特伦托大学) Huawei(华为)

AI总结 该研究构建了HUG-VIS多模态基准,包含30名演员的8400段同步多模态视频等数据,评估了四类任务的模型,揭示了情感识别、生成等任务的关键特性与现存问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26431 2026-08-28 cs.SD eess.AS 新提交

AudioSpan: Spanning the Duration and Depth of Audio Comprehension

AudioSpan:覆盖音频理解的时长与深度

Wen Huang, Yunfei Chu, Meng Gao, Haolin He, Jin Xu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究提出覆盖10分钟至2小时音频的基准AudioSpan,含3240个分三认知层级的问题,评估12个大型音频-语言模型,发现从长音频提取相关事实是核心难点,该基准可公开获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26140 2026-08-28 cs.CL cs.LG 新提交

Affix Cache for Diffusion Large Language Models

扩散大语言模型的词缀缓存

Kaihua Liang, An Zhong, Xin Tan, Zafar Ayyub Qazi, Hong Xu, Jian Weng, Marco Canini

机构 * KAUST(阿卜杜拉国王科技大学) CUHK(香港中文大学) LUMS(拉合尔管理科学大学)

AI总结 针对扩散大语言模型高效推理难题,提出面向词缀的ACache缓存机制,通过复用词缀缓存并仅重新计算约20%关键锚定词元,可降低延迟、提升吞吐量并恢复精度损失。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24982 2026-08-28 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新

Unsupervised Post-Training of Foundation Models: A Survey

基础模型的无监督后训练:一项综述

Yijie Xu, Qianyi Cai, Huizai Yao, Yili Wang, Tianfu Wang, Cehao Yang, Xingbo Yao, Zhiyu Guo, Aiwei Liu, Xuming Hu, Weiyu Guo, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Xiaohongshu Inc.(小红书公司) WeChat, Tencent(腾讯微信) CUHK(香港中文大学) AI Robotics(人工智能机器人)

AI总结 该综述梳理80种无监督后训练(UPT)方法,按更新信号来源分类,揭示内部信号与任务结构对UPT效果的影响,构建统一框架用于UPT的选择与评估。

Comments Accepted to Findings of EMNLP 2026. 20 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20159 2026-08-28 cs.CV cs.AI cs.LG cs.MM cs.RO 版本更新

A Very Big Video Reasoning Suite

一个非常大的视频推理套件

Maijunxian Wang, Ruisi Wang, Juyi Lin, Ran Ji, Thaddäus Wiedemer, Qingying Gao, Dezhi Luo, Yaoyao Qian, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Jiachen Li, Hanwen Xing, Tianqi Zhao, Fengyuan Yu, Weihang Xiao, Yizheng Jiao, Jianheng Hou, Danyang Zhang, Pengcheng Xu, Boyang Zhong, Zehong Zhao, Gaoyun Fang, John Kitaoka, Yile Xu, Hua Xu, Kenton Blacutt, Tin Nguyen, Siyuan Song, Haoran Sun, Shaoyue Wen, Linyang He, Runming Wang, Yanzhi Wang, Mengyue Yang, Ziqiao Ma, Raphaël Millière, Freda Shi, Nuno Vasconcelos, Daniel Khashabi, Alan Yuille, Yilun Du, Ziming Liu, Bo Li, Dahua Lin, Ziwei Liu, Vikash Kumar, Yijiang Li, Lei Yang, Zhongang Cai, Hokin Deng

机构 * University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) University of Tübingen(图宾根大学) Johns Hopkins University(约翰霍普金斯大学) University of Michigan(密歇根大学) University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Stanford University(斯坦福大学) University of Texas at Austin(得克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Cornell University(康奈尔大学) San Jose State University(圣何塞州立大学) University of California, Irvine(加州大学尔湾分校) Technical University of Munich(慕尼黑技术大学) University of California, San Diego(加州大学圣地亚哥分校) Imperial College London(伦敦帝国学院) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) University of Edinburgh(爱丁堡大学) Hong Kong University of Science(香港科学大学) New York University(纽约大学) Auburn University(阿伯丁大学) Columbia University(哥伦比亚大学) University of Bristol(布里斯托大学) University of Waterloo(滑铁卢大学) The Chinese University of Hong Kong(香港中文大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 VBVR数据集和评估框架旨在解决视频推理能力研究中的大规模数据缺乏问题,通过大规模实验观察到对未见任务的泛化能力。

Comments Homepage: this https URL (https://video-reason.com/?v=vbvr)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22203 2026-08-28 cs.LG cs.AI cs.CL 版本更新

From Accuracy to Robustness: A Study of Rule- and Model-based Verifiers in Mathematical Reasoning

从准确率到鲁棒性:数学推理中基于规则与基于模型的验证器研究

Yuzhen Huang, Weihao Zeng, Xingshan Zeng, Qi Zhu, Junxian He

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 本研究以数学推理为案例,分析了基于规则与基于模型的验证器在静态评估和RL训练中的表现,发现两类验证器分别存在误拒和奖励黑客问题,为开发更优RL奖励系统提供了参考。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏