arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-09-01 至 2026-09-01 共收录 18
2608.31075 2026-09-01 cs.AI 新提交

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

超越人类监督扩展大型推理模型:通往超级智能的路径

Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院) Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Hong Kong Baptist University(香港浸会大学) Hunyuan Tencent(腾讯混元) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

AI总结 本文研究人类监督逐步退出时大型推理模型(LRMs)的扩展路径,提出五级阶梯框架,分析自主化带来的风险,围绕策略能力等开展评估,为开发通往超级智能的自我维持学习系统提供结构化方案。

Comments 72pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31036 2026-09-01 cs.LG 新提交

Normalized Low-Rank Adaptation

归一化低秩适配

Jiale Kang, Ziyin Yue, Zheng Zhan, Yangyi Huang, Weiyang Liu

机构 * Yuanshi Intelligence(元氏智能) The Chinese University of Hong Kong(香港中文大学) Microsoft Research(微软研究院) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对LoRA训练动态正则化不足的问题,提出归一化低秩适配(NoRA),通过归一化下投影矩阵提升LoRA性能,在多任务中加速收敛、改善稳定性并缓解灾难性遗忘,且无额外计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30536 2026-09-01 cs.RO 新提交

Behavior-Skill: A Fine-Grained Benchmark for Evaluating Vision-Language-Action Policies in Long-Horizon Tasks

Behavior-Skill:用于评估长 horizon 任务中视觉-语言-动作策略的细粒度基准

Chunyun Ma, Lun Luo, Xingjian Luo, Xiexing Feng, Hang Zhang, Wei Liu, Feng Qiao, Yaonan Wang, Huimin Lu, Xieyuanli Chen

机构 * XPeng Inc.(小鹏汽车) The Chinese University of Hong Kong(香港中文大学) Hunan University(湖南大学)

AI总结 本研究提出细粒度基准 Behavior-Skill,含 235492 个技能实例,引入轨迹与技能级指标,实验发现接触丰富操作技能是长 horizon VLA 策略瓶颈,可用于分析改进该类策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30400 2026-09-01 cs.CV 新提交

Real-Time Scene-Adaptive Tone Mapping for High-Dynamic Range Object Detection

面向高动态范围目标检测的实时场景自适应色调映射

Gongzhe Li, Linwei Qiu, Peibei Cao, Fengying Xie, Xiangyang Ji, Qilin Sun

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Tianmushan Laboratory, Beihang University(北京航空航天大学天目山实验室) School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系) Point Spread Technology(点扩散科技)

AI总结 本文提出一种场景自适应实时色调映射方法,通过神经光度校准等技术解决HDR图像适配检测网络的问题,性能优于传统算法,可在NVIDIA Jetson平台实现4K HDR图像实时处理。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30395 2026-09-01 cs.CL 新提交

When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models

当大语言模型遇到树搜索:大语言模型中作为搜索的推理的系统视角

Jiaqi Wei, Xiang Zhang, Yuejin Yang, Wenxuan Huang, Juntai Cao, Sheng Xu, Xiang Zhuang, Zhangyang Gao, Muhammad Abdul-Mageed, Laks VS Lakshmanan, Chenyu You, Wanli Ouyang, Siqi Sun

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) University of British Columbia(不列颠哥伦比亚大学) Stony Brook University(石溪大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本综述将大语言模型的推理视为搜索,系统化基于树搜索的推理进展,引入统一设计空间并倡导标准化计算报告,以优化推理权衡。

Comments Accepted by EMNLP'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30344 2026-09-01 cs.CV cs.CG cs.GR cs.RO 新提交

Proximity3D: Shape from Capacitive Proximity on Sensing Manifold

Proximity3D:基于感知流形上电容邻近性的形状重建

Hao Chen, Chenming Wu, Chun Ping Lam, Xiangjia Chen, Guoxin Fang, Charlie C. L. Wang, Yeung Yam, Juncong Lin, Chengkai Dai

机构 * Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Xiamen University(厦门大学) The Chinese University of Hong Kong(香港中文大学) The University of Manchester(曼彻斯特大学)

AI总结 Proximity3D提出将弯曲电容织物表面作为非平面感知流形,引入多视图前馈重建模型,通过聚合电容邻近场实现物体形状鲁棒重建,为机器人近场几何感知提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30289 2026-09-01 cs.RO 新提交

CometVLA: Co-Training on an Embodied Data Pyramid towards Physical Understanding

CometVLA:基于具身数据金字塔的协同训练以实现物理理解

Hanwen Wan, Dafeng Chi, Linbo Zhai, Tianao Shen, Yuzheng Zhuang, Tianle Zhang, Peidong Liu, Liang Lin, Xiaoqiang Ji

机构 * JD Explore Academy(京东探索研究院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳市人工智能与机器人研究院) South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

AI总结 该研究提出CometVLA,通过构建与机器人动作对齐的具身物理VQA数据及引入GAP token,在具身数据金字塔上协同训练,提升VLA模型的物理理解能力,显著优于基线模型并验证了物理预训练对下游操作的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29783 2026-09-01 cs.CV 新提交

InspectorGPT: A Comparative Reasoning Enhanced VLM for Comprehensive Industrial Anomaly Detection

InspectorGPT:用于全面工业异常检测的对比推理增强型视觉语言模型(VLM)

Weifei Chen, Honghao Zhang, Zhiyuan You, Xinyi Le

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究提出InspectorGPT,一种结合对比推理的VLM框架,通过CoT微调与GRPO优化,配合任务向量融合的InspectorGPT-Seg实现工业异常检测,在多维度性能及未见基准泛化上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29715 2026-09-01 cs.LG cs.AI cs.CL 新提交

Higher-Dimensional Rotary Position Embedding

高维旋转位置嵌入

Yixing Li, Ruobing Xie, Yudong Zhang, Yushi Bai, Samm Sun, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent Hunyuan(腾讯混元) Tsinghua University(清华大学) University of Macau(澳门大学)

AI总结 针对RoPE跨通道混合与鲁棒性不足的问题,提出HD-RoPE,通过扩展至高维旋转并引入Paley-I正交基,在无额外参数的情况下提升性能,获基准测试显著改善。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29516 2026-09-01 cs.RO 新提交

Task-Relevant Feature-Dynamics Fidelity Enables Zero-Shot Sim-to-Real Transfer for Robotic Ultrasound Scanning

任务相关特征动力学保真度实现机器人超声扫描的零样本仿真到真实迁移

Yizhao Qian, Jiayuan Luo, Wanyi Zhu, Yameng Zhang, Max Q. -H. Meng, Yixuan Yuan, Li Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Great Bay University(大湾区大学) Dongguan Great Bay Institute for Advanced Study(东莞大湾区先进研究院) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

AI总结 该研究提出任务相关特征动力学保真度(TR-FDF),开发面向TR-FDF的超声模拟器,实现仅仿真训练的机器人超声策略在体模实验中400次零样本部署成功390次,提升零样本仿真到真实迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29252 2026-09-01 cs.AI 新提交

Dynamic Important Example Mining for Reinforcement Finetuning

用于强化微调的动态重要示例挖掘

Haoru Tan, Sitong Wu, Yanfeng Chen, Shizhen Zhao, Yang-Tian Sun, Tianjia Liu, Chirui Chang, Shaofeng Zhang, Samm Sun, Xiuzhe Wu, Ruobing Xie, Xiaojuan Qi

机构 * HKU(香港大学) Tencent(腾讯) CUHK(香港中文大学) Stanford(斯坦福大学)

AI总结 该研究针对强化微调中样本价值固定假设的缺陷,提出DIEM框架,整合梯度对齐重要性估计器与约束批量重加权方案,在多个推理基准中优于相关基线。

Journal ref CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29242 2026-09-01 cs.RO 新提交

AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization

AnyWorld:用于跨 embodiments 泛化的分解式第一人称世界模型

Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

机构 * Nanyang Technological University(南洋理工大学) Institute of Advanced Intelligence and Computing, A*STAR(新加坡科技研究局高级智能与计算研究院) XPENG Robotics(小鹏机器人) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 AnyWorld 框架通过分解交互为动作、相机、embodiment 因子,将人类交互重组为机器人原生经验,生成数据可提升机器人操作性能,验证了动作校准与视觉重组的必要性。

Comments Project page: https://xpeng-robotics.github.io/anyworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29177 2026-09-01 cs.CV 新提交

Dynamic-Robust Photometric-Semantic Reconstruction for Open-Vocabulary 3D Scene Understanding

面向开放词汇三维场景理解的动态鲁棒光度-语义重建

Boyu Cai, Li Yang, Yan Xu, Wei Liu, Nian Liu, Sikui Zhang, Yan Wang, Chunfeng Yuan, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) The Chinese University of Hong Kong(香港中文大学) Deepeleph Intelligent Technology(深智科技)

AI总结 提出SPAR架构与动态区域感知训练范式,解决NVS与OVS模型在动态场景的特征错位问题,在D-RE10K基准上实现SOTA性能,3/4视图下PSNR达22.15/23.33 dB,运动掩码预测mIoU达88.5%。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29108 2026-09-01 cs.RO 新提交

From Multi-Modal Paths to Executable Trajectories: A Trajectory Planning Framework for 4WIS Robots

从多模态路径到可执行轨迹:面向四轮独立转向(4WIS)机器人的轨迹规划框架

Runjiao Bao, Lin Zhang, Yongkang Xu, Shoukun Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Beijing Institute of Technology(北京理工大学) Shenzhen Research Institute of Nankai University(南开大学深圳研究院)

AI总结 针对4WIS机器人现有规划方法无法充分利用其多模态能力的问题,提出结合模式增强前端搜索与模式一致后端优化的轨迹规划框架,实验验证了其综合性能与实际可执行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29066 2026-09-01 cs.CL cs.AI 新提交

Not All or None: Dynamic Construction of Target-aware Memory Graph for Conversational Stance Detection

非全即无:面向对话式立场检测的目标感知记忆图的动态构建

Yifan Xiang, Bin Liang, Yuqi Huang, Ruifeng Xu, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 针对对话式立场检测中历史对话信息利用的噪声问题,提出目标感知记忆图TamGraph,通过熵引导回溯机制动态构建目标感知图,提升LLM在该任务上的性能。

Comments Accepted in EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29003 2026-09-01 cs.CV cs.AI 新提交

RoSe-SLAM: Robust Semantic-Aware Gaussian Splatting SLAM from Dynamic Monocular Videos

RoSe-SLAM:面向动态单目视频的鲁棒语义感知高斯溅射SLAM

Wenting Wang, Jiaxin Guo, Wenzhen Dong, Yun-Hui Liu, Charlie C. L. Wang, Yeung Yam

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Manchester(曼彻斯特大学) Centre for Perceptual and Interactive Intelligence (CPII) Limited(感知与互动智能中心有限公司)

AI总结 本研究提出RoSe-SLAM,利用2D基础模型语义特征与时空运动掩码等模块,结合几何与语义线索,在动态单目视频中实现更优的SLAM性能,优于现有动态RGB SLAM基线。

Comments Accepted by IEEE/RSJ INTERNATIONAL CONFERENCE ON INTELLIGENT ROBOTS & SYSTEMS (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28970 2026-09-01 cs.SD cs.AI 新提交

Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction

诊断后优化:基于AudioLLM引导校正的闭环TTS系统

Zeyang Song, Tianchi Liu, Tianrui Wang, Chenglin Xu, Steven Y. Guo, Haizhou Li

机构 * National University of Singapore(新加坡国立大学) Tencent(腾讯) LIGHTSPEED(光速) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对开环TTS易出现韵律缺陷且指标难检测的问题,提出含AudioLLM评判器与细粒度优化器的LoopTTS框架,构建4.2万示例数据集训练优化器,实验表明其修复质量与指令遵循能力更优。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30382 2026-09-01 cs.LG math.OC math.PR 新提交

Convergence rates for the RMSprop optimizer with full control of the hyperparameters

超参数完全可控的RMSprop优化器的收敛速率

Steffen Dereich, Arnulf Jentzen

机构 * University of Münster(明斯特大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 该研究针对超参数完全可控的RMSprop优化器,解决了凸随机优化下误差常数一致有界的未决问题,给出了适用于所有梯度步的非渐近收敛速率估计,核心创新为RMSprop二阶矩过程的逆矩界。

详情

展开后加载摘要…

URL PDF HTML 收藏