arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-08-25 至 2026-08-25 共收录 21
2608.23551 2026-08-25 cs.CL cs.AI cs.LG stat.ML 新提交

ConvergeFlow: Language Flow with Provable Convergence to Token Embeddings

ConvergeFlow:可收敛至词元嵌入的语言流模型

Na Li, Yuchen Jiao, Changxiao Cai, Gen Li

机构 * Chinese University of Hong Kong(香港中文大学) University of Michigan(密歇根大学)

AI总结 本研究提出ConvergeFlow,一种嵌入空间的基于流的语言模型,通过约束数据预测器至词元嵌入凸包实现可收敛性,无需交叉熵解码器,在OpenWebText上取得与现有模型相当的性能,展现了基于流范式的语言建模潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22972 2026-08-25 cs.CV 新提交

Optimize Surgical Triplet Recognition: A Knowledge-Driven Mixture-of-Experts Solution

优化手术三元组识别:一种知识驱动的混合专家解决方案

Yiyi Zhang, Yuchen Yuan, Ying Zheng, Jialun Pei, Jinpeng Li, Zheng Li, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 针对手术三元组识别的三大冲突问题,提出MoeCo框架,通过组件定制适配器、协同梯度学习及知识驱动混合专家机制,在CholecT45和CholecT50数据集上验证了方法的有效性与优越性。

Comments Accepted in TMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22967 2026-08-25 cs.CL 新提交

Closed-Loop Bayesian Molecular Inverse Design with Semantic LLM Surrogates

基于语义大语言模型代理的闭环贝叶斯分子逆设计

Yaoyao Xu, Xinjian Zhao, Xiaozhuang Song, Lei Bai, Tianshu Yu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 该研究提出基于语义大语言模型代理的闭环贝叶斯分子逆设计框架,在MolQA任务上优于一次性提示,与GP-based BO基线相当或更优,且揭示了领域依赖的参考转移与摘要添加的接口

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22906 2026-08-25 cs.CV 新提交

AquaFlow: A Monocular Gaussian Splatting SLAM for Underwater Streaming Reconstruction

AquaFlow:用于水下流式重建的单目高斯溅射SLAM

Yingxiang Xu, Kerui Ren, Wenqi Guo, Changjian Jiang, Tao Lu, Linning Xu, Mulin Yu

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 针对水下场景视觉退化导致的SLAM难题,提出AquaFlow框架,通过微调3D视觉基础模型等技术实现更优的水下重建,在62条水下轨迹数据集上相较WaterSplat-SLAM性能显著提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22879 2026-08-25 cs.CV 新提交

Large-Small Model Collaboration for Zero-Shot Surgical Phase Recognition

用于零样本手术阶段识别的大小模型协作

Yiyi Zhang, Ying Zheng, Wenxin Fan, Yu Zhu, Yuchen Yuan, Litao Zhao, Zheng Li, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与XR研究所)

AI总结 该研究提出LaST大小模型协作框架,结合轻量模型时间建模能力与基础模型迁移性,实现零样本手术阶段识别,在未见领域自适应上性能显著优于基线及部分先进方法。

Comments MICCAI 2026 Early Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22510 2026-08-25 cs.AI 新提交

ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts

ClawProBench:基于运行时覆盖与冻结工作空间保留集的轨迹感知AI智能体评估

YuanHang Xiao

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 该研究提出ClawProBench基准,基于OpenClaw运行时构建,通过含102场景的全配置集与68场景的冻结保留集评估AI智能体,采用安全门控公式评分,发现最终答案排行榜存在缺陷,不同评估视角的智能体排名差异显著。

Comments 29 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21833 2026-08-25 cs.AI cs.CL 新提交

GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?

GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?

Kun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie, Chenxu Liu, Jieling He, Zhongyuan Liu, Zeno Zeng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Lightspeed Studios, Tencent(腾讯光速工作室)

AI总结 GameXpert-Bench是覆盖游戏开发全生命周期的基准,含三个赛道,测评显示当前编码智能体在生成可玩游戏基础上表现较好,在缺陷发现等方面仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21544 2026-08-25 cs.CL cs.AI 新提交

Forgotten in Weights, Recovered by Tools: Agentic Tool Unlearning for LLM Agents

权重中遗忘,工具中恢复:面向大语言模型智能体的智能体工具遗忘

Baicheng Chen, Zheyuan Liu, Jingyu Zhang, Kaize Ding, Ningshan Ma, Yue Huang, Meng Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Notre Dame(圣母大学) Johns Hopkins University(约翰斯·霍普金斯大学) Northwestern University(西北大学) MIT(麻省理工学院)

AI总结 该研究针对大语言模型智能体的工具介导恢复问题,提出两阶段的Agentic Tool Unlearning框架,在RWKU和MUSE数据集上实现了更好的遗忘与保留效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21485 2026-08-25 cs.LG eess.SP 新提交

Congruence Decomposition with Neural Block Solvers for Large-Scale PCI Assignment

基于神经块求解器的同余分解用于大规模物理小区标识分配

Yeqing Qiu, Chengpiao Huang, Ye Xue, Akang Wang, Fan Xu, Zhipeng Jiang, Dong Zhang, Ruoyu Sun, Qingjiang Shi, Zhi-Quan Luo

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) Columbia University(哥伦比亚大学) Sun Yat-sen University(中山大学) Tongji University(同济大学) University of Chinese Academy of Sciences(中国科学院大学) Huawei Technologies(华为技术有限公司)

AI总结 本研究针对大规模5G网络PCI分配难题,提出带神经块求解器的同余分解框架,将问题解耦为子问题并结合图神经网络优化,实验显示其性能优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14782 2026-08-25 cs.CV cs.CL 版本更新

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

最后但同样重要:用于多模态KV缓存压缩的边界注意力校准

Tianhao Chen, Yuheng Wu, Kelu Yao, Xiaogang Xu, Xiaobin Hu, Dongman Lee

机构 * KAIST(韩国科学技术院) Zhejiang Laboratory(之江实验室) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

AI总结 针对多模态大语言模型长视觉上下文中KV缓存压缩导致关键证据丢失的问题,提出BACON方法,通过校准观察窗口注意力与最后查询注意力,并利用层内一致性和层间持久性抑制噪声,在激进压缩下平均提升7.5%性能。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13610 2026-08-25 cs.CL cs.AI 版本更新

One Polluted Page Is Enough: Evaluating Web Content Pollution in LLM Recommenders

一个被污染的页面就够了:评估生成式推荐系统中的网页内容污染

Minghao Luo, Liang Chen

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究提出FORGE基准,评估搜索增强LLM在检索结果被污染时推荐虚假产品的脆弱性,发现单个污染页面即可导致高达27%的推荐错误率,且推理能力无法缓解此问题。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07602 2026-08-25 cs.LG cs.AI 版本更新

Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

面向LEGO空间物理推理的样本高效后训练

Yuhuan Yuan, Zhouliang Yu, Minghao Liu, Weiyang Liu, Ge Lin Kan

机构 * HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZODA

AI总结 针对LLM生成LEGO组装时出现的物理有效但几何语义错位问题,提出基于模型的数据选择方法和样本高效强化学习PVPO,结合体素空间几何奖励,提升结构、语义对齐和物理有效性。

Comments Technical Report V2, 20 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12969 2026-08-25 cs.LG cs.AI 版本更新

Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective

从对比视角重新审视基于可验证奖励的强化学习

Feng Zhang, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang, Guanjun Jiang

机构 * Beijing Institute of Technology(北京理工大学) Qwen Business Unit of Alibaba(阿里巴巴Qwen业务部) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出ConSPO方法,通过对比序列级策略优化,解决GRPO在目标函数上的似然错配和信用分配不敏感问题,在推理任务上超越强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08712 2026-08-25 cs.CV 版本更新

From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation

从运动学至路由视觉控制:用于动作条件化外科视频生成

Bohan Li, Shuojue Yang, Baorui Peng, Xianda Guo, Erli Zhang, Youqi Tao, Junfeng Duan, Daguang Xu, Qi Dou, Xin Jin, Wenjun Zeng, Hao Zhao, Yueming Jin

机构 * SJTU(上海交通大学) NUS(国立新加坡大学) THU(清华大学) EIT(欧洲研究所) WHU(武汉大学) Harvard(哈佛大学) NVIDIA(NVIDIA公司) CUHK(香港大学)

AI总结 本文提出一种运动学至视觉提升范式,通过五种图像对齐的控制模态生成动作条件化外科视频,采用分层路由框架提升控制精度与效率,构建新基准并验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13183 2026-08-25 cs.CV cs.MM 版本更新

GeoLink: A 3D-aware Framework to Improve Generalization for Cross-view Geo-localization

GeoLink:一种面向跨视角地理定位更好泛化的3D-aware框架

Hongyang Zhang, Yinhao Liu, Haitao Zhang, Zhongyi Wen, Zhenyu Kuang, Shuxian Liang, Xian-Sheng Hua

机构 * CUHK(SZ)(香港中文大学(深圳)) XMU(厦门大学) UESTC(电子科技大学) Foshan University(佛山大学) Tongji University(同济大学)

AI总结 本文提出GeoLink框架,通过3D感知的语义一致方法提升跨视角地理定位的泛化能力,实验表明其在多个基准测试中优于现有方法,能适应未见领域和多变天气。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26757 2026-08-25 cs.RO 版本更新

Beyond Viewpoint Generalization: What Multi-View Demonstrations Offer and How to Synthesize Them for Robot Manipulation?

超越视角泛化:多视角演示提供了什么以及如何为机器人操作合成它们

Boyang Cai, Qiwei Liang, Jiawei Li, Shihang Weng, Zhaoxin Zhang, Tao Lin, Xiangyu Chen, Wenjie Zhang, Jiaqi Mao, Weisheng Xu, Bin Yang, Jiaming Liang, Junhao Cai, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学) Beijing Jiaotong University(北京交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究通过实验验证多视角演示在机器人操作中的性能提升,揭示了多视角数据在提升泛化能力和突破单视角限制方面的优势,提出RoboNVS框架合成多视角数据以提升下游政策表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13095 2026-08-25 cs.CV cs.LG 版本更新

ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning

ADHint: 基于难度先验的自适应提示用于强化学习

Feng Zhang, Zezhong Tan, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang, Guanjun Jiang

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhongguancun Academy(中关村学院)

AI总结 ADHint通过整合难度先验,改进强化学习中的探索与模仿平衡,提升推理能力和分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-08-25 cs.CV cs.CL 版本更新

Benchmarking and Boosting Multilingual Capabilities of LVLMs via OCR-Centric Reinforcement Learning

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Weijia Li, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01362 2026-08-25 cs.LG 版本更新

Directed evolution algorithm drives neural prediction

定向进化算法驱动神经预测

Yanlin Wang, Nancy M Young, Patrick C M Wong

机构 * Brain and Mind institute, The Chinese University of Hong Kong(脑科学与智能技术研究所,香港中文大学) Department of Linguistics and Modern Languages, The Chinese University of Hong Kong(语言学与现代语言系,香港中文大学) Division of Otolaryngology, Ann & Robert H. Lurie Children's Hospital of Chicago(芝加哥安·罗伯特·H·卢里儿童医院耳鼻喉科) Department of Otolaryngology Head & Neck Surgery, Feinberg School of Medicine, Northwestern University(费因伯格医学院耳鼻喉科与头颈外科部,西北大学) Knowles Hearing Center, Department of Communication Sciences and Disorders, Northwestern University(诺里斯听力中心,西北大学沟通科学与障碍系)

AI总结 提出定向进化模型(DEM),模拟生物定向进化试错过程,结合回放缓冲和连续反向传播,在跨域神经预测中提升泛化能力并解决标签稀缺问题。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15294 2026-08-25 cs.SD cs.MM 版本更新

MeMo: Attentional Momentum for Real-Time Audio-Visual Target Speaker Extraction Under Impaired Visual Conditions

MeMo: 视觉受损条件下的实时视听目标说话人提取的注意力动量

Junjie Li, Wenxuan Wu, Shuai Wang, Zexu Pan, Kong Aik Lee, Helen Meng, Haizhou Li

机构 * Department of Electrical and Electronic Engineering, Faculty of Engineering, The Hong Kong Polytechnic University(电子工程系,工程学院,香港理工大学) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(系统工程与工程管理系,香港中文大学) School of Artificial Intelligence (SAI), The Chinese University of Hong Kong, Shenzhen(人工智能学院(SAI),香港中文大学深圳校区) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) Tongyi Lab, Alibaba Group, Singapore(通义实验室,阿里巴巴集团,新加坡)

AI总结 提出MeMo框架,通过两个自适应记忆库存储注意力信息,在视觉线索缺失时维持注意力动量,实现实时目标说话人提取,SI-SNR提升至少2dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12295 2026-08-25 cs.CL cs.AI cs.LG 版本更新

Text-ADBench: Text Anomaly Detection Benchmark Based on LLM Embeddings

Text-ADBench:基于大语言模型嵌入的文本异常检测基准

Feng Xiao, Jicong Fan

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本研究构建了基于LLM嵌入的文本异常检测基准,通过多模型、多数据集的实验发现嵌入质量决定检测效果,深度学习方法在LLM嵌入下无性能优势,还提出了高效评估策略并开源工具包。

详情

展开后加载摘要…

URL PDF HTML 收藏