arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-09-01 至 2026-09-01 共收录 33
2608.31075 2026-09-01 cs.AI 新提交

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

超越人类监督扩展大型推理模型:通往超级智能的路径

Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院) Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Hong Kong Baptist University(香港浸会大学) Hunyuan Tencent(腾讯混元) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

AI总结 本文研究人类监督逐步退出时大型推理模型(LRMs)的扩展路径,提出五级阶梯框架,分析自主化带来的风险,围绕策略能力等开展评估,为开发通往超级智能的自我维持学习系统提供结构化方案。

Comments 72pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31036 2026-09-01 cs.LG 新提交

Normalized Low-Rank Adaptation

归一化低秩适配

Jiale Kang, Ziyin Yue, Zheng Zhan, Yangyi Huang, Weiyang Liu

机构 * Yuanshi Intelligence(元氏智能) The Chinese University of Hong Kong(香港中文大学) Microsoft Research(微软研究院) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对LoRA训练动态正则化不足的问题,提出归一化低秩适配(NoRA),通过归一化下投影矩阵提升LoRA性能,在多任务中加速收敛、改善稳定性并缓解灾难性遗忘,且无额外计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30536 2026-09-01 cs.RO 新提交

Behavior-Skill: A Fine-Grained Benchmark for Evaluating Vision-Language-Action Policies in Long-Horizon Tasks

Behavior-Skill:用于评估长 horizon 任务中视觉-语言-动作策略的细粒度基准

Chunyun Ma, Lun Luo, Xingjian Luo, Xiexing Feng, Hang Zhang, Wei Liu, Feng Qiao, Yaonan Wang, Huimin Lu, Xieyuanli Chen

机构 * XPeng Inc.(小鹏汽车) The Chinese University of Hong Kong(香港中文大学) Hunan University(湖南大学)

AI总结 本研究提出细粒度基准 Behavior-Skill,含 235492 个技能实例,引入轨迹与技能级指标,实验发现接触丰富操作技能是长 horizon VLA 策略瓶颈,可用于分析改进该类策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30400 2026-09-01 cs.CV 新提交

Real-Time Scene-Adaptive Tone Mapping for High-Dynamic Range Object Detection

面向高动态范围目标检测的实时场景自适应色调映射

Gongzhe Li, Linwei Qiu, Peibei Cao, Fengying Xie, Xiangyang Ji, Qilin Sun

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Tianmushan Laboratory, Beihang University(北京航空航天大学天目山实验室) School of Artificial Intelligence, Nanjing University of Information Science and Technology(南京信息工程大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系) Point Spread Technology(点扩散科技)

AI总结 本文提出一种场景自适应实时色调映射方法,通过神经光度校准等技术解决HDR图像适配检测网络的问题,性能优于传统算法,可在NVIDIA Jetson平台实现4K HDR图像实时处理。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30395 2026-09-01 cs.CL 新提交

When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models

当大语言模型遇到树搜索:大语言模型中作为搜索的推理的系统视角

Jiaqi Wei, Xiang Zhang, Yuejin Yang, Wenxuan Huang, Juntai Cao, Sheng Xu, Xiang Zhuang, Zhangyang Gao, Muhammad Abdul-Mageed, Laks VS Lakshmanan, Chenyu You, Wanli Ouyang, Siqi Sun

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) University of British Columbia(不列颠哥伦比亚大学) Stony Brook University(石溪大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本综述将大语言模型的推理视为搜索,系统化基于树搜索的推理进展,引入统一设计空间并倡导标准化计算报告,以优化推理权衡。

Comments Accepted by EMNLP'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30344 2026-09-01 cs.CV cs.CG cs.GR cs.RO 新提交

Proximity3D: Shape from Capacitive Proximity on Sensing Manifold

Proximity3D:基于感知流形上电容邻近性的形状重建

Hao Chen, Chenming Wu, Chun Ping Lam, Xiangjia Chen, Guoxin Fang, Charlie C. L. Wang, Yeung Yam, Juncong Lin, Chengkai Dai

机构 * Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Xiamen University(厦门大学) The Chinese University of Hong Kong(香港中文大学) The University of Manchester(曼彻斯特大学)

AI总结 Proximity3D提出将弯曲电容织物表面作为非平面感知流形,引入多视图前馈重建模型,通过聚合电容邻近场实现物体形状鲁棒重建,为机器人近场几何感知提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30289 2026-09-01 cs.RO 新提交

CometVLA: Co-Training on an Embodied Data Pyramid towards Physical Understanding

CometVLA:基于具身数据金字塔的协同训练以实现物理理解

Hanwen Wan, Dafeng Chi, Linbo Zhai, Tianao Shen, Yuzheng Zhuang, Tianle Zhang, Peidong Liu, Liang Lin, Xiaoqiang Ji

机构 * JD Explore Academy(京东探索研究院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳市人工智能与机器人研究院) South China University of Technology(华南理工大学) Sun Yat-sen University(中山大学) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院)

AI总结 该研究提出CometVLA,通过构建与机器人动作对齐的具身物理VQA数据及引入GAP token,在具身数据金字塔上协同训练,提升VLA模型的物理理解能力,显著优于基线模型并验证了物理预训练对下游操作的益处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29783 2026-09-01 cs.CV 新提交

InspectorGPT: A Comparative Reasoning Enhanced VLM for Comprehensive Industrial Anomaly Detection

InspectorGPT:用于全面工业异常检测的对比推理增强型视觉语言模型(VLM)

Weifei Chen, Honghao Zhang, Zhiyuan You, Xinyi Le

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究提出InspectorGPT,一种结合对比推理的VLM框架,通过CoT微调与GRPO优化,配合任务向量融合的InspectorGPT-Seg实现工业异常检测,在多维度性能及未见基准泛化上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29715 2026-09-01 cs.LG cs.AI cs.CL 新提交

Higher-Dimensional Rotary Position Embedding

高维旋转位置嵌入

Yixing Li, Ruobing Xie, Yudong Zhang, Yushi Bai, Samm Sun, Yu Cheng

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent Hunyuan(腾讯混元) Tsinghua University(清华大学) University of Macau(澳门大学)

AI总结 针对RoPE跨通道混合与鲁棒性不足的问题,提出HD-RoPE,通过扩展至高维旋转并引入Paley-I正交基,在无额外参数的情况下提升性能,获基准测试显著改善。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29516 2026-09-01 cs.RO 新提交

Task-Relevant Feature-Dynamics Fidelity Enables Zero-Shot Sim-to-Real Transfer for Robotic Ultrasound Scanning

任务相关特征动力学保真度实现机器人超声扫描的零样本仿真到真实迁移

Yizhao Qian, Jiayuan Luo, Wanyi Zhu, Yameng Zhang, Max Q. -H. Meng, Yixuan Yuan, Li Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Great Bay University(大湾区大学) Dongguan Great Bay Institute for Advanced Study(东莞大湾区先进研究院) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

AI总结 该研究提出任务相关特征动力学保真度(TR-FDF),开发面向TR-FDF的超声模拟器,实现仅仿真训练的机器人超声策略在体模实验中400次零样本部署成功390次,提升零样本仿真到真实迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29252 2026-09-01 cs.AI 新提交

Dynamic Important Example Mining for Reinforcement Finetuning

用于强化微调的动态重要示例挖掘

Haoru Tan, Sitong Wu, Yanfeng Chen, Shizhen Zhao, Yang-Tian Sun, Tianjia Liu, Chirui Chang, Shaofeng Zhang, Samm Sun, Xiuzhe Wu, Ruobing Xie, Xiaojuan Qi

机构 * HKU(香港大学) Tencent(腾讯) CUHK(香港中文大学) Stanford(斯坦福大学)

AI总结 该研究针对强化微调中样本价值固定假设的缺陷,提出DIEM框架,整合梯度对齐重要性估计器与约束批量重加权方案,在多个推理基准中优于相关基线。

Journal ref CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29242 2026-09-01 cs.RO 新提交

AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization

AnyWorld:用于跨 embodiments 泛化的分解式第一人称世界模型

Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

机构 * Nanyang Technological University(南洋理工大学) Institute of Advanced Intelligence and Computing, A*STAR(新加坡科技研究局高级智能与计算研究院) XPENG Robotics(小鹏机器人) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 AnyWorld 框架通过分解交互为动作、相机、embodiment 因子,将人类交互重组为机器人原生经验,生成数据可提升机器人操作性能,验证了动作校准与视觉重组的必要性。

Comments Project page: https://xpeng-robotics.github.io/anyworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29177 2026-09-01 cs.CV 新提交

Dynamic-Robust Photometric-Semantic Reconstruction for Open-Vocabulary 3D Scene Understanding

面向开放词汇三维场景理解的动态鲁棒光度-语义重建

Boyu Cai, Li Yang, Yan Xu, Wei Liu, Nian Liu, Sikui Zhang, Yan Wang, Chunfeng Yuan, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) The Chinese University of Hong Kong(香港中文大学) Deepeleph Intelligent Technology(深智科技)

AI总结 提出SPAR架构与动态区域感知训练范式,解决NVS与OVS模型在动态场景的特征错位问题,在D-RE10K基准上实现SOTA性能,3/4视图下PSNR达22.15/23.33 dB,运动掩码预测mIoU达88.5%。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29108 2026-09-01 cs.RO 新提交

From Multi-Modal Paths to Executable Trajectories: A Trajectory Planning Framework for 4WIS Robots

从多模态路径到可执行轨迹:面向四轮独立转向(4WIS)机器人的轨迹规划框架

Runjiao Bao, Lin Zhang, Yongkang Xu, Shoukun Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Beijing Institute of Technology(北京理工大学) Shenzhen Research Institute of Nankai University(南开大学深圳研究院)

AI总结 针对4WIS机器人现有规划方法无法充分利用其多模态能力的问题,提出结合模式增强前端搜索与模式一致后端优化的轨迹规划框架,实验验证了其综合性能与实际可执行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29066 2026-09-01 cs.CL cs.AI 新提交

Not All or None: Dynamic Construction of Target-aware Memory Graph for Conversational Stance Detection

非全即无:面向对话式立场检测的目标感知记忆图的动态构建

Yifan Xiang, Bin Liang, Yuqi Huang, Ruifeng Xu, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 针对对话式立场检测中历史对话信息利用的噪声问题,提出目标感知记忆图TamGraph,通过熵引导回溯机制动态构建目标感知图,提升LLM在该任务上的性能。

Comments Accepted in EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29003 2026-09-01 cs.CV cs.AI 新提交

RoSe-SLAM: Robust Semantic-Aware Gaussian Splatting SLAM from Dynamic Monocular Videos

RoSe-SLAM:面向动态单目视频的鲁棒语义感知高斯溅射SLAM

Wenting Wang, Jiaxin Guo, Wenzhen Dong, Yun-Hui Liu, Charlie C. L. Wang, Yeung Yam

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Manchester(曼彻斯特大学) Centre for Perceptual and Interactive Intelligence (CPII) Limited(感知与互动智能中心有限公司)

AI总结 本研究提出RoSe-SLAM,利用2D基础模型语义特征与时空运动掩码等模块,结合几何与语义线索,在动态单目视频中实现更优的SLAM性能,优于现有动态RGB SLAM基线。

Comments Accepted by IEEE/RSJ INTERNATIONAL CONFERENCE ON INTELLIGENT ROBOTS & SYSTEMS (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28970 2026-09-01 cs.SD cs.AI 新提交

Diagnose, Then Refine: A Closed-Loop TTS System with AudioLLM-Guided Correction

诊断后优化:基于AudioLLM引导校正的闭环TTS系统

Zeyang Song, Tianchi Liu, Tianrui Wang, Chenglin Xu, Steven Y. Guo, Haizhou Li

机构 * National University of Singapore(新加坡国立大学) Tencent(腾讯) LIGHTSPEED(光速) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对开环TTS易出现韵律缺陷且指标难检测的问题,提出含AudioLLM评判器与细粒度优化器的LoopTTS框架,构建4.2万示例数据集训练优化器,实验表明其修复质量与指令遵循能力更优。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30382 2026-09-01 cs.LG math.OC math.PR 新提交

Convergence rates for the RMSprop optimizer with full control of the hyperparameters

超参数完全可控的RMSprop优化器的收敛速率

Steffen Dereich, Arnulf Jentzen

机构 * University of Münster(明斯特大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 该研究针对超参数完全可控的RMSprop优化器,解决了凸随机优化下误差常数一致有界的未决问题,给出了适用于所有梯度步的非渐近收敛速率估计,核心创新为RMSprop二阶矩过程的逆矩界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26583 2026-09-01 cs.RO 版本更新

SOLO: Stable Omni-terrain Long-Horizon Perceptive Humanoid Locomotion

SOLO:稳定全地形长视距感知类人机器人运动

Pihai Sun, Gang Han, Jingkai Sun, Jiahao Ma, Zeran Su, Zelin Tao, Peiran Liu, Shuai Shi, Wei Cui, Zifan Wang, Jialin Yu, Wen Zhao, Kangning Yin, Jiaxu Wang, Jiahang Cao, Lingfeng Zhang, Hao Cheng, Jian Tang, Qiang Zhang, Yijie Guo

机构 * Artificial General Intelligence Institute, University of Science and Technology of China(中国科学技术大学通用人工智能研究院) X-Humanoid(X-人形机器人) The University of Hong Kong(香港大学) The Australian National University(澳大利亚国立大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 SOLO是解决长视距类人机器人运动脆弱性的统一框架,通过QR与TA-MSE蒸馏提升地形感知与策略学习,仿真及实际测试中通行成功率显著优于基线方法,可零样本完成长距离复杂地形任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20308 2026-09-01 cs.CV 版本更新

ACE-Ego-Hand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery

DreamHand:复用视频扩散模型实现遮挡鲁棒的第一人称视角3D手部运动恢复

Yufei Liu, Xixi Wang, Hao Li, Ganlong Zhao, Kaitong Cai, Chengkai Jin, Chunxiao Liu, Jianbo Liu, Siyuan Huang, Xingang Pan, Hongsheng Li

机构 * ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 DreamHand是复用视频扩散模型的离线片段级框架,通过确定性干净潜在编码器与双向时空解码器恢复带度量位置的连续双手轨迹,在五个第一人称视角基准测试中实现最佳性能,为机器人操作数据提供可扩展路径。

Comments Project Page: https://ggxxii.github.io/ace-ego-hand

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19810 2026-09-01 cs.SD 版本更新

SimulS2ST-Omni: Data-Efficient Streaming Speech-to-Speech Translation via Explicit Trajectory Supervision

SimulS2ST-Omni:通过显式轨迹监督实现数据高效的流式语音到语音翻译

Rongshen He, Xinyu Liang, Dekun Chen, Jiaqi Li, Mingjie Chen, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究长格式流式语音到语音翻译,提出仅用约2000小时配对数据的训练方法,核心是联合文本-代码轨迹监督,双流分解减轻干扰,在质量-延迟权衡上表现出色,与先进闭源系统相当。

Comments 29 pages, 19 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-09-01 cs.CV 版本更新

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15932 2026-09-01 cs.CL 版本更新

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

超越NL2Code:多模态代码智能的结构化综述

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

机构 * Meituan(美团) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) Ludwig Maximilian University of Munich(慕尼黑大学) University of Science and Technology of China(中国科学技术大学) Queen Mary University of London(伦敦玛丽女王大学)

AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15872 2026-09-01 cs.CL 版本更新

SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks

SciOrch: 学习编排专家大语言模型以解决前沿多模态科学推理任务

Jingru Guo, Xiangyuan Xue, Lian Zhang, Wanghan Xu, Siki Chen, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * Imperial College London(伦敦帝国学院) The Chinese University of Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出SciOrch框架,训练轻量级8B模型编排多个前沿大语言模型,通过MCTS和GRPO优化,在科学推理任务上超越最强单模型和多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04483 2026-09-01 cs.CL 版本更新

Voices Across Registers: Corpus-Conditioned Vernacular Jailbreaks against Aligned LLMs via Fanfiction Subgenres

分布外声音:同人小说子类型作为对齐LLM的通用白话越狱

Zhongze Luo, Ruihe Shi, Zhenshuai Yin, Haoyue Liu, Weixuan Wan, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院) The Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院) The Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) School of Microelectronics, Xi’an Jiaotong University(西安交通大学微电子学院)

AI总结 本文发现安全训练覆盖不足的自然人类写作语域是对齐LLM的真正失败模式,并提出首个利用真实同人小说子类型作为通用攻击载体的越狱方法,显著提升攻击成功率。

Comments Accepted by EMNLP 2026 Main Conference, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03236 2026-09-01 cs.AI 版本更新

Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents

先感知后推理:一种用于高效可靠主动移动代理的预推理感知框架

Zhijie Ding, Weinan Hong, Zicheng Zhu, Lei Li, Dezhi Kong, Hao Wang, Peng Zhou, Xuchu Jiang, Jiaming Xu

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司) Zhongnan University of Economics and Law(中南财经政法大学) Jilin University(吉林大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出预推理感知框架(PRPF),通过轻量级多模态主动感知器(MPP)进行干预门控和上下文压缩,仅在需要时激活主动代理推理器(PAR),以解决主动移动代理中干预时机与方式决策的目标错位和冗余推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27243 2026-09-01 cs.CV 版本更新

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头

Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song

机构 * HKUST(香港科技大学) University of Edinburgh(爱丁堡大学) CUHK(香港中文大学) NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) Tsinghua University(清华大学)

AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25903 2026-09-01 cs.CL cs.LG 版本更新

Universal Activation Verbalizer: A Unified Framework for Cross-Model Activation Explanation

通用激活词化器:跨模型激活解释的统一框架

Haiyan Zhao, Zirui He, Guanchu Wang, Ali Payani, Yingcong Li, Mengnan Du

机构 * New Jersey Institute of Technology(新泽西理工学院) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Cisco Research(思科研究) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出通用激活词化器(UAV)框架,通过共享解码器和轻量适配器将异构模型的隐藏表示转化为自然语言解释,支持跨模型家族和规模的激活词化,在分类、事实检索和要点总结任务中与强基线竞争。

Comments 23 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09362 2026-09-01 cs.GR cs.CV 版本更新

FrameTwin: Curve-Anchored Gaussian Alignment from Sparse Views for Adaptive Wireframe 3D Printing

FrameTwin: 基于稀疏视角的曲线锚定高斯对齐用于自适应线框3D打印

Wenting Wang, Zhuo Huang, Kun Qian, Neelotpal Dutta, Yuhu Guo, Yingjun Tian, Yeung Yam, Charlie C. L. Wang

机构 * Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) Centre of Perceptual and Interactive Intelligence, Hong Kong(香港感知与交互智能中心) University of Manchester(曼彻斯特大学) Department of Mechanical and Aerospace Engineering, The University of Manchester, United Kingdom(曼彻斯特大学机械与航空航天工程系)

AI总结 FrameTwin通过曲线锚定高斯对齐方法,利用稀疏视角图像实现自适应线框3D打印的闭环控制,通过高斯核与参数曲线的结合,生成几何感知的紧凑编码,提升线框结构的拓扑捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21716 2026-09-01 cs.LG cs.AI cs.CV 版本更新

Mixture-Greedy for Online Generative Model Selection: Is UCB Necessary in Diversity-Aware Multi-Armed Bandits?

当探索免费时的混合贪婪:我们是否需要在多样性意识的多臂老虎机中使用UCB?

Bahar Dibaei Nia, Farzan Farnia

机构 * Department of Computer Science and Engineering, Chinese University of Hong Kong(计算机科学与工程系,香港中文大学)

AI总结 在生成模型选择中,混合贪婪策略无需UCB探索奖励即可实现更快收敛和更高样本效率,挑战了传统多臂老虎机中UCB的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏