arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Chinese University of Hong Kong(香港中文大学)

共收录 4209
2609.03104 2026-09-04 stat.ML cs.LG 新提交

Occupancy-based Quantile Risk Control

基于占用率的分位数风险控制

Zihao Shi, Huajun Xi, Bingyi Jing, Hongxin Wei

机构 * Southern University of Science and Technology(南方科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 针对现有分位数风险控制方法存在过度保守或缺乏有限样本保证的局限,提出OQRC方法,通过有序校准损失划分损失空间实现紧风险控制,在常见基准上可将风险差距降低多达78.64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04131 2026-09-04 cs.CV 新提交

Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding

超越检索:面向流视频理解的渐进式潜在记忆演化

Hongyu Qu, Guangming Yao, Ling Xing, Xiaobin Hu, Rongxing Ding, Guibin Zhang, Fan Zhang, Yi Yuan, Xiangbo Shu, Shuicheng Yan

机构 * Nanjing University of Science and Technology(南京理工大学) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究针对流视频理解中存储-检索范式无法内化历史证据的问题,提出LatentStream框架,通过分层内存组织、渐进式演化及置信度优化实现流记忆的检索-内化,在视频基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03816 2026-09-04 cs.SI cs.CV cs.LG 新提交

When Vision Meets Graphs: A Survey on Graph Reasoning and Learning

当视觉遇上图:图推理与学习综述

Xinjian Zhao, Wei Pang, Zhixuan Yu, Xiangru Jian, Xiaozhuang Song, Yaoyao Xu, Zhongkai Xue, Dingshuo Chen, Shu Wu, Philip Torr, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Waterloo(滑铁卢大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Oxford(牛津大学)

AI总结 本综述首次系统概述“视觉遇上图”领域,将图的视觉表征作为推理与学习的一级输入,梳理相关研究方向,旨在推进能像科学家一样处理图的基础模型。

Comments IJCAI Survey Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03594 2026-09-04 cs.AR cs.AI cs.LG 新提交

LevelSyn: Physical-Aware Logic Synthesis via Level-Asynchronous Graph Neural Networks

LevelSyn:基于层级异步图神经网络的物理感知逻辑综合

Jingyi Zhou, Zhengyuan Shi, Ziyang Zheng, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 LevelSyn是一种基于层级异步GNN的物理感知逻辑综合框架,通过层级对齐子图划分策略适配工业级设计,在EPFL基准上较SOTA方法实现功耗降6.89%、延迟升27.48%,DRC违规减99.59%,可加速集成电路设计收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03407 2026-09-04 cs.AI 新提交

Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation

陷入叙事:多轮大语言模型对话中的叙事俘获

Yuhe Wu, Guangyu Wang, Yujie Chen, Jiatong Zhang, Yuran Chen, Yutong Zhang, Xiyin Cheng, Wenpeng Cao, Zhuang Liu, Guang Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Dongbei University of Finance and Economics(东北财经大学)

AI总结 该研究提出多轮LLM对话中的叙事俘获失效模式,构建含5078个场景的基准,发现17个LLMs中该现象普遍存在,偏移达25个百分点,偏好优化是主因,部分推理策略可缓解,旨在培养具独立判断的LLM顾问。

Comments Accepted by EMNLP 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03376 2026-09-04 cs.CR cs.IR cs.LG 新提交

Spruce: Scalable Private Outsourced Retrieval Using Compact Embeddings

Spruce:基于紧凑嵌入的可扩展私有外包检索

Peichun Hua, Yunming Xiao

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学)

AI总结 Spruce将表示与密码协议协同设计,通过紧凑二进制编码、固定半径MPC、私有聚类剪枝等技术,在保持检索质量的同时大幅提升私有外包检索的速度与吞吐量。

Comments 22 pages, 10 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31413 2026-09-04 cs.AI cs.LG 版本更新

Learning to Select, Not Relearn: Hard-Routed Mixtures of Reasoning LoRAs

学会选择,而非重新学习:硬路由推理LoRA混合

Seyed Alireza Molavi, Zhan Su, Yan Hu, Peyman Sheikholharam Mashhadi, Stefan Byttner, Prayag Tiwari

机构 * Halmstad University(哈尔姆斯塔德大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出硬路由MoR-LoRA框架,通过硬top-1路由组合冻结的推理LoRA专家,保留专家行为且可训练参数少于软路由方法。

Comments Code available at: https://github.com/sar-molavi/hard-routed-mor-lora

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10581 2026-09-04 cs.CL cs.SD eess.AS 版本更新

ParaBridge: Bridging Paralinguistic Perception and Dialogue Behavior in Speech Language Models

ParaBridge: 弥合语音语言模型中的副语言感知与对话行为

Yuxiang Wang, Qinke Ni, Shengbo Cai, Wan Lin, Liqiang Zhang, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tencent Hunyuan(腾讯混元) Shenzhen Loop Area Institute(深圳河套学院) Amphion Technology Co., Ltd.(Amphion科技有限公司) Tsinghua University(清华大学)

AI总结 提出ParaBridge,一种在线自我蒸馏方法,将推理阶段的副语言指令支架转化为稳定的模型行为,无需人工标注或外部奖励,显著提升语音语言模型对副语言线索的响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28053 2026-09-04 cs.LG 版本更新

RW-TTT: Batched Serving for Request-Owned Test-Time Training State

RW-TTT:面向请求自有测试时训练状态的批量服务

Jian Yang, Zhizhuo Kou, Yao Tian, Hao Zhang, Han Chen, Sirui Han, Yike Guo

机构 * HKUST(香港科技大学) CUHK(香港大学) NUS(新加坡国立大学)

AI总结 提出RW-TTT框架,通过标记解码步骤的所有者、版本和读写效果,实现请求自有测试时训练状态下的高效批量LLM服务,在单GPU上达到274.61 tok/s聚合吞吐,较顺序服务提升9.31倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07106 2026-09-04 cs.CV cs.AI cs.CL 版本更新

Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models

Ex-Omni:为全模态大语言模型赋能3D面部动画生成

Haoyu Zhang, Zhipeng Li, Yiwen Guo, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) LIGHTSPEED Independent Researcher(独立研究员)

AI总结 提出Ex-Omni模型,通过混合形状感知语音单元生成器和解码器解耦语义推理与时间生成,并引入统一令牌查询门控融合机制,实现全模态大语言模型同步生成语音和3D面部动画。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00669 2026-09-04 cs.CL cs.AI cs.CV cs.LG 版本更新

Medical Reasoning in the Era of LLMs: A Systematic Review of Enhancement Techniques and Applications

大语言模型时代的医学推理:增强技术与应用的系统综述

Zizhan Ma, Wenxuan Wang, Meidan Ding, Shiyi Zheng, Shengyuan Liu, Jie Liu, Jiaming Ji, Linlin Shen, Yixuan Yuan, Wenting Chen

机构 * Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen University(深圳大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)

AI总结 本文对大语言模型时代医学推理的增强技术与应用开展首次系统综述,提出相关技术分类,分析其在多模态数据及临床场景的应用,调查评估基准演变,基于60项研究指出挑战并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02286 2026-09-03 stat.ML cs.LG eess.SP 新提交

From topology learning to graph generation: A unifying perspective

从拓扑学习到图生成:一个统一视角

Xiaowen Dong, Hoi-To Wai, Siheng Chen, Laura Toni, Dorina Thanou

机构 * University of Oxford(牛津大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) EPFL(洛桑联邦理工学院)

AI总结 本综述提出统一框架,将图拓扑学习与图生成视为图数据共同生成过程的逆问题,综述相关方法并指出跨范式整合机遇,为该领域提供跨学科视角并勾勒未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02886 2026-09-03 cs.CV 新提交

SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models

SolarWM:面向长时序视频世界模型的开放数据与可扩展训练

Junchao Huang, Guian Fang, Shengju Qian, Xianghao Kong, Zhuoran Zhao, Wei Huang, Yihua Du, Zixin Zhang, Justin Cui, Yuchao Gu, Yukang Chen, Xinting Hu, Tianyu He, Shaoshuai Shi, Zhuotao Tian, Xin Wang, Mike Zheng Shou, Li Jiang

机构 * CUHK-SZ(香港中文大学(深圳)) SLAI(深圳先进人工智能研究院) NUS(新加坡国立大学) CUHK(香港中文大学) HKUST(香港科技大学) HKUST-GZ(香港科技大学(广州)) NVIDIA(英伟达公司) UCLA(加利福尼亚大学洛杉矶分校) MSRA(微软亚洲研究院)

AI总结 SolarWM是面向长时序视频世界模型的开放基础框架,通过多源数据引擎与适配框架实现异构数据训练,实例化多款5B至33B模型,仅用5秒序列训练即可支持长时序实时交互,为相关研究提供可复扩展的基础。

Comments https://junchao-cs.github.io/SolarWM-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02413 2026-09-03 cs.GR cs.RO 新提交

WildFab: Multi-Axis 3D Printing from Models in the Wild

WildFab:面向野外模型的多轴3D打印

Jiasheng Qu, Zhikai Shen, Chenyu Xu, Hailin Sun, Chengkai Dai, Yuhu Guo, Junpeng Wang, Yeung Yam, Guoxin Fang

机构 * The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Carnegie Mellon University(卡内基梅隆大学) Technical University of Denmark(丹麦技术大学)

AI总结 本研究提出WildFab框架,结合UDF与reg-GWN的混合查询表示,实现多轴3D打印的无支撑制造,可直接处理含非流形结构的各类“野外”模型,提升设计到3DP工作流的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02367 2026-09-03 cs.MM cs.CV 新提交

The Missing Temporal Link: Temporal Context Routing for Script-Driven Audio-Video Generation

缺失的时间关联:面向脚本驱动的音视频生成的时间上下文路由

Yichen Liu, Quanwei Zhang, Haozhe Wang, Donghao Zhou, Xiaojie Li, Yang Shi, Jiaming Liu, Ruihua Huang, Yingtian Zou, Daquan Zhou

机构 * PKU(北京大学) Qwen Applications(通义千问应用公司) HKUST(香港科技大学) CUHK(香港中文大学) SJTU(上海交通大学)

AI总结 针对脚本驱动音视频生成中时序对齐不足的问题,提出时间上下文路由(TCR)方法,将脚本时序映射到音视频共享时间轴,显著提升了镜头边界和对话时序的准确性,且保持了音视频质量与同步性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02275 2026-09-03 cs.CL cs.AI cs.LG 新提交

Do Large Language Models Capture the Diversity in their Training Data?

大语言模型是否捕捉到了其训练数据中的多样性?

Youqi Wu, Farzan Farnia

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 该研究从信息论视角发现大语言模型等生成模型存在系统性条件多样性差距,提出事后修正机制并证明相关凹性以缓解该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01952 2026-09-03 cs.LG cs.AI 新提交

Convergence Theory of Knowledge Distillation in Asynchronous P2P Gossip Learning Network

异步P2P闲聊学习网络中知识蒸馏的收敛理论

Lucas Qingyang Fang, Tiyao Liu, Jinhao Jing, Zeji Li, Kaijie Chen, Harikrishna Kuttivelil, Katia Obraczka

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) China University of Petroleum(中国石油大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong(香港城市大学) University of Virginia(弗吉尼亚大学)

AI总结 本文针对异步P2P闲聊学习网络,提出了完全去中心化KD的收敛理论,证明其可将函数分歧收缩40-61倍,为异构设备的无服务器学习提供了理论支撑。

Comments 35 pages, 21 graphes, currently submitting to AAAI 2027 main track (Federated Learning and Decentralized Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08244 2026-09-03 cs.AI 版本更新

FemWear: A Parameter-Efficient Wearable Foundation Model for Women's Health

FemWear:面向女性健康的专用可穿戴设备基础模型

Yifan Wang, Chenzhong Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出面向女性健康的专用可穿戴基础模型FemWear,通过参数高效方式改造预训练主干,在女性健康相关指标上取得性能提升,但未确立普遍优势与临床有效性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16847 2026-09-03 cs.CL cs.AI 版本更新

Follow the Latent Roadmap: Navigating Revocable Decoding for Diffusion LLMs with Anchor Tokens

遵循潜在路径:利用锚定令牌导航扩散LLM的可撤销解码

Yizhen Yao, Qinglin Zhu, Runcong Zhao, Xiangxiang Dai, Yanzheng Xiang, Yulan He, Lin Gui

机构 * King's College London(伦敦国王学院) The Chinese University of Hong Kong(香港中文大学) The Alan Turing Institute, UK(英国艾伦·图灵研究所)

AI总结 针对扩散大语言模型解码速度与质量的权衡,提出无训练框架ASRD,通过锚定令牌解耦上下文,结合锚定引导生成与锚定扰动验证,在数学和编码基准上提升准确率6.4%,加速推理7.2倍。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29661 2026-09-03 cs.CV 版本更新

Geometry-Guided Modeling of Foundation Features Enables Generalizable Object Shape Deformation Learning

几何引导的基础特征建模实现可泛化的物体形状变形学习

Yiyao Ma, Kai Chen, Zhongxiang Zhou, Zhuheng Song, Dongsheng Xie, Zelong Tan, Rong Xiong, Qi Dou

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学计算机科学与工程系) Zhejiang Innovation Center for Humanoid Robotics, Ningbo, China(浙江省人形机器人创新中心) State Key Laboratory of Industrial Control and Technology, Zhejiang University, Hangzhou, China(浙江省工业控制技术重点实验室)

AI总结 提出一种几何引导的特征建模机制和视图自适应特征聚合模块,通过变形类别级形状模板实现单目3D形状恢复,在形状变化和视角多样性上显著优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10534 2026-09-03 cs.AI 版本更新

Achieving Olympiad-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning

通过复杂度提升强化学习实现奥lympia级几何大语言模型代理

Haiteng Zhao, Junhao Shen, Yiming Zhang, Songyang Gao, Kuikun Liu, Tianyou Ma, Fan Zheng, Dahua Lin, Wenwei Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) ICMAT Spanish National Research Council(西班牙国家研究委员会ICMAT) The Chinese University of Hong Kong(香港中文大学)

AI总结 InternGeometry通过复杂度提升强化学习实现几何问题求解,仅用13K训练示例解决44个IMO问题,超越平均金牌得主得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16509 2026-09-03 cs.CV 版本更新

SlowFast-SCI: Slow-Fast Deep Unfolding Learning for Spectral Compressive Imaging

SlowFast-SCI: 慢-快深度展开学习用于光谱压缩成像

Haijin Zeng, Xuan Lu, Jiezhang Cao, Kai Zhang, Yurong Zhang, Qiangqiang Shen, Guoqing Chao, Li Jiang, Yongyong Chen, Jingyong Su, Jie Liu

机构 * Harvard University(哈佛大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiaotong University(上海交通大学) City University of Hong Kong(香港城市大学) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 SlowFast-SCI是一种双速深度展开框架,通过预训练和自适应模块实现高效自适应的光谱重建,显著提升参数效率和适应速度。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23722 2026-09-03 cs.DC cs.AI 版本更新

OctoPipe: Reducing Pipeline Bubbles for Heterogeneous Models via Co-Optimizing Partitioning, Placement, and Scheduling

OctoPipe:通过共同优化分区、放置和调度减少异构模型的流水线气泡

Jihu Guo, Tenghui Ma, Wei Gao, Peng Sun, Xun Chen, Jiaxing Li, Zhisheng Ye, Yuyang Jin, Dahua Lin

机构 * FDU & Shanghai AI Laboratory(复旦大学及上海人工智能实验室) HKUST(香港科技大学) Unaffiliated(无隶属机构) Tsinghua University(清华大学) CUHK & SenseTime Research(香港大学及SenseTime研究院)

AI总结 研究针对模型架构异构性加剧流水线气泡降低训练效率的问题,提出OctoPipe系统,通过构建模拟器、开发调谐器、实现执行器共同优化分区、放置和调度,提升了吞吐量。

Comments 14 pages, 13 Figures; Accepted by SC'26;

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01260 2026-09-02 cs.AI cs.RO 新提交

Dual Process Motion Planning

双过程运动规划

Jiayi Yan, Francesco Fabiano, Alessandro Abate

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Oxford(牛津大学)

AI总结 本研究受双系统思维范式启发,提出双过程架构,结合符号求解器与经验驱动模块,在非线性基准环境中提升机器人运动规划的效率、精度与泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01147 2026-09-02 cs.CV cs.CL 新提交

On the Design Fundamentals of Pixel Text Representation Learning

像素文本表示学习的设计基础

Chaohao Yuan, Ruifeng Yuan, Zhuoxu Huang, Yu Rong, Hong Cheng, Hou Pong Chan, Chenghao Xiao

机构 * The Chinese University of Hong Kong(香港中文大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Fudan University(复旦大学) Aberystwyth University(阿伯里斯特威斯大学) University of Macau(澳门大学) Shanghai University of Finance and Economics(上海财经大学)

AI总结 本研究针对现有像素-文本编码器的缺陷,确定视觉文本表示学习的四个关键设计原则,据此训练的Pixel Linguist II在多项视觉文本任务上达SOTA,且在高视觉令牌压缩下仍具鲁棒性,推动光学上下文压缩发展。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01111 2026-09-02 cs.CL 新提交

ClinTraceBench: Source-Verifiable Longitudinal Clinical Reasoning over EHR-Derived Dialogues

ClinTraceBench:基于EHR衍生对话的可溯源纵向临床推理

Huimin Wang, Zhengyi Zhao, Yutian Zhao

机构 * Shenzhen University(深圳大学) The Chinese University of Hong Kong(香港中文大学) Dealism(迪利斯姆(Dealism))

AI总结 该研究提出ClinTraceBench基准,评估8种历史表示策略在4种临床大语言模型上的纵向临床推理能力,发现压缩策略存在关系损失与聚合代价,且颠覆了最大主干模型胜出的经验法则。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01068 2026-09-02 cs.CL 新提交

OUTLETS: Output-Length Prediction from Speculative Decoding Backbones

OUTLETS:基于推测解码主干的输出长度预测

Weihuang Wen, Yingying Liu, Yichuan Liu, Wenqi Zeng, Li Zhou, Chumin Sun, Jie Sun, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 针对LLM服务输出长度重尾分布的调度难题,OUTLETS利用推测解码草稿表示构建轻量长度预测器,降低MAE并将短请求P99延迟减少34.8%。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01006 2026-09-02 cs.AI cs.GR 新提交

Figures as Programs: Recursive Generation of Editable Scientific Figures

作为程序的图形:可编辑科学图形的递归生成

Yepeng Liu, Dasen Dai, Chengzhi Liu, Yiren Song, Hai Ci, Yu Zhang, Qi Zhang, Mike Zheng Shou, Xin Eric Wang, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) CUHK(香港中文大学) National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) Tongji University(同济大学)

AI总结 本研究提出多智能体系统FigTree,将科学图形生成转化为递归SVG程序构建任务,可从论文生成高质量可编辑矢量图形,其编辑效果优于现有光栅方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01004 2026-09-02 cs.CV cs.AI cs.CL cs.LG 新提交

SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models

SinkPruner:面向多模态大语言模型的无汇视觉令牌剪枝

Shiyu Li, Zi-Yuan Hu, Shijia Huang, Yanyang Li, Yiwu Zhong, Liwei Wang

机构 * Weitu AI(微图AI) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究针对多模态大语言模型处理长视觉令牌序列时计算开销大的问题,提出无训练的SinkPruner剪枝框架,通过视觉净化器和文本引导剪枝器,在12个图像-语言和4个视频-语言基准上实现高效推理,在令牌减少89%时保留了LLaVA-1.5和Qwen2.5-VL的大部分性能。

Comments EMNLP 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00862 2026-09-02 cs.CV 新提交

Training-Free Inpainting Across Domains with a Frozen Text-to-Image Diffusion Model

使用冻结文本到图像扩散模型的跨域无训练图像修复

Zhenhuan Wang, Fengyi Yuan

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院)

AI总结 该研究提出Step-PI方法,借助冻结文本到图像扩散模型,无需训练即可实现跨域图像修复,在多个数据集上优于同类无训练基线,为跨域图像修复提供了补充方案。

Comments 30 pages, 11 figures, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏