arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-02-04 至 2026-02-04 共收录 13
2602.03815 2026-02-04 cs.CV cs.LG

Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning

通过视觉标记修剪实现多模态大语言模型的快慢高效训练

Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong University of Science and Technology(香港科技大学)

AI总结 DualSpeed通过快慢双模式实现多模态大语言模型的高效训练,提升训练速度并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18939 2026-02-04 cs.LG cs.AI

Damba-ST: Domain-Adaptive Mamba for Efficient Urban Spatio-Temporal Prediction

Damba-ST: 域自适应Mamba用于高效的都市时空预测

Rui An, Yifeng Zhang, Ziran Liang, Wenqi Fan, Yuxuan Liang, Xuequn Shang, Qing Li

机构 * Northwestern Polytechnical University(西北工业大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

AI总结 Damba-ST通过域自适应Mamba模型提升都市时空预测的效率与泛化能力,解决跨域泛化难题。

Comments Accepted by ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03400 2026-02-04 cs.SE cs.AI

Precision in Practice: Knowledge Guided Code Summarizing Grounded in Industrial Expectations

实践中的精确性:基于工业期望的知识引导代码摘要

Jintai Li, Songqiang Chen, Shuo Jin, Xiaoyuan Xie

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机科学学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, China(香港科学与技术大学计算机科学与工程系) Department of Computer Science(计算机科学系)

AI总结 ExpSum 通过整合元数据抽象和领域知识检索,生成符合工业期望的代码摘要,显著提升摘要质量与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03237 2026-02-04 cs.LG cs.CL

Merging Beyond: Streaming LLM Updates via Activation-Guided Rotations

超越合并:通过激活引导的旋转进行流式LLM更新

Yuxuan Yao, Haonan Sheng, Qingsong Lv, Han Wu, Shuqi Liu, Zehua Liu, Zengyan Liu, Jiahui Gao, Haochen Tan, Xiaojin Fu, Haoli Bai, Hing Cheung So, Zhijiang Guo, Linqi Song

机构 * City University of Hong Kong, Hong Kong SAR(香港城市大学) Tsinghua University(清华大学) Huawei Noah’s Ark Lab, Hong Kong SAR(华为诺亚实验室(香港)) University of Hong Kong(香港大学) Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

AI总结 本文提出ARM策略,通过激活引导的旋转实现流式LLM更新,有效超越收敛模型,提供高效适应框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03086 2026-02-04 cs.LG cs.CV

Neural Predictor-Corrector: Solving Homotopy Problems with Reinforcement Learning

神经预测-校正器:利用强化学习解决同伦问题

Jiayao Mai, Bangyan Liao, Zhenjun Zhao, Yingping Zeng, Haoang Li, Javier Civera, Tailin Wu, Yi Zhou, Peidong Liu

机构 * Hunan University(湖南大学) Westlake University(西湖大学) University of Zaragoza(阿拉贡大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出神经预测-校正器,通过强化学习统一解决同伦问题,实现高效稳定的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03026 2026-02-04 cs.AI cs.MA

Visual Reasoning over Time Series via Multi-Agent System

通过多智能体系统进行时间序列的视觉推理

Weilin Ruan, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 MAS4TS通过多智能体系统实现时间序列的视觉推理,利用分析-推理-执行范式,结合视觉语言模型和工具链,提升时间序列任务的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02539 2026-02-04 cs.LG cs.CV

How Much Information Can a Vision Token Hold? A Scaling Law for Recognition Limits in VLMs

视觉标记能承载多少信息?VLMs中识别限制的缩放定律

Shuxin Zhuang, Zi Liang, Runsheng Yu, Hongzong Li, Rong Feng, Shiqin Tang, Youzhi Zhang

机构 * City University of Hong Kong(香港城市大学) The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港理工大学) Centre for Artificial Intelligence and Robotics, Chinese Academy of Sciences(中国科学院人工智能与机器人研究院)

AI总结 本研究通过压力测试揭示了视觉标记的信息上限,提出了一种统一的缩放定律,为优化视觉上下文压缩的效率-精度权衡提供了实证依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02230 2026-02-04 cs.LG cs.AI

SEDformer: Event-Synchronous Spiking Transformers for Irregular Telemetry Time Series Forecasting

SEDformer: 事件同步脉冲变换器用于不规则遥测时间序列预测

Ziyu Zhou, Yuchen Fang, Weilin Ruan, Shiyu Wang, James Kwok, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Electronic Science and Technology of China(电子科学与技术大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 SEDformer是一种基于脉冲变换器的遥测不规则时间序列预测模型,通过事件同步脉冲编码和事件保留下采样模块,提升预测精度并降低能耗。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02033 2026-02-04 cs.CV cs.AI cs.MM

One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation

一个尺寸,多种适配:在大规模广告图像生成中对多样化群体点击偏好进行对齐

Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院长春光学精密机械与物理研究所 & 中国科学院自动化所) School of AI, UCAS(中国科学院大学人工智能学院) HKUST(gz)(香港科技大学) PRLab, NJU(南京大学PRLab)

AI总结 本文提出OSMF框架,通过自适应分组和群组感知多模态模型,解决广告图像生成中用户群体点击偏好多样性的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01077 2026-02-04 cs.CV

PISA: Piecewise Sparse Attention Is Wiser for Efficient Diffusion Transformers

PISA:分块稀疏注意力使扩散变换器更高效

Haopeng Li, Shitong Shao, Wenliang Zhong, Zikai Zhou, Lichen Bai, Hui Xiong, Zeke Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 PISA通过分块稀疏注意力在保持质量的同时显著提升扩散变换器的效率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12203 2026-02-04 cs.CV

LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence

LazyDrag: 通过显式对应关系在多模态扩散变换器上实现稳定的拖拽编辑

Zixin Yin, Xili Dai, Duomin Wang, Xianfang Zeng, Lionel M. Ni, Gang Yu, Heung-Yeung Shum

机构 * The Hong Kong University of Science and Technology(香港科技大学) StepFun The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 LazyDrag通过显式对应关系实现多模态扩散变换器的稳定拖拽编辑,消除了隐式点匹配依赖,提升生成能力与精确控制。

Comments https://zxyin.github.io/LazyDrag

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09131 2026-02-04 cs.GR cs.AI cs.CV

Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer

无需训练的文本引导颜色编辑与多模态扩散变换器

Zixin Yin, Xili Dai, Ling-Hao Chen, Deyu Zhou, Jianan Wang, Duomin Wang, Gang Yu, Lionel M. Ni, Lei Zhang, Heung-Yeung Shum

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) International Digital Economy Academy(国际数字经济学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tsinghua University(清华大学) Astribot StepFun

AI总结 ColorCtrl通过多模态扩散变换器实现无需训练的文本引导颜色编辑,精准控制颜色属性并保持一致性,优于现有方法和商业模型。

Comments https://zxyin.github.io/ColorCtrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12968 2026-02-04 cs.CV cs.RO

OptiPMB: Enhancing 3D Multi-Object Tracking with Optimized Poisson Multi-Bernoulli Filtering

OptiPMB:通过优化的泊松多伯努利滤波增强3D多目标跟踪

Guanhua Ding, Yuxuan Xia, Runwei Guan, Qinchen Wu, Tao Huang, Weiping Ding, Jinping Sun, Guoqiang Mao

机构 * School of Electronic Information Engineering, Beihang University(电子信息工程学院,北京航空航天大学) School of Automation and Intelligent Sensing, Shanghai Jiaotong University(自动化与智能感知学院,上海交通大学) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科技大学) College of Science and Engineering, James Cook University(科学与工程学院,詹姆斯库克大学) School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学) Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学) Research Laboratory of Smart Driving and Intelligent Transportation Systems, Southeast University(智能驾驶与智能交通系统研究实验室,东南大学)

AI总结 OptiPMB通过优化的泊松多伯努利滤波器和创新设计提升3D多目标跟踪的准确性与性能

详情

展开后加载摘要…

URL PDF HTML 收藏