arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

共收录 2282
2609.03675 2026-09-04 cs.CV 新提交

CoFiE: Coarse-to-Fine Evidence Selection for Efficient Streaming Video Understanding

CoFiE:用于高效流视频理解的由粗到细证据选择框架

Jing Jiang, Yiran Ling, Ruonan Li, Dimitrios Stamoulis, Jie Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) State Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统国家重点实验室) Pengcheng Laboratory(鹏城实验室)

AI总结 CoFiE 是一种由粗到细证据选择框架,通过解耦证据选择阶段减少流视频理解的延迟,在多个基准上实现最优准确率-效率权衡,性能优于现有模型

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03528 2026-09-04 cs.LG cs.AI cs.AR 新提交

LeanGRPO: Eliminating Redundant Recomputation in Diffusion RL

LeanGRPO:消除扩散强化学习中的冗余重计算

Sijie Wang, Zhiqiang Tan, Xinrui Yang, Shaohuai Shi

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院)

AI总结 针对扩散强化学习中rollout后冗余重计算的问题,提出LeanGRPO方法,通过两种无重计算训练调度方案实现最高1.83倍端到端加速,且保留原始优化目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03334 2026-09-04 cs.CV 新提交

Laplacian Frequency Hierarchies for Efficient 3D Gaussian Splatting Training

用于高效3D高斯溅射训练的拉普拉斯频率层次结构

Yixiong Yang, Sisheng Zhang, Qingsong Yan, Shaohuai Shi, Qiang Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) XGRIDS

AI总结 针对3D高斯溅射训练中高斯基元增长导致的瓶颈,提出拉普拉斯频率层次结构,结合拉普拉斯分解与分阶段训练,可与现有加速方法兼容,实现训练速度提升且重建质量有竞争力。

Comments Accepted to Pacific Graphics 2026 (conference track). Project page: https://sorenzhang574.github.io/Laplacian-GS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03331 2026-09-04 cs.CL 新提交

FPCO-Dialog: A Multi-Turn False-Premise Benchmark for Correction and Cooperation in Vision-Language Models

FPCO-Dialog:用于评估视觉语言模型中纠正与协作能力的多轮错误前提基准

Jiayuan Ma, Yuqi Lu, Weiyang Guo, Chenrui Wang, Junyi Shu, Xuebo Liu, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 本文提出FPCO-Dialog基准,针对多轮对话中持续错误前提场景,评估20个视觉语言模型的纠正与协作能力,揭示不同模型间的显著差异,相关资源已公开。

Comments Accepted at EMNLP2026 Main Conference. For code and data, see https://github.com/lab-klc/FPCO-Dialog

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03225 2026-09-04 cs.RO 新提交

Long-Horizon Consistent and Interaction-Aware World Models for Multi-Style End-to-End Driving

面向多风格端到端驾驶的长时一致且感知交互的世界模型

Yuxuan Han, Kunyuan Wu, Liyunong Yang, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)智能科学与工程学院) Autonomous Driving Center, Shanghai Utopilot Technology Co.Ltd.(上海元戎智能科技有限公司自动驾驶中心)

AI总结 针对现有世界模型在自动驾驶中长时一致性、交互建模及风格适应性的局限,提出StyleDrive框架,通过三项改进提升性能,在Bench2Drive基准上获显著提升并实现仿真到真实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02291 2026-09-04 cs.CV cs.AI 版本更新

VoRTeC: Taming Foundation Flow for One-step Real time Video Compression

VoRTeC:驯服基础流模型实现单步实时视频压缩

Yichong Xia, Qinhong Wu, Bin Chen, Jinpeng Wang, Zeyuan Chen, Haoqian Wang

机构 * Shenzhen International Graduate School(深圳国际研究生院) Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peking University(北京大学)

AI总结 该研究针对超低码率视频压缩的模糊伪影、解码延迟与时间一致性问题,提出基于Wan2.1的VoRTeC框架,实现单步解码,比特消耗降58%,解码速度提升3至197倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04726 2026-09-04 cs.CL cs.LG 版本更新

What You See Is What You Get: Observation-Aligned Supervision for Chart-to-Code Generation

所见即所得:图表到代码生成的观察对齐监督

Tianhao Niu, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 研究图表到代码生成,指出用参考绘图脚本监督微调存在问题,引入观察对齐监督框架,用视觉观察约束量替代潜在原始数据目标,实验证明可提升可观察值恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30912 2026-09-04 cs.CV cs.CL 版本更新

Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR

关注证据:面向多模态RLVR的证据锚定空间注意力监督

Ruina Hu, Chen Wang, Lai Wei, Jionghao Bai, Bin Yu, Weiran Huang, Kai Wang, Yue Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) Nankai University(南开大学) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 提出EASE方法,通过将标注证据区域转化为平滑视觉标记目标,在多模态强化学习训练中引导响应到图像的注意力,从而提升视觉语言模型在感知、幻觉、视觉数学和多模态推理基准上的性能。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02780 2026-09-03 cs.CV cs.CL 新提交

ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding

ShallowStream:先建立浅层索引再进行深度推理的流视频理解框架

Jitai Hao, Ke Yang, Qiang Huang, Jun Yu

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 针对多模态大语言模型处理流视频计算成本高的问题,提出ShallowStream框架,通过利用MLLM浅层构建索引并检索证据,在保持性能的同时大幅降低了延迟。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02573 2026-09-03 cs.CV 新提交

Deeply Interleaved Text-Image Contexts for Multimodal LLMs Assessment

用于多模态大语言模型评估的深度交错文本-图像上下文

Zihao Wang, Xi Xiang, Yuwen Sun, Yingyu Li, Yabo Zhang, Yihan Zeng, Fan Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文针对多模态模型评估中忽略深度交错文本-图像场景的问题,提出基准 TIC-Bench,评估 10 种多模态大语言模型的相关能力,发现其与人类专家存在显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02542 2026-09-03 cs.RO 新提交

World-Model-Augmented Visual Locomotion for Humanoids on Foothold-Constrained Terrain

基于世界模型增强的人形机器人在支点受限地形上的视觉 locomotion

Yuxi Liu, Lijun Han, Ziming Wang, Ao Zhang, Cong Yang, Wei Sui

机构 * D-Robotics(地平线机器人) Beijing University of Posts and Telecommunications(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) Soochow University(苏州大学)

AI总结 该研究提出WM-LOCO方法,通过联合训练循环世界模型与PPO策略,使人形机器人在支点受限地形上的平均成功率达93.3%,优于基线方法。

Comments 11 pages, 3 figures, 4 tables. Yuxi Liu and Lijun Han contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02079 2026-09-03 cs.RO cs.SY eess.SY 新提交

Koopman-Based Robust Model Predictive Control for Nonlinear Systems with Stochastic Intermittent Measurements

基于Koopman的带随机间歇测量的非线性系统鲁棒模型预测控制

Guanhua Liu, Tong Wu, Lixian Zhang, Weifeng Du, Minghao Han

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Astronautics, Harbin Institute of Technology(哈尔滨工业大学航天学院) Nanyang Technological University(南洋理工大学) Nanyang Environment and Water Research Institute (NEWRI)(南洋环境与水研究)

AI总结 本文针对带随机间歇测量的非线性系统,提出基于Koopman的带概率截断软约束的随机MPC框架,经理论分析和视觉伺服跟踪仿真验证,可保证闭环系统的递归可行性与均方最终有界性,实现有效跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02075 2026-09-03 cs.CV 新提交

DPA: Decoupling Product-Agnostic Anomaly Representations for Zero-shot Anomaly Generation

DPA:解耦与产品无关的异常表示用于零样本异常生成

Hang Yao, Yansheng Fu, Ming Liu, Zifei Yan, Yanli Ji, Hongzhi Zhang, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部) School of Intelligent Systems Engineering, Sun Yat-Sen University(中山大学智能工程学院)

AI总结 该研究针对新部署产品缺乏异常样本的问题,提出DPA框架,通过异常迁移生成真实异常,在多个基准上显著提升了下游异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24130 2026-09-03 cs.RO cs.SY eess.SY 版本更新

Equivariant Filter Transformations for Consistent and Efficient Visual--Inertial Navigation

等价滤波变换用于一致且高效的视觉-惯性导航

Chungeng Tian, Fenghua He, Ning Hao

机构 * School of Astronautics, Harbin Institute of Technology(哈尔滨工程大学航天学院)

AI总结 本文提出了一种等价滤波变换方法,通过建立不同对称性的等价滤波器之间的分析联系,实现系统一致性设计和高效实现。

Comments 39 papes, 13 figures. Paper accepted in IEEE/ASME Trans. Mechatronics (T-MECH)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16509 2026-09-03 cs.CV 版本更新

SlowFast-SCI: Slow-Fast Deep Unfolding Learning for Spectral Compressive Imaging

SlowFast-SCI: 慢-快深度展开学习用于光谱压缩成像

Haijin Zeng, Xuan Lu, Jiezhang Cao, Kai Zhang, Yurong Zhang, Qiangqiang Shen, Guoqing Chao, Li Jiang, Yongyong Chen, Jingyong Su, Jie Liu

机构 * Harvard University(哈佛大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiaotong University(上海交通大学) City University of Hong Kong(香港城市大学) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 SlowFast-SCI是一种双速深度展开框架,通过预训练和自适应模块实现高效自适应的光谱重建,显著提升参数效率和适应速度。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01487 2026-09-02 cs.CR cs.AI 新提交

Defense-as-Skill: Evolving Runtime Guard Skill for Skill-Augmented Agents

防御即技能:为技能增强型智能体演化运行时防护技能

Xiaofang Yang, Ziqi Miao, Dianbo Sui, Jing Shao, Lijun Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海))

AI总结 本研究提出 Defense-as-Skill 防御范式,将运行时防护实现为可安装技能,开发 SkillSonar 防护工具,构建 SCOPE-R 数据集,经演化后可大幅降低攻击成功率,同时保持安全-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01216 2026-09-02 cs.AI 新提交

H2Table: Hierarchical Hypergraph-Enhanced Large Language Models for Complex Table Reasoning

H2Table:用于复杂表格推理的分层超图增强型大语言模型

Jia Ling, Yangfan Wang, Chen Tang, Haoming Tan, Yang Yang, Yi Guan, Jingchi Jiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) AI Research Center, Midea Group (Shanghai) Co., Ltd.(美的集团(上海)有限公司AI研究中心) Changchun University of Science and Technology(长春理工大学)

AI总结 针对大语言模型处理表格时忽略其二维与分层结构的问题,提出H2Table框架,通过分层嵌套超图及定制超图编码器等,在HiTab数据集嵌套深度4的复杂表格任务上较最优基线提升22.88%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01051 2026-09-02 cs.LG cs.CV 新提交

SAGE: Subpopulation-Aware Generative Enhancement for Mitigating Spurious Correlations

SAGE:用于缓解虚假关联的子群体感知生成增强方法

Yiming Luo, Rongqiang Zhao, Jie Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) State Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统国家重点实验室)

AI总结 SAGE是两阶段生成增强框架,通过生成合成数据缓解虚假关联,在Waterbirds等三个数据集上的最差群体准确率优于无群体标签基线,提升最多7.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00866 2026-09-02 cs.CV cs.AI 新提交

Benchmarking Vision-Language Models for Automated Pathology Diagnosis and Report Generation

用于自动化病理诊断与报告生成的视觉语言模型基准测试

Yumi Lee, Harim Oh, Hyoryung Kim, Minji Kim, Eunsu Kim, Hyeseong Lee, Junya Fukuoka, Andrey Bychkov, Jijgee Munkhdelger, Rajiv Kumar Kaushal, Ayushi Sahay, Rajni Yadav, Bharathi Prabakaran, Sulen Sarioglu, Serdar Balcı, Ilknur Turkmen, Yuri Tolkach, Christian Harder, Julian Westerdorf, Reinhard Buettner, Audun Ljone Henriksen, Sepp De Raedt, Byung Hyun Lee, Sungjin Lim, Joohoon Lee, Gwanghyun Kim, Se Young Chun, Suryakant Singh, Saarthak Kapse, Prateek Prasanna, Kyung A Kim, Yousun Kang, Sehwan Yoo, Sungman Hong, Shubham Innani, Michael Feldman, Spyridon Bakas, Ujjwal Baid, Prasad Dutande, Suhas Gajare, Bhakti Baheti, Serkan Sökmen, Ece Tuğba Cebeci, Ahmet Halıcı, Musa Balcı, Kardelen Peçenek, Srividhya Sainath, Kyongseok Jang, Messi H. J. Lee, Noorul Wahab, Bodong Du, Jiaming Zhang, Qixiang Zhang, Jang-Hwan Choi, Sangjeong Ahn

机构 * Ewha Womans University(梨花女子大学) Korea University Anam Hospital(高丽大学安岩医院) Korea University College of Medicine(高丽大学医学院) Memorial Health Group(纪念健康集团) Kameda Medical Center(龟田医疗中心) Nagasaki University Graduate School of Biomedical Sciences(长崎大学生物医学科学研究生院) Tata Memorial Hospital(塔塔纪念医院) All India Institute Of Medical Sciences Delhi(全印医学科学研究所德里分院) University Hospital Cologne, Medical Faculty, University of Cologne(科隆大学医院、科隆大学医学院) Institute for Cancer Genetics and Informatics(癌症遗传学与信息学研究所) Seoul National University(首尔大学) Stony Brook University(石溪大学) Yonsei University College of Medicine(延世大学医学院) Tokyo Polytechnic University(东京工艺大学) Nanyang Technological University(南洋理工大学) Korea University(高丽大学) Indiana University School of Medicine(印第安纳大学医学院) Emory University(埃默里大学) Shri Guru Gobind Singhji Institute of Engineering and Technology(斯里古鲁戈宾德辛格吉工程技术学院) Viseur AI(维瑟人工智能公司) EKFZ TU Dresden (KatherLab)(德累斯顿工业大学EKFZ(凯瑟实验室)) MTS Company(MTS公司) University of Warwick(华威大学) The Hong Kong University of Science and Technology(香港科技大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 该研究建立了含约10500对样本的泛亚WSI-报告数据集及REG 2025基准,评估多模态病理模型,发现需结构化表示等提升性能,指出数字幻觉等局限,为相关模型设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00853 2026-09-02 cs.CV cs.AI 新提交

ADGNet: Asymmetric Dual-text Guided Network for Infrared Small Target Detection

ADGNet:用于红外小目标检测的非对称双文本引导网络

Tongtong Wang, Mingzhu Xu, Chenglong Yu, Jing Wang, Xiaohui Lin, Weili Guan

机构 * Shandong University(山东大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 针对红外小目标检测中纯视觉方法难区分目标与杂波、现有多模态方法存在缺陷的问题,提出ADGNet,设计ADP、ADBI、AFA模块,构建AITIR数据集,性能优于21种SOTA方法。

Comments 10 pages, 10 figures. Accepted by the 34th ACM International Conference on Multimedia (ACM Multimedia 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00845 2026-09-02 cs.AI 新提交

Towards Generalizable Visually Grounded Exploration of Household Devices

面向家庭设备的可泛化视觉接地探索

Linhao Zheng, Zeming Liu, Wangke Chen, Li Zeng, Wanxiang Che, Heyan Huang, Yuhang Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology(哈尔滨工业大学社会计算与交互机器人研究中心) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

AI总结 本文针对现有具身探索范式泛化能力不足的问题,构建了基准VGEBench及逻辑驱动状态机框架,实验发现现有VLMs在语义知识转物理执行和长程状态跟踪上存在挑战。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00666 2026-09-02 cs.CV 新提交

DGNet: Dual-knowledge Guided Network for Infrared Small Target Detection

DGNet:用于红外小目标检测的双知识引导网络

Chenglong Yu, Mingzhu Xu, Jing Wang, Tongtong Wang, Pingping Miao, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 针对红外小目标检测中文本引导方法的语义纠缠与部署限制问题,提出双知识引导网络DGNet,通过PWM模块与CDA损失实现性能提升,在三个公开数据集上验证了其有效性。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00624 2026-09-02 cs.CL 新提交

Trust Your Guide Only When Certain: Uncertainty-Aware Sparse Alignment at Inference Time

仅在确信时信任你的引导:推理时的不确定性感知稀疏对齐

Zeen Zhu, Zhuo Li, Weiyang Guo, Liye Zhao, Haibing Di, Yequan Wang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院)

AI总结 针对推理时LLMs密集对齐的低置信度干预问题,提出TUSA方法,通过不确定性感知仲裁器仅在满足条件时授权干预,跳过约50%对齐步骤,同时提升安全与通用偏好。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00619 2026-09-02 cs.RO 新提交

DSG: Dynamic 3D Scene Graph Construction for Embodied Agents in Changing Indoor Environments

DSG:面向动态室内环境中具身智能体的动态3D场景图构建

Ming Liao, Chao Ye, Jianing Fei, Weiyang Lin

机构 * Research Institute of Intelligent Control and Systems, Harbin Institute of Technology(哈尔滨工业大学智能控制系统研究院)

AI总结 本文针对室内环境中物体变化导致场景图不一致的问题,提出DSG框架,结合3D高斯表示、双视图变化检测与多粒度空间推理,在DynTHOR等基准上优于现有方法,提升动态场景图构建准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00404 2026-09-02 cs.CR cs.RO cs.SE 新提交

Federated Trust for Embodied Robot Capability Marketplaces

用于具身机器人能力市场的联邦信任机制

Xue Qin, Simin Luan, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

AI总结 针对具身机器人集群提出联邦信任机制,实现本地验证,经5000次对抗试验验证其安全性,性能与存储占用优于对比方案。

Comments 32 pages, 2 figures. Reference implementation and reproduction data: https://github.com/s20sc/embodied-federated-trust

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00097 2026-09-02 cs.LG cs.AI 新提交

Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding

比Flash更快:利用注意力稀疏性实现高效长上下文解码

Zhigeng Liu, Zhiyuan Ning, Ruixiao Li, Xiaoran Liu, Yuerong Song, Min Zhang, Ziwei He, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 该研究提出硬件-算法协同设计框架FFD,利用注意力稀疏性实现长上下文解码的高效性,获内核级11.6倍加速、端到端吞吐量2.37倍提升,在基准数据集上保持精度。

Comments 20 pages, 8 figures, 10 tables; Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20153 2026-09-02 cs.CL 版本更新

FormalTCS: Benchmarking End-to-End Frontier Formal Theoretical Computer Science Research of Large Language Models

FormalTCS:评估大型语言模型端到端前沿形式理论计算机科学研究的基准

Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 FormalTCS基准评估发现,当前大型语言模型完成端到端前沿TCS研究的能力不足,形式化是核心瓶颈,且研究品味限制了自主TCS研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12781 2026-09-02 cs.CL cs.AI 版本更新

A Token is Worth over 1,000 Tokens: Efficient Knowledge Distillation through Low-Rank Clone

一个标记值超过1000个标记:通过低秩克隆实现高效的知识蒸馏

Jitai Hao, Qiang Huang, Hao Liu, Xinyan Xiao, Zhaochun Ren, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学智能科学与工程学院) Baidu Inc.(百度公司) Leiden University(莱顿大学) Pengcheng Laboratory(鹏城实验室)

AI总结 本文提出低秩克隆方法,通过高效预训练实现小语言模型在训练效率和性能上的突破。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10475 2026-09-02 cs.CR cs.AI cs.CV 版本更新

X-SG$^2$S: Safe and Generalizable Gaussian Splatting with X-dimensional Watermarks

X-SG²S:具有X维水印的安全且可泛化的高斯溅射技术

Zihang Cheng, Wentao Bao, Huiping Zhuang, Chun Li, Xin Meng, Ziqian Zeng, Cen Chen, Ming Li, F. Richard Yu

机构 * South China University of Technology(南方科技大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Peking University(北京大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出X-SG²S框架,为3D高斯溅射技术实现1至3维水印的多模态嵌入,兼具高保真度与鲁棒性,且无需修改参数或管线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10214 2026-09-02 cs.CV 版本更新

Exploiting Stability-Plasticity Asymmetry in Pretrained Detectors for Incremental Object Detection

利用预训练检测器中的稳定性-可塑性不对称性实现增量目标检测

Songze Li, Qixing Xu, Tonghua Su, Xu-Yao Zhang, Zhongjie Wang, Yunzhe Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)

AI总结 该研究针对增量目标检测中预训练检测器未区分组件稳定性与可塑性的问题,提出选择性适配与保留框架,结合质量感知高斯特征回放和两阶段一致性蒸馏,在COCO等数据集上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏