arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-02-04 至 2026-02-04 共收录 6
2602.03815 2026-02-04 cs.CV cs.LG

Fast-Slow Efficient Training for Multimodal Large Language Models via Visual Token Pruning

通过视觉标记修剪实现多模态大语言模型的快慢高效训练

Dingkun Zhang, Shuhan Qi, Yulin Wu, Xinyu Xiao, Xuan Wang, Long Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong University of Science and Technology(香港科技大学)

AI总结 DualSpeed通过快慢双模式实现多模态大语言模型的高效训练,提升训练速度并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23440 2026-02-04 cs.AI

Self-Foveate: Enhancing Diversity and Difficulty of Synthesized Instructions from Unsupervised Text via Multi-Level Foveation

自聚焦:通过多级聚焦从无监督文本中增强合成指令的多样性和难度

Mingzhe Li, Xin Lu, Yanyan Zhao

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 Self-Foveate通过多级聚焦方法提升无监督文本合成指令的多样性和难度,采用细粒度到整体模式的提取策略,并结合重合成模块提高指令质量。

Comments Accepted to ACL 2025 (Findings). 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03156 2026-02-04 cs.CV cs.LG

Fully Kolmogorov-Arnold Deep Model in Medical Image Segmentation

全 Kolmogorov-Arnold 深度模型在医学图像分割中的应用

Xingyu Qiu, Xinghua Ma, Dong Liang, Gongning Luo, Wei Wang, Kuanquan Wang, Shuo Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Case Western Reserve University(凯斯西储大学)

AI总结 本文提出全 Kolmogorov-Arnold 深度模型,通过改进 KAN 层和减少内存消耗,实现医学图像分割的高精度与高效性。

Comments 11 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02453 2026-02-04 cs.AI

Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling

用漫画思考:通过结构化视觉叙事增强多模态推理

Andong Chen, Wenxin Zhu, Qiuyu Ding, Yuchen Song, Muyun Yang, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出用漫画作为中间视觉表示,通过结构化视觉叙事提升多模态推理效率和性能。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01709 2026-02-04 cs.CL

ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation

ARTIS: 通过迭代模拟实现代理风险感知的测试时间扩展

Xingshan Zeng, Lingzhi Wang, Weiwen Liu, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

AI总结 ARTIS通过迭代模拟提升代理在高风险环境中的可靠性和鲁棒性,采用风险感知的模拟器改进决策效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21984 2026-02-04 cs.CV cs.CL

Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models

超越视觉编码器:识别和缓解大视觉-语言模型中的空间偏差

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Yongshuai Hou, Weili Guan, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

AI总结 本文提出AGCI机制,通过动态注入全局视觉上下文缓解大视觉-语言模型中的空间偏差问题,提升模型的空间鲁棒性和下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏