LycheeDecode: Accelerating Long-Context LLM Inference via Hybrid-Head Sparse Decoding
LycheeDecode: 通过混合头稀疏解码加速长上下文LLM推理
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院)
AI总结 LycheeDecode通过混合头稀疏解码方法,实现长上下文LLM推理的高效与高质量
Comments ICLR 2026
高校专区
LycheeDecode: 通过混合头稀疏解码加速长上下文LLM推理
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院)
AI总结 LycheeDecode通过混合头稀疏解码方法,实现长上下文LLM推理的高效与高质量
Comments ICLR 2026
超越单模态捷径:MLLMs作为跨模态推理器用于 grounded 命名实体识别
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学)
AI总结 本文提出MCR方法,通过多风格推理模式注入和约束引导的可验证优化,解决MLLMs在跨模态推理中的模态偏见问题,提升 grounded 命名实体识别的性能。
Comments GMNER
medR:通过三驱动势函数实现临床离线强化学习中的奖励工程
机构 * National University of Singapore(新加坡国立大学) ; University of Helsinki(赫尔辛基大学) ; Harbin Institute of Technology(哈尔滨工业大学)
AI总结 medR通过三驱动势函数实现临床离线强化学习中的自动化奖励设计,提升策略性能。
PhysBrain: 人眼视角数据作为视觉语言模型到物理智能的桥梁
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Huazhong University of Science and Technology(华中科技大学)
AI总结 PhysBrain通过将人类眼动视频转化为多级具身监督,提升机器人在眼动感知和长期规划中的能力,实现从人类视角到机器人控制的有效迁移。
Comments 21 pages, 8 figures
一致的监督-无监督对齐用于通用类别发现
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究院、西安交通大学) ; School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(计算机科学与技术学院、哈尔滨工业大学深圳校区) ; School of Software Engineering, Xi’an Jiaotong University(软件工程学院、西安交通大学) ; Kuaishou Technology(快手科技) ; Faculty of Microelectronics, Shenzhen University of Advanced Technology(微电子学院、深圳先进技术大学)
AI总结 本文提出NC-GCD框架,通过预分配ETF原型和引入一致ETF对齐损失,提升通用类别发现任务中新类别识别的性能。
Comments Accepted by NeurIPS 2025
MirrorLA: 用于视觉线性注意力的特征图反射
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院) ; Pengcheng Laboratory(鹏城实验室) ; UQMM Lab, University of Queensland(UQMM实验室,昆士兰大学)
AI总结 MirrorLA通过几何框架和可学习反射实现线性注意力的非负特征图重定向,提升性能并保持表示忠实性。
超越静态裁剪:层适应的视觉定位与解码增强
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; King’s College London(伦敦大学国王学院)
AI总结 本文提出LASER方法,通过动态层适应提升视觉定位和解码精度,解决静态裁剪在复杂推理任务中的局限性。
Comments 9 pages, 5 figures
AppleVLM: 端到端自主驾驶与高级感知和规划增强的视觉语言模型
机构 * Shenzhen Key Lab for Advanced Motion Control and Modern Automation Equipments(深圳先进运动控制系统与现代自动化装备重点实验室) ; Guangdong Provincial Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics(广东省智能变形机制与适应机器人省重点实验室) ; School of Intelligence Science and Engineering(智能科学与工程学院) ; Harbin Institute of Technology(哈尔滨工业大学) ; National Key Laboratory of Smart Farm Technologies and Systems(国家智能农业技术与系统重点实验室) ; Autonomous Driving Center(自动驾驶中心) ; Shanghai Utopilot Technology Co.Ltd.(上海驭目科技有限公司)
AI总结 AppleVLM通过引入先进的视觉和规划编码器,提升端到端自动驾驶的感知和决策能力,实现复杂环境下的稳健驾驶性能。
评估和引导多模态大语言模型中的模态偏好
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)
AI总结 本文提出MC²基准测试,通过受控证据冲突场景评估和引导多模态大语言模型的模态偏好,揭示了其可通过指令引导和潜在表示控制,并展示了通过表示工程方法提升多模态任务性能的潜力。
Comments Modality Preference