arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-02-17 至 2026-02-17 共收录 9
2602.14386 2026-02-17 cs.CL

Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models

超越令牌级策略梯度:用于大语言模型复杂推理的多令牌策略梯度优化

Mufan Xu, Kehai Chen, Xuefeng Bai, Zhengyu Niu, Muyun Yang, Tiejun Zhao, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, China(哈尔滨工业大学计算机科学与技术学院) Baidu Inc.(百度公司)

AI总结 本文提出MPO框架,通过多令牌级优化提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14186 2026-02-17 cs.CV

UniRef-Image-Edit: Towards Scalable and Consistent Multi-Reference Image Editing

UniRef-Image-Edit: 向可扩展和一致的多参考图像编辑迈进

Hongyang Wei, Bin Wen, Yancheng Long, Yankai Yang, Yuhang Hu, Tianke Zhang, Wei Chen, Haonan Fan, Kaiyu Jiang, Jiankang Chen, Changyi Liu, Kaiyu Tang, Haojie Ding, Xiao Yang, Jia Sun, Huaiqing Wang, Zhenyu Yang, Xinyu Wei, Xianglong He, Yangguang Li, Fan Yang, Tingting Gao, Lei Zhang, Guorui Zhou, Han Li

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技) Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) CUHK MMLab(香港中文大学MMLab)

AI总结 UniRef-Image-Edit通过统一的输入表示和两阶段训练框架,提升多参考图像编辑的一致性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14143 2026-02-17 cs.LG cs.CL

ROAST: Rollout-based On-distribution Activation Steering Technique

基于 rollout 的分布内激活引导技术:ROAST

Xuanbo Su, Hao Luo, Yingfang Zhang, Lijun Zhang

机构 * Bairong Inc.(柏隆公司) School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院)

AI总结 ROAST 通过分布内 rollout 和连续软缩放技术提升大语言模型的推理性能,有效解决高幅度激活导致的引导方向不稳问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13818 2026-02-17 cs.CV cs.LG

VAR-3D: View-aware Auto-Regressive Model for Text-to-3D Generation via a 3D Tokenizer

VAR-3D: 基于视图感知的自回归模型用于文本到3D生成 via 3D标记器

Zongcheng Han, Dongyan Cao, Haoran Sun, Yu Hong

机构 * School of Computer Science and Technology(计算机科学与技术学院) Soochow University(苏州大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 VAR-3D通过视图感知的3D标记器和渲染监督训练策略,提升文本到3D生成的质量和对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13772 2026-02-17 cs.CV

Offline-Poly: A Polyhedral Framework For Offline 3D Multi-Object Tracking

Offline-Poly: 一种基于多边形框架的离线3D多目标跟踪

Xiaoyu Li, Yitao Wu, Xian Wu, Haolin Zhuo, Lijun Zhao, Lining Sun

机构 * State Key Laboratory of Robotics and System, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学)

AI总结 Offline-Poly提出了一种基于跟踪-跟踪范式的通用离线3D多目标跟踪方法,通过离线优化提升跟踪精度,实现77.6% AMOTA和83.00% HOTA的优异性能。

Comments Based on this work, we achieved 1st place on the KITTI tracking leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22920 2026-02-17 cs.CV

Q-Hawkeye: Reliable Visual Policy Optimization for Image Quality Assessment

Q-Hawkeye:用于图像质量评估的可靠视觉策略优化

Wulin Xie, Rui Dai, Ruidong Ding, Kaikui Liu, Xiangxiang Chu, Xinwen Hou, Jie Wen

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Amap, Alibaba Group, Hangzhou, China(阿里云) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))

AI总结 Q-Hawkeye通过不确定性感知动态优化和感知感知优化提升图像质量评估的可靠性,实现更稳定的策略优化和更准确的质量判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07817 2026-02-17 cs.CV

PAGCNet: A Pose-Aware and Geometry Constrained Framework for Panoramic Depth Estimation

PAGCNet:一种具有姿态感知和几何约束的全景深度估计框架

Kanglin Ning, Ruzhao Chen, Penghong Wang, Xingtao Wang, Ruiqin Xiong, Xiaopeng Fan

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) Suzhou Research Institute of HIT(哈尔滨工业大学苏州研究院) Institute of Digital Media, School of Electronic Engineering and Computer Science, Peking University(数字媒体学院,北京大学电子工程与计算机科学学院) PengChengLab, Shenzhen(鹏城实验室,深圳)

AI总结 PAGCNet通过姿态感知和几何约束框架,有效解决复杂室内场景中全景深度估计的挑战,提升深度估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12641 2026-02-17 cs.CV cs.AI

Single Image Reflection Separation via Dual Prior Interaction Transformer

单图像反射分离 via 双先验交互变换器

Yue Huang, Tianle Hu, Yu Chen, Zi'ang Li, Jie Wen, Xiaozhao Fang

机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) School of Computer Science and Technology, Guangdong University of Technology(广东工业大学计算机科学与技术学院) Shenzhen Key Laboratory of Visual Object Detection and Recognition, Harbin Institute of Technology(哈尔滨工业大学深圳视觉目标检测与识别重点实验室)

AI总结 本文提出双先验交互框架,通过轻量传输先验生成和有效先验融合,实现单图像反射分离的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13640 2026-02-17 cs.RO cs.AI

Hierarchical Audio-Visual-Proprioceptive Fusion for Precise Robotic Manipulation

层次化音频-视觉-本体感知融合用于精确机器人操作

Siyuan Li, Jiani Lu, Yu Song, Xianren Li, Bo An, Peng Liu

机构 * Harbin Institute of Technology, China(哈尔滨工业大学) Nanyang Technological University, Singapore(南洋理工大学)

AI总结 本文提出层次化多模态融合框架,通过整合音频、视觉和本体感知信息,提升机器人精确操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏