arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Harbin Institute of Technology(哈尔滨工业大学)

2026-08-26 至 2026-08-26 共收录 4
2608.24714 2026-08-26 cs.RO 新提交

GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models

GaussianWAM:将三维高斯场的几何与语义知识蒸馏至世界-动作模型

Zijian Zhang, Yuqing Jiang, Weitao Zhou, Minglei Li, Jinhao Zhang, Yao Mu, Xiaofan Li, Hao Zhao, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Simple AI(简智人工智能) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) The University of Hong Kong(香港大学)

AI总结 GaussianWAM是训练时的表征增强框架,通过三维高斯场蒸馏几何与语义监督,在LIBERO-Plus等任务上显著提升了WAM类模型的机器人操作性能,且不改变部署架构。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24334 2026-08-26 cs.CV cs.CL cs.GR 新提交

SeMoCo: A Semantic-First Motion Codec for Motion Language Modeling

SeMoCo:面向运动语言建模的语义优先运动编解码器

Tianlv Huang, Hetian Guo, Ziyi Cai, Song Wang, Yanping Zhang, Zipei Fan, Xuan Song, Guangming Wu, Xin Zheng

机构 * Jilin University(吉林大学) Frontier Robotics(前沿机器人公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 SeMoCo是面向运动语言建模的语义优先运动编解码器,搭配双轴运动生成器,构建了Ω-MotionVerse数据集,在重构精度与文本到运动生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24300 2026-08-26 cs.LG cs.AI 新提交

Contrastive Branch Policy Optimization

对比分支策略优化

Ying Wang, Changlin Qiu, Bang Lin, Linbo Jin, Wen Jiang, Zhe Sun, Jingli Yang

机构 * Alibaba Group(阿里巴巴集团) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 针对工具集成智能体训练的细粒度信用分配问题,提出CBPO解耦分支采样的预算分配与信用转化,在十个基准上优于现有方法,获两个领域及两种模型规模下最高宏平均准确率。

Comments 10 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-08-26 cs.CV cs.AI 版本更新

EviPathBench: Benchmarking Evidence Acquisition and Reasoning in Vision-Language Models for Whole-Slide Pathology

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏