arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-02-11 至 2026-02-11 共收录 6
2602.10109 2026-02-11 cs.RO

ST4VLA: Spatially Guided Training for Vision-Language-Action Models

ST4VLA:基于空间引导的视觉-语言-动作模型训练

Jinhui Ye, Fangjing Wang, Ning Gao, Junqiu Yu, Yangkun Zhu, Bin Wang, Jinyu Zhang, Weiyang Jin, Yanwei Fu, Feng Zheng, Yilun Chen, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

AI总结 ST4VLA通过空间引导训练提升视觉-语言-动作模型的性能,实现对机器人任务的更稳健和可泛化的学习。

Comments Spatially Training for VLA, Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09736 2026-02-11 cs.CV

Toward Fine-Grained Facial Control in 3D Talking Head Generation

迈向3D说话人脸生成中的细粒度面部控制

Shaoyang Xie, Xiaofeng Cong, Baosheng Yu, Zhipeng Gui, Jie Gui, Yuan Yan Tang, James Tin-Yau Kwok

机构 * School of Cyber Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科金医学院) School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院) Purple Mountain Laboratories, Nanjing(南京紫金山实验室) Engineering Research Center of Blockchain Application, Supervision And Management (Southeast University), Ministry of Education(教育部区块链应用、监督与管理工程研究中心(东南大学)) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

AI总结 本文提出FG-3DGS框架,通过频率感知解耦策略实现细粒度面部控制,提升3D说话人脸生成的精度和唇同步效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09712 2026-02-11 cs.CL

TraceMem: Weaving Narrative Memory Schemata from User Conversational Traces

TraceMem: 从用户对话轨迹编织叙事记忆图式

Yiming Shu, Pei Liu, Tiange Zhang, Ruiyang Gao, Jun Ma, Chen Sun

机构 * The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nankai University(南开大学)

AI总结 TraceMem通过三阶段流程从用户对话轨迹中编织叙事记忆图式,提升多跳和时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09657 2026-02-11 cs.RO

AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild

AutoFly:面向野外无人机自主导航的视觉-语言-动作模型

Xiaolou Sun, Wufei Si, Wenhui Ni, Yuntian Li, Dongming Wu, Fei Xie, Runwei Guan, He-Yang Xu, Henghui Ding, Yuan Wu, Yutao Yue, Yongming Huang, Hui Xiong

机构 * Southeast University(东南大学) Purple Mountain Labs(紫金山实验室) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 AutoFly是一种面向野外无人机自主导航的视觉-语言-动作模型,通过伪深度编码器和渐进两阶段训练策略,实现自主避障和规划,提升导航成功率。

Comments Acceped by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08712 2026-02-11 cs.CL cs.AI cs.DC

A Survey on Parallel Text Generation: From Parallel Decoding to Diffusion Language Models

关于并行文本生成的综述:从并行解码到扩散语言模型

Lingzhe Zhang, Liancheng Fang, Chiming Duan, Minghua He, Leyi Pan, Pei Xiao, Shiyu Huang, Yunpeng Zhai, Xuming Hu, Philip S. Yu, Aiwei Liu

机构 * Peking University(北京大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Tsinghua University(清华大学) XPENG Alibaba Group(阿里巴巴集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文综述了并行文本生成技术,分析了基于AR和非AR的方法,评估了其在速度、质量和效率上的权衡,并指出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11239 2026-02-11 cs.LG

Massive-STEPS: Massive Semantic Trajectories for Understanding POI Check-ins -- Dataset and Benchmarks

Massive-STEPS: 用于理解POI签到的大量语义轨迹 -- 数据集和基准测试

Wilson Wongso, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 Massive-STEPS通过提供大规模、公开的POI签到数据集和基准测试,推动人类移动性和POI轨迹建模的可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏