arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Huawei(华为)

2026-07-07 至 2026-07-07 共收录 8
2607.04732 2026-07-07 cs.CV 新提交

SparseOcc++: Geometry-Aware Sparse Latent Representation for Semantic Occupancy Prediction

SparseOcc++:用于语义占用预测的几何感知稀疏潜在表示

Pin Tang, Zhongdao Wang, Guoqing Wang, Xiangxuan Ren, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(教育部人工智能重点实验室,上海交通大学人工智能研究院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

AI总结 研究针对基于视觉的3D语义占用预测,提出SparseOcc++框架,通过场景完成场将场景完成与语义分割解耦,用新方法建模复杂户外几何,实验表明其提升了IoU且速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04661 2026-07-07 cs.CV cs.AI 新提交

Targeted Structure Completion for Sparse-View 3D Reconstruction in Autonomous Driving

自动驾驶中稀疏视图3D重建的目标结构完成

Guoqing Wang, Pin Tang, Xiangxuan Ren, Liping Hou, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, Institute of AI, Shanghai Jiao Tong University(教育部人工智能重点实验室,上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

AI总结 针对自动驾驶稀疏视图3D重建难题,提出FocusGS框架,通过解耦结构完成与确定性区域,集中计算于几何模糊区域,设计模块优化高斯查询,提升效率质量平衡。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04652 2026-07-07 cs.RO 新提交

KAM-WM: Kinematic Affordance Maps from Latent World Models for Robot Manipulation

KAM-WM:基于潜在世界模型的机器人操作运动学可供性地图

Xinyu Shao, Keru Zhou, Guowei Huang, Yajun Gao, Tongtong Cao, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Huawei Technologies Ltd.(华为技术有限公司)

AI总结 研究如何从少量演示中学习操作,提出KAM-WM框架,从冻结的潜在视频世界模型提取粗粒度方向交互线索,转化为运动学可供性地图,结合其他信息控制机器人,在实验中取得较好成果。

Comments 16 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04637 2026-07-07 cs.CV 新提交

PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving

PixelPilot:用于端到端自动驾驶的可扩展视觉-语言-动作模型

Pin Tang, Guoqing Wang, Xiangxuan Ren, Zhongdao Wang, Guodongfang Zhao, Bailan, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, Institute of AI, Shanghai Jiao Tong University(教育部人工智能重点实验室,上海交通大学人工智能研究院) Central Research Institute, Huawei(华为中央研究院)

AI总结 针对现有视觉-语言-动作模型在自动驾驶场景中数据可扩展性有限等问题,提出PixelPilot,采用解耦规划和提升范式,通过知识灌输策略学习,提升了模型性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04302 2026-07-07 cs.LG cs.AI cs.AR cs.CL cs.PF 新提交

HiFA4: Training-Free 4-bit FlashAttention on Ascend HIF4 NPUs for LLM Inference

HiFA4:用于大语言模型推理的昇腾HIF4 NPU上的免训练4位FlashAttention

Hui Dong, Yanzhao Li, Jie Gao, Chunlu Li, Zhiyuan Zhang, Yupeng Sun, Zhenyuan Chen, Zhiqiang Zou

机构 * Huawei Technologies(华为技术有限公司)

AI总结 HiFA4是一种训练后算子级设计,在昇腾NPU上用4位HIF4 Cube GEMM执行QK^T和PV进行大语言模型推理,结合Smooth-QK和P-Reordering机制,减少量化决策漂移,提升准确率。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03780 2026-07-07 cs.SE cs.AI 新提交

SkillFab: An Agent-Native Skill Production Platform

SkillFab:一个原生代理技能生产平台

Anjie Xu, Yifeng Cai, Yi Li, Zixing Wang, Zhiyu Zhang, Jingfan Chen, Ruohan Xu, Leye Wang

机构 * Peking University(北京大学) Huawei(华为) Northwestern Polytechnical University(西北工业大学) Zhongguancun Academy(中关村学院)

AI总结 SkillFab是原生代理平台,将缺失能力转化为可复用技能。运行时代理先找技能,无则提需求,经SkillFab管理库等流程开发,通过多界面暴露相同生命周期,使工作可审查可恢复,还介绍了平台及案例。

Comments 12 pages, 7 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03732 2026-07-07 cs.CV 新提交

ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics

ProxyUp:用于可控动力学的免训练代理条件视频生成

Zanwei Zhou, Jiazhong Cen, Jiemin Fang, Yumeng He, Chen Yang, Sikuang Li, Fanpeng Meng, Zhikuan Bao, Wei Shen, Qi Tian

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Inc.(华为公司)

AI总结 现代视频生成模型精确控制复杂动力学具挑战性。提出代理条件视频生成,以代理视频控制前景物体运动。基于预训练模型构建免训练框架ProxyUp,用区域潜在噪声和随机流松弛,实验表明其在动态保真度和文本对齐方面优于基线。

Comments Project Page: $\href{https://zanue.github.io/proxyup}{\text{this https URL}}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02991 2026-07-07 cs.CV 新提交

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

GuideMe:流视频中的多域任务指导与干预

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究院) University of Science and Technology of China(中国科学技术大学) Chinese University of Hong Kong(香港中文大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

AI总结 构建流视频多域基准GuideMe,支持训练和评估用于闭环交互任务指导的MLLMs,设计评估框架衡量模型能力,实验发现现有MLLMs虽擅提供指令,但难识别执行错误并反馈。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏