arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-07-21 至 2026-07-21 共收录 3
2606.09079 2026-07-21 cs.LG cs.AI 版本更新

FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

FlashMemory-DeepSeek-V4: 通过前瞻稀疏注意力实现闪电索引超长上下文

Yan Wang, Qifan Zhang, Jiachen Yu, Tian Liang, Dongyang Ma, Xiang Hu, Zibo Lin, Chunyang Li, Zhichao Wang, Miao Peng, Nuo Chen, Jia Li, Yujiu Yang, Haitao Mi, Dong Yu

机构 * Independent Researchers(独立研究者) Tencent(腾讯) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

AI总结 提出前瞻稀疏注意力(LSA),基于DeepSeek-V4架构的神经记忆索引器,通过预测未来上下文需求仅保留关键KV块,在超长上下文场景下将物理KV缓存压缩至全上下文的13.5%,同时保持或略微提升下游准确率。

Comments Technical report. 11 pages. Code and model available at https://github.com/libertywing/FlashMemory-Deepseek-V4 and https://huggingface.co/libertywing/FlashMemory-Deepseek-V4

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03043 2026-07-21 cs.CL cs.AI cs.LG 版本更新

Lil: Less is Less When Applying Post-Training Sparse-Attention Algorithms in Long-Decode Stage

Lil: 在长解码阶段应用后训练稀疏注意力算法时,少即是少

Junhao Hu, Fangze Li, Mingtao Xu, Feifan Meng, Shiju Zhao, Tiancheng Hu, Ting Peng, Anmin Liu, Wenrui Huang, Chenxu Liu, Ziyue Hua, Tao Xie

机构 * SCS, Peking University, Beijing, China(北京大学信息科学与技术学院,北京,中国) Key Lab of HCST (PKU), MOE, Beijing, China(高等教育出版社HCST重点实验室(PKU),北京,中国) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) Tencent, Shenzhen, China(腾讯,深圳,中国) Beijing Tongming Lake Information Technology Application Innovation Center, Beijing, China(北京 Tongming Lake 信息技术应用创新中心,北京,中国)

AI总结 本文研究了在长解码阶段应用稀疏注意力算法时,信息丢失导致序列变长的问题,提出早停算法减少token消耗并降低精度损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26800 2026-07-21 cs.CV cs.GR cs.LG 版本更新

OmniX: From Unified Panoramic Generation and Perception to Graphics-Ready 3D Scenes

OmniX:从统一全景生成与感知到适用于图形的3D场景

Yukun Huang, Jiwen Yu, Yanning Zhou, Jianan Wang, Xintao Wang, Pengfei Wan, Xihui Liu

机构 * University of Hong Kong(香港大学) Kuaishou Technology(快手科技) Tencent(腾讯)

AI总结 研究基于全景的2D提升技术,提出OmniX框架,利用跨模态适配器结构和循环空间算子,将预训练2D流匹配先验用于多模态联合建模,构建数据集,实现适用于图形的3D场景生成,为虚拟世界创建开辟新可能。

Comments ECCV 2026; Project page: https://yukun-huang.github.io/OmniX/

详情

展开后加载摘要…

URL PDF HTML 收藏