arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-04 至 2025-12-04 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 5 篇

2507.12482 2025-12-04 cs.SE cs.AI cs.CE cs.LG 84%

Kodezi Chronos: A Debugging-First Language Model for Repository-Scale Code Understanding

Kodezi Chronos:面向仓库级代码理解的调试优先语言模型

Ishraq Khan, Assad Chowdary, Sharoz Haseeb, Urvish Patel, Yousuf Zaii

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 Kodezi Chronos-1是一种专为调试设计的语言模型,通过自适应图引导检索、持久调试内存和七层架构,在多文件调试任务中达到67.3%的修复准确率,超越现有模型并实现仓库特定的高解决率。

Comments 24 figures, 43 tables, 2 algorithms. Extended technical report introducing Chronos-1, a debugging-specific language model. Information available at https://github.com/Kodezi/chronos

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03494 2025-12-04 cs.CL cs.LG 79%

A Preliminary Study on the Promises and Challenges of Native Top-$k$ Sparse Attention

关于原生Top-k稀疏注意力的潜力与挑战的初步研究

Di Xiu, Hongyin Tang, Bolin Rong, Lizhi Yan, Jingang Wang, Yifan Lu, Xunliang Cai

机构 * Meituan, Beijing, China(美团,北京,中国)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨了原生Top-k稀疏注意力机制在解码和训练中的有效性,通过实验验证其在提升模型性能方面的潜力,并从熵的角度解释了其在下游任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01311 2025-12-04 cs.AI cs.LG 73%

CuES: A Curiosity-driven and Environment-grounded Synthesis Framework for Agentic RL

CuES: 一种基于好奇心和环境导向的代理强化学习合成框架

Shinji Mai, Yunpeng Zhai, Ziqian Chen, Cheng Chen, Anni Zou, Shuchang Tao, Zhaoyang Liu, Bolin Ding

机构 * Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CuES通过好奇心驱动和环境导向的方法自动生成任务,提升代理强化学习的可扩展性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03724 2025-12-04 cs.CL 70%

MemOS: A Memory OS for AI System

MemOS:人工智能系统中的内存操作系统

Zhiyu Li, Chenyang Xi, Chunyu Li, Ding Chen, Boyu Chen, Shichao Song, Simin Niu, Hanyu Wang, Jiawei Yang, Chen Tang, Qingchen Yu, Jihao Zhao, Yezhaohui Wang, Peng Liu, Zehao Lin, Pengyuan Wang, Jiahao Huo, Tianyi Chen, Kai Chen, Kehang Li, Zhen Tao, Huayi Lai, Hao Wu, Bo Tang, Zhengren Wang, Zhaoxin Fan, Ningyu Zhang, Linfeng Zhang, Junchi Yan, Mingchuan Yang, Tong Xu, Wei Xu, Huajun Chen, Haofen Wang, Hongkang Yang, Wentao Zhang, Zhi-Qin John Xu, Siheng Chen, Feiyu Xiong

机构 * MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) Research Institute of China Telecom(中国电信研究院) Tongji University(同济大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Renmin University of China(中国人民大学) Beihang University(北航) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MemOS是一种面向人工智能系统的内存操作系统,通过统一管理不同类型的内存资源,提升长上下文推理和持续个性化的能力。

Comments 36 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05661 2025-12-04 cs.CV 50%

Language-Driven Object-Oriented Two-Stage Method for Scene Graph Anticipation

基于语言的面向对象两阶段方法用于场景图预见

Xiaomeng Zhu, Changwei Wang, Haozhe Wang, Xinyu Liu, Fangzhen Lin

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心,齐鲁大学) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(跨学科研究学院,香港科学与技术大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出基于语言的面向对象两阶段方法,通过时间一致性正则化预测对象集动态和关系轨迹,显著提升视频场景图预见性能。

详情

展开后加载摘要…

URL PDF HTML 收藏