Accelerating Attention with Basis Decomposition
基于基分解加速注意力机制
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出BD Attention(BDA),通过基分解将多头投影重构为紧凑形式,实现无损且架构无关的注意力加速,在DeepSeek-V2-Lite上KV投影加速34%、权重减小25%,困惑度仅增0.02%。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
基于基分解加速注意力机制
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出BD Attention(BDA),通过基分解将多头投影重构为紧凑形式,实现无损且架构无关的注意力加速,在DeepSeek-V2-Lite上KV投影加速34%、权重减小25%,困惑度仅增0.02%。
语言学与人脑:计算神经科学的视角
机构 * Institute of AI and Robotics, College of Intelligent Robotics and Advanced Manufacturing, Fudan University(人工智能与机器人研究院,智能机器人与先进制造学院,复旦大学) ; Department of Language Science and Technology, The Hong Kong Polytechnic University(语言科学与技术系,香港理工大学) ; Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文从计算神经科学视角,通过建模、模拟和数据分析将语言层次动态结构转化为可测试神经模型,并利用深度学习和大语言模型探索语言处理的神经基础。
Journal ref Cognitive Neurodynamics, 2026
评估 AGENTS.md:仓库级上下文文件对编码助手有帮助吗?
机构 * Department of Computer Science(计算机科学系) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 通过SWE-bench任务和开发者提交的上下文文件,评估发现上下文文件并未普遍提升编码助手的任务成功率,反而平均增加20%以上的推理成本。
分块码字嵌入用于可靠的多比特文本水印
机构 * Department of AI, DGIST, Daegu, Republic of Korea(韩国大邱科学技术院人工智能系) ; Department of EECS, DGIST, Daegu, Republic of Korea(韩国大邱科学技术院电子工程与计算机科学系) ; ICT convergence, University of Ulsan, Ulsan, Republic of Korea(韩国釜山大学信息通信融合学院)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出BREW框架,通过分块盲消息估计和窗口位移验证,解决多比特水印中高误报率问题,实现高真阳性率和低误报率。
Comments Accepted at ICML 2026
dMoE: 具有可学习块专家的扩散大语言模型
机构 * National University of Singapore(新加坡国立大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对扩散大语言模型与混合专家架构集成时块并行解码与令牌级专家选择不匹配导致的推理内存瓶颈,提出dMoE框架,通过聚合块内令牌级专家分布为统一的块级专家分布来减少激活专家数量,在保持性能的同时显著降低内存使用和延迟。
Comments Working in progress. Code is available at: \url{https://github.com/fscdc/dMoE}
面向高效视频大语言模型的sink-token感知剪枝:用于细粒度视频理解
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) ; Oracle ; University of California, San Diego(加州大学圣地亚哥分校) ; Electronics and Telecommunications Research Institute (ETRI)(电子电信研究院)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出Sink-Token-aware Pruning方法,通过识别并抑制semantically uninformative tokens,提升细粒度视频理解性能,在多种基准测试中表现优异。
Comments ECCV 2026
CoDe-R: 通过原理引导和自适应推理利用大语言模型优化反编译器输出
机构 * School of Computer Science and Technology / School of Artificial Intelligence, China University of Mining and Technology(计算机科学与技术学院/人工智能学院,中国矿业大学) ; Mine Digitization Engineering Research Center of the Ministry of Education, China University of Mining and Technology(教育部矿山数字化工程研究中心,中国矿业大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出CoDe-R框架,通过语义认知增强和动态双路径回退机制,在轻量级模型上首次实现平均可重执行率超过50%,显著提升反编译代码质量。
Comments 11 pages, 7 figures, 6 tables. Accepted by IJCNN 2026
迈向以人为中心的AI辅助术语工作
机构 * Universite du Quebec à Trois-Rivieres(魁北克大学三河分校)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出以人为中心的人工智能框架,在利用生成式AI自动化术语工作的同时,通过增强术语学家能力、保持人类控制权来确保术语数据的准确性和可靠性。
Comments Accepted for publication in the journal Terminology
DSB: 扩散语言模型的动态滑动块调度
机构 * Nanyang Technological University(南洋理工大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对扩散语言模型固定块调度忽视语义难度的问题,提出无训练的动态滑动块方法DSB及配套KV缓存机制DSB Cache,显著提升生成质量和推理效率。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
自动化低风险代码审查在Meta:RADAR、风险校准与审查效率
机构 * Meta USA, UK, Canada(Meta美国、英国、加拿大)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出RADAR系统,通过多阶段漏斗对代码差异进行风险分层自动化审查,在Meta部署后显著提升审查效率并降低风险。
MegaFold: 跨平台GPU上高效训练下一代3D注意力蛋白质模型
机构 * UIUC SSAIL Lab(UIUC SSAIL实验室)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 针对AlphaFold3类模型因3D注意力机制导致训练效率低的问题,提出MegaFold系统,通过高效内核、分片策略、算子融合和流水线优化,在NVIDIA和AMD GPU上实现更长序列训练和加速。
Comments 13 pages, 12 figures
无牺牲的引导:面向仅提示干预的引导向量的原则性训练
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出联合训练引导因子和方向的方法,消除后验因子选择;引入仅提示引导向量(PrOSV),仅干预少量提示词,在AxBench上优于传统全序列引导向量,并实现更好的通用模型效用与对抗鲁棒性权衡。
Comments 63 pages, 50 figures; accepted by ICML 2026
非洲数据中心用水效率数据集
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Carnegie Mellon University Africa Kigali Rwanda(卡内基梅隆大学非洲分校,基亚利,卢旺达) ; Rochester Institute of Technology(罗切斯特理工学院) ; Rochester New York USA(罗切斯特,纽约州,美国) ; Carnegie Mellon University Pittsburgh Pennsylvania USA(卡内基梅隆大学匹兹堡,宾夕法尼亚州,美国) ; University of California, Riverside(加州大学河滨分校)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 构建首个结合天气与发电数据的非洲41国数据中心用水效率数据集,评估Llama-3-70B和GPT-4推理用水量,发现多数非洲国家用水低于全球平均。
Comments Accepted by NeurIPS 2024 Workshop on Tackling Climate Change with Machine Learning
GenAutoML: 面向时间序列分析的动态架构生成与优化的智能体框架
机构 * Paul Wurth S.A.(保罗·沃思公司) ; Otto-von-Guericke University(奥托·冯·格里克大学) ; Technical University of Munich(慕尼黑技术大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出GenAutoML框架,利用大语言模型作为神经架构师,通过沙盒反射循环和签名感知运行时自动生成并优化时间序列预测与异常检测的神经网络架构,引入动态可逆实例归一化提升非平稳条件下的鲁棒性。
Comments 26 pages, 17 figures, 12 tables. Under review
MPK:一种用于将张量程序转化为巨型内核的编译器和运行时系统
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Tsinghua University(清华大学) ; NVIDIA ; University of Michigan(密歇根大学) ; Independent Researcher(独立研究者) ; Peking University(北京大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 提出MPK,首个自动将多GPU模型推理转化为单个高性能巨型内核的编译器和运行时系统,通过SM级图表示实现跨算子软件流水线和细粒度计算通信重叠,显著降低推理延迟。
Comments 14 pages
从感知序列中学习模式与抽象
机构 * Mathematisch-Naturwissenschaftlichen Fakultät und der Medizinischen Fakultät der Eberhard-Karls-Universität Tübingen(图宾根大学数学自然科学学院和医学学院)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究从感知序列中通过分块和抽象发现模式与层次结构的计算原理,提出理性分块模型和非参数层次变量模型,实现高效序列分解与无监督模式发现。
Comments Doctoral thesis
用于推理时间论证的神经符号学习
机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出了一种用于三元主张验证的可训练神经符号框架,通过在训练和推理过程中结合形式论证语义来指导大语言模型生成论证并分配基础分数,从而提高三元预测的准确性。
Comments Under review
更细粒度更好(配合正确的缩放)
机构 * Google LLC(谷歌公司) ; Mountain View, Ca(山景城,加利福尼亚)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文研究大语言模型低精度量化中的块大小悖论,发现细粒度块在正确缩放策略下能降低量化误差,并通过4-over-6方法等解决退化问题。
潜在缓存流:无需文本的模型间通信
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 提出潜在缓存流(LCF)方法,通过联合翻译和压缩键值缓存实现高效模型间通信,在上下文不同场景下比基于文本的通信准确率提高23%、速度提升8.5倍。
Comments 6 pages, 5 figures
WhiteTesseract: 通过XR和对话式AI重新诠释文化遗产
机构 * University of Tsukuba(茨口大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究通过结合XR和对话式AI,提出WhiteTesseract系统,旨在提升文化遗产展览的沉浸感和个性化体验,增强观众的参与度和反思能力。
Comments 38 pages, 13 figures. Accepted for publication in ACM Journal on Computing and Cultural Heritage (JOCCH)
参与过程:重新思考动作与观察的时间接口
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出参与过程(EP)模型,通过显式时间接口处理动作与观察的不同时间尺度交互,支持多速率协调和子系统组合,揭示隐藏的时间行为并使策略适应显式时间成本。
SMART: 基于音频增强多模态大模型的镜头感知视频时刻检索
机构 * Department of Computer Science, University at Albany - SUNY(University at Albany - SUNY 计算机科学系) ; School of Software & Microelectronics, Peking University(北京大学软件与微电子学院) ; Nanjing University(南京大学) ; Xiamen University(厦门大学) ; Department of Mathematics and Statistics, University at Albany - SUNY(University at Albany - SUNY 数学与统计学系)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出SMART框架,融合音频与视觉特征,利用镜头感知令牌压缩技术,在多模态大模型基础上实现视频时刻检索,在Charades-STA和QVHighlights上取得显著提升。
RECON:基于压缩的推理用于高效检索增强生成
机构 * University of Utah(犹他大学) ; University of Washington(华盛顿大学) ; George Washington University(乔治·华盛顿大学) ; University of Virginia(弗吉尼亚大学) ; Shandong University(山东大学) ; Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) ; University of Notre Dame(诺特丹大学)
专题命中 效率与部署 :LLM(abstract_cn);pretraining(abstract);分类 cs.CL
AI总结 提出RECON框架,在强化学习搜索代理的多轮推理中插入观察压缩器,通过两阶段课程训练实现上下文压缩,提升训练和推理效率并增强问答性能。
Comments Techinical report
打破知识的诅咒:为实时在线会议设计个性化术语支持
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Fujitsu Research of America(富士通美国研究)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出ParseJargon系统,利用用户画像和会话内反馈实现个性化术语识别,提升在线会议中跨学科听众的理解和参与度。
Comments Portions of this work appeared in CHI '26 Extended Abstracts ("Breaking the Curse of Knowledge: Toward Personalized Jargon Support in Online Meetings") and ACL '26 System Demonstrations ("ParseJargon: Personalized Real-time Jargon Support in Online Meetings")
无性能权衡的位精确AI推理验证
机构 * Naci Cankaya(纳西·卡纳亚)
专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 针对GPU浮点运算非确定性导致AI工作负载验证困难的问题,提出通过软件仿真实现位精确重计算,在不牺牲性能的前提下实现可审计的推理验证。
Comments Best paper award, ICML 2026 TAIGR workshop. Code can be found at https://github.com/NaciCankaya/hardware_rounding_error_predictor
在Google Cloud TPU上微调和服务Gemma 4 31B:与GPU基线的技术比较
机构 * Google Cloud(谷歌云)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文首次端到端展示了在TPU硬件上微调和服务Google Gemma 4 31B模型,通过与GPU平台的实证比较,提供了代码级适配方案,并证明TPU在训练速度和成本上具有优势。
EVA: 针对环境注入攻击的红队GUI智能体的演化语义对抗方法
机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Independent Researcher(独立研究者)
专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出EVA框架,通过演化语义对抗载荷攻击多模态大语言模型驱动的GUI智能体,揭示语义欺骗是攻击成功的关键,实现85%攻击成功率且快速收敛。
Comments Accepted by
语义观察核的识别与学习:部分观察、一致恢复与极小极大极限
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 探讨可观察语言法则何时支持状态可重现后验概率,提出语义映射方法,保持语言法则非参数性且不使用隐藏模型量。理论上推导多项条件和率等,实证上通过模拟和研究验证相关指标,明确语言概率提供可审计状态测量的条件。
Themis:通过完全分片稀疏数据并行实现高效的稀疏模型训练
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 Themis提出FSSDP方法,通过原位负载均衡与异构分片优化MoE训练,消除专家重排的开销,在2个集群的多样工作负载下实现1.26-2.42倍加速。
基于日志的检测规则在公共仓库中的演变
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 本文研究了公共仓库中基于日志的检测规则的演变,通过分析Sigma和Splunk Security Content两个项目中的6859条规则历史,发现约56%的规则至少经过一次修订,且规则生命周期内演变非单调,经常出现回退,表明规则变化并非持续积累,而是存在操作上的权衡。