arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2014 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2014 篇

2606.27732 2026-06-29 cs.IR cs.AI cs.LG 新提交 84%

Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation

双焦扩散语言模型:用于并行生成的非对称双向上下文

Yuhang Chen, Xianfeng Wu, Jinhao Duan, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Parish Aggarwal, Frank Shyu, Luke Simon, Sandeep Pandey, Xi Liu, Tianlong Chen

机构 * Meta AI University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出双焦扩散语言模型R2LM,通过非对称双向上下文(因果注意力+反向Mamba)解决双向注意力与KV缓存不兼容问题,实现并行生成中2.4-12.9倍吞吐提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27627 2026-06-29 cs.LG cs.AI 新提交 84%

HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models

HybridCodec:为高效语音语言模型建模离散和连续表示

Artem Ploujnikov, Francesco Verdini, Samir Sadok, Mirco Ravanelli

机构 * Mila, Quebec AI Institute(Mila-魁北克人工智能研究所) Concordia University(康考迪亚大学) Sapienza University of Rome(罗马大学) Inria, Université Grenoble Alpes CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学国家科学研究中心,让·库尔曼实验室)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出HybridCodec,结合时间压缩离散令牌与降维连续残差,通过混合离散-连续焦点调制编解码器和混合Transformer,在离散域自回归推理并辅以非自回归预测和连续残差上采样,相比纯离散方法显著提升说话人特征保留并减少自回归步数。

Comments Accepted

Journal ref InterSpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27550 2026-06-29 cs.CL cs.LG 新提交 84%

EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction

EntMTP:基于熵引导的多令牌预测加速LLM推理

Carrie Chen

机构 * Cornell University(康奈尔大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出EntMTP,一种无需训练的动态树注意力拓扑调度器,根据局部生成熵调整推测深度,在保持生成质量的同时最大化接受令牌吞吐量,相比Hydra和Medusa分别实现1.15倍和1.36倍加速。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26120 2026-06-26 cs.CL cs.LG 新提交 84%

Dynamic-dLLM: Dynamic Cache-Budget and Adaptive Parallel Decoding for Training-Free Acceleration of Diffusion LLM

Dynamic-dLLM: 动态缓存预算与自适应并行解码实现扩散大语言模型的无训练加速

Tianyi Wu, Xiaoxi Sun, Yanhua Jiao, Yulin Li, Yixin Chen, YunHao Cao, YiQi Hu, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Huawei(华为) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对扩散大语言模型计算复杂度随序列长度立方增长的问题,提出Dynamic-dLLM框架,通过动态缓存更新和自适应并行解码,在不训练的情况下实现3倍以上加速并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23104 2026-06-23 cs.LG cs.AI 新提交 84%

ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation

ReNIO: 为大语言模型在线策略蒸馏重加权负轨迹重要性

Chen Lin, Kedi Chen, Wei Zhang

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 提出ReNIO方法,通过学生-教师概率比识别错误推理轨迹中的关键令牌并加权,在不依赖最终答案正确性的情况下提升在线策略蒸馏效果,在数学推理和代码生成任务上取得显著提升。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20670 2026-06-23 cs.LG cs.AI cs.IT math.IT 新提交 84%

Towards CSI-Native Foundation Models: A Channel-Adaptive Roadmap for 6G

面向CSI原生的基础模型:6G的信道自适应路线图

Chenyu Zhang, Xinchen Lyu, Chenshan Ren, Shuhan Liu, Qimei Cui

机构 * National Engineering Research Center for Mobile Network Technologies, Beijing University of Posts and Telecommunications(北京邮电大学移动网络技术国家工程研究中心) Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(中央民族大学教育部民族语言智能分析与安全治理重点实验室) China Telecom Corporation Limited Gansu Branch(中国电信股份有限公司甘肃分公司)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出信道自适应路线图,通过统一预训练、位置建模和注意力控制与信道需求对齐,实现CSI原生基础模型,在零样本泛化、尺度外推和推理效率上显著优于现有方法。

Comments 7 pages, 5 figures, submmited to IEEE WCM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19475 2026-06-23 cs.AI cs.CL 新提交 84%

Diffusion Language Models: An Experimental Analysis

扩散语言模型:一项实验分析

Thomas Bertolani, Davide Bucciarelli, Leonardo Zini, Marcella Cornia, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) University of Pisa(比萨大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统比较了八种扩散语言模型在推理、编码、翻译等任务上的表现,分析了去噪步数、上下文长度等推理因素对性能与效率的影响,揭示了扩散语言模型在不同任务和预算下的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19558 2026-06-19 cs.LG cs.CL 新提交 84%

Displacement Is Not Direction: Evaluating Fidelity Metrics for Quantized LLM Deployment

位移不是方向:评估量化LLM部署的保真度指标

Miloš Nikolić, Ali Hadi Zadeh, Enrique Torres Sanchez, Andreas Moshovos

机构 * ByteShape University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文研究KL散度等保真度指标在量化语言模型部署中与下游基准分数的相关性,发现整体强相关但在近基线区域失效,归因于KL散度主要衡量分歧量而非方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18271 2026-06-18 cs.AI cs.LG 新提交 84%

NAVI-Orbital: First In-Orbit Demonstration of a Zero-Shot Vision-Language Model for Autonomous Earth Observation

NAVI-Orbital:用于自主地球观测的零样本视觉语言模型的首次在轨演示

Juan Manuel Delfa Victoria, Taran Cyriac John, Andrew W. Herson

机构 * NASA Jet Propulsion Laboratory (JPL)(美国宇航局喷气推进实验室) Loft Orbital(Loft Orbital公司)

专题命中 效率与部署 :language model(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍NAVI-Orbital系统,在低地球轨道卫星上首次实现视觉语言模型的自主多模态推理,通过语义压缩解决数据下传瓶颈。

Comments 17 pages, 47 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16496 2026-06-16 cs.CL cs.LG 新提交 84%

REFLEX: Reflective Evolution from LLM Experience

REFLEX: 基于大语言模型经验的反思进化

Pan Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出REFLEX框架,通过解耦视觉诊断与代码生成实现可审计的高效策略进化,在控制任务和天线阵列合成中展现优异样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12841 2026-06-12 cs.LG cs.AI 新提交 84%

TimeROME-DLM: Temporal Causal Tracing and Low-Rank Inference-Time Knowledge Editing for Masked Diffusion Language Models

TimeROME-DLM:掩码扩散语言模型的时间因果追踪与低秩推理时知识编辑

Zhengtao Yao, Liuyang Song, Hongbo Zhang, Chenhao Wei, Haoyan Xu, Guang Yang, Siheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出TimeROME-DLM,首个无需训练和梯度的推理时知识编辑框架,通过时间因果追踪定位关键坐标并应用低秩残差编辑,在保持模型性能的同时高效删除事实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07618 2026-06-09 cs.LG cs.AI cs.CV 新提交 84%

ScaleSweep: Accurate NVFP4 Post-Training Quantization of LLMs via Block Scale Initialization

ScaleSweep: 通过块尺度初始化实现LLM的精确NVFP4训练后量化

Li Lin, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 效率与部署 :post-training(title);LLM(title_cn);分类 cs.AI、cs.LG

AI总结 提出ScaleSweep方法,通过扫描可行块尺度候选并选择最小化目标函数的候选,优化NVFP4量化中的尺度初始化,理论推导扫描范围边界,在Llama和Qwen模型上提升量化性能,缩小与全精度的差距。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12239 2026-08-13 cs.CV cs.AI cs.MM 新提交 84%

HAMP-LIC: Hessian-Aware Mixed-Precision Post-Training Quantization for Learned Image Compression

HAMP-LIC:面向学习型图像压缩的 Hessian 感知混合精度后训练量化

Yuefeng Zhang

机构 * Beijing Institute of Computer Technology and Application(北京计算机技术及应用研究所) School of Elite Engineering, Northwestern Polytechnical University(西北工业大学精英工程学院)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.AI

AI总结 本文针对学习型图像压缩模型低比特部署的效率与精度问题,提出带四阶段优化的 HAMP-LIC 框架,实现最高4.85倍模型压缩且仅0.59%率失真损失,性能优于现有方法并消除跨平台编解码误差。

Comments Learned image compression, post-training quantization, mixed-precision quantization, Hessian-based sensitivity analysis, model compression

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20492 2026-08-24 cs.CV 新提交 83%

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

以标注为回滚:面向视频多模态大语言模型的高效可扩展强化学习

Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

机构 * Nankai University(南开大学) Northwestern Polytechnical University(西北工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) NKIARI

专题命中 效率与部署 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出OraRL算法,将标注作为神谕回滚解耦优势估计,实现高效可扩展的视频MLLM强化学习,在多项视频感知基准上超越现有模型,解码速度大幅提升。

Comments Project page: this https URL (https://orarl.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20169 2026-08-21 cs.CL cs.AI cs.LG 新提交 83%

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection

Task-CoEvolve:通过自适应验证任务选择实现高效的智能体框架优化

Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Task-CoEvolve通过自适应验证任务选择,使LLM智能体框架与验证任务协同演化,在保持全集搜索最终性能的同时,减少80%评估次数,实现高效的智能体框架优化。

Comments Github: https://github.com/Agent4Science-UTokyo/Task-CoEvolve

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11121 2026-08-12 stat.OT stat.ME 新提交 83%

Generative AI use in Statistical Research: A Literature Review and Code Generation Case Study

生成式AI在统计研究中的应用:文献综述与代码生成案例研究

Natalie Morosin, Adel Ahmadi Nadi, Michael P. Wallace

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过案例研究分析了ChatGPT-5和ScholarAI在统计研究的文献综述与代码生成中的应用,发现其需专业人员提示监督,可作为研究工具但无法替代专业方法论知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02512 2026-07-03 cs.LG cs.AI cs.CL 新提交 83%

Program-as-Weights: A Programming Paradigm for Fuzzy Functions

程序即权重:一种模糊函数的编程范式

Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng

机构 * University of Waterloo(滑铁卢大学) Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)

AI总结 提出模糊函数编程范式,通过Program-as-Weights方法将自然语言规范编译为轻量可执行神经工件,在保持性能的同时大幅降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23280 2026-06-23 cs.RO 新提交 83%

Causal Reward World Models: Zero-shot Reward Design for Automated Skill Generation

因果奖励世界模型:面向自动化技能生成的零样本奖励设计

Yang Yang, Yuchuang Tong, Zhengtao Zhang, Xu Ding, Ning Yang, Yifan Zhang, Haipeng Li, Kehu Yang, Miao Xin

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Intelligent Manufacturing Institute, HFUT(合肥工业大学智能制造研究院) School of Electrical Engineering and Automation, Anhui University(安徽大学电气工程与自动化学院) School of Artificial Intelligence, China University of Mining and Technology (Beijing)(中国矿业大学(北京)人工智能学院) National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能全国重点实验室)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出因果奖励世界模型(CRWM),通过离线预训练学习候选奖励组件与任务目标物理变量间的因果拓扑关系,结合显式机制解耦与置信感知软融合的联合优化模块构建因果骨架,使LLM在零样本下生成可执行奖励函数,无需反馈迭代,显著降低新技能设计延迟并保持或超越现有性能。

Comments 22 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15007 2026-06-16 cs.CL cs.AI cs.LG 新提交 83%

Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning

Nemotron 3 Ultra: 开放、高效的混合专家Mamba-Transformer模型用于智能体推理

NVIDIA, :, Aaron Blakeman, Aaron Thomas, Aastha Jhunjhunwala, Abhibha Gupta, Abhinav Khattar, Adam Rajfer, Adi Renduchintala, Adil Asif, Aditya Vavre, Adriana Flores Miranda, Ahmad Bilal, Aileen Zaman, Ajay Hotchandani, Akanksha Shukla, Akhiad Bercovich, Aleksander Ficek, Alex Gronskiy, Alex Kondratenko, Alex Steiner, Alex Ye, Alexander Bukharin, Alexandre Milesi, Ali Taghibakhshi, Alice Gatti, Alisa Liu, Alok Kumar, Amar Phanishayee, Ameya Sunil Mahabaleshwarkar, Amir Klein, Amit Zuker, Amnon Geifman, Anahita Bhiwandiwalla, Ananth Subramaniam, Andrea Santilli, Andrew Fulks, Andrew McHarg, Andrew Tao, Andrii Skliar, Anjulie Agrusa, Ankur Srivastava, Ankur Verma, Anna Shors, Anna Warno, Antoni-Joan Solergibert I Llaquet, Arham Mehta, Arkadiusz Nowaczynski, Arti Jain, Ashwath Aithal, Ashwin Poojary, Asif Ahamed, Asit Mishra, Asma Kuriparambil Thekkumpate, Atefeh Sohrabizadeh, Avinash Kaur, Avinash Vem, Ayush Dattagupta, Barath Subramaniam Anandan, Bardiya Sadeghi, Ben Lanir, Benedikt Schifferer, Besmira Nushi, Bilal Kartal, Bill Thiede, Bita Darvish Rouhani, Bo Deng, Bob Schatz, Boris Ginsburg, Boxin Wang, Brad Nemire, Brandon Norick, Brian Dang, Brian Westphal, Brian Yu, Brucek Khailany, Bryan Catanzaro, Carlo del Mundo, Caryln Aarish, Chankyu Lee, Chantal Hwang, Charbel Sakr, Charles Wang, Charlie Truong, Chen Cui, Cheng Cheng, Cheng-Ping Hsieh, Chenghao Zhang, Chenhui Deng, Chintan Patel, Chris Alexiuk, Christian Cosgrove, Christian Munley, Christine Harvey, Christopher Parisien, Chunyang Shen, Coco Li, Collin Neale, Cynthia Gao, Cyril Meurillon, Dan Gil, Dan Su, Dan Zhao, Dane Corneil, Daniel Afrimi, Daniel Egert, Daniel Korzekwa, Daniel Lo, Daniel Machlab, Daniel Serebrenik, Daniil Sorokin, Daria Gitman, Daria Levy, Darko Stosic, David Mosallanezhad, David Yu, Davit Karamyan, Deena Donia, Deep Debroy, Deepak Narayanan, Devin O'Kelly, Dheeraj Peri, Dhruv Nathawani, Di, Wu, Dima Rekesh, Divyanshu Kakwani, Donald Plummer, Dong Anh, Dongfeng Yu, Dongfu Jiang, Donnie Kim, Dorrin Poorkay, Duncan Riach, Dusan Stosic, Dustin VanStee, Eavan Meng, Edgar Minasyan, Edward Lin, Eileen Margaret Peters Long, Elad Sarafin, Elad Segal, Elena Lantz, Ellie Evans, Elliott Ning, Eric Chung, Eric Harper, Eric Pham-Hung, Eric Tramel, Eric Yang, Erick Galinkin, Erik Pounds, Erika Goncalves Goncalves, Evan Briones, Evan Wu, Evelina Bakhturina, Evgeny Tsykunov, Ewa Dobrowolska, Faisal Ladhak, Farzan Memarian, Fay Wang, Fei Jia, Felipe Soares, Felipe Vieira Frujeri, Feng Chen, Fengguang Lin, Ferenc Galko, Frank Sun, Frankie Siino, Frida Hou, Gal Hubara Agam, Gal Kaplun, Gantavya Bhatt, Gargi Prasad, Garvit Kulshreshtha, George Armstrong, Gerald Shen, Giulio Borghesi, Gordana Neskovic, Gorkem Batmaz, Grace Lam, Greg Mason, Greg Pauloski, Grigor Nalbandyan, Grzegorz Chlebus, Grzegorz Karch, Guan-Ting Liu, Guoming Zhang, Guyue Huang, Haggai Maron, Haifeng Qian, Haim Elisha, Haoxing Ren, Haran Kumar Shiv Kumar, Haribhau Hud, Harris Nover, Harrison Saturley Hall, Hayate Iso, Helen Ngo, Herbert Hum, Herman Sahota, Hexin Wang, Himanshu Soni, Hovhannes Tamoyan, Hua Li, Huanhuan Chen, Hui Li, Hui Wang, Huy Nguyen, Ian Chiles, Ido Galil, Ido Shahaf, Igor Gitman, Igor Shovkun, Ilya Loshchilov, Ingo Guehring, Itamar Schen, Itay Levy, Itay Neeman, Ivan Moshkov, Izik Golan, Izzy Putterman, Jaemin Choi, Jakub Slowikowski, Jan Kautz, Jane Polak Scowcroft, Jared Casper, Jatin Mitra, Jeffrey Glick, Jenny Chen, Jesse Oliver, Jiacheng Xu, Jiafan Zhu, Jialin Song, Jian Zhang, Jiantao Jiao, Jiaqi Zeng, Jie Lou, Jim King, Jimmy Zhang, Jingquan Wang, Jinhang Choi, Jinju Chu, Joey Conway, Joey Guman, Johan Jatko, Johannes Rausch, John Kamalu, John Roberts, Johnny Greco, Johnny Mensel, Jonah Alben, Jonas Yang, Jonathan Cohen, Jonathan Raiman, Joseph Jennings, Joshua Mabry, Joshua Pierce, Joyjit Daw, Julien Veron Vialard, Junkeun Yi, Jupinder Parmar, Kajal Jain, Kan Zhu, Kari Briski, Katherine Cheung, Katherine Luna, Keith Willowhawk, Keith Wyss, Keshav Santhanam, Kevin Shih, Kezhi Kong, Khanh Nguyen, Khushi Bhardwaj, Kirthi Shankar Sivamani, Konstantinos Krommydas, Krishna C. Puvvada, Krzysztof Pawelec, Kumar Anik, Kyle Keprios, Kylie Day, Lawrence McAfee, Leo Du, Leon Derczynski, Li Ding, Linda Liu, Lingjie Wu, Lior Kadoch, Lizzie Wei, Luis Vega, Luke Robison, Lun Su, Maarten Van Segbroeck, Maciej Jakub Mikulski, Maer Rodrigues de Melo, Magda Sypula, Mahan Fathi, Makesh Narsimhan Sreedhar, Makesh Tarun Chandran, Manoj Kilaru, Maor Ashkenazi, Marc Cuevas, Marc Romeijn, Marcin Chochowski, Mark Cai, Mark Mozolewski, Markus Kliegl, Marta Stepniewska-Dziubinska, Martyna Patelka, Mattei Machczynski, Matvei Novikov, Mauricio Ferrato, Maximilian Golub, Mehrzad Samadi, Melissa Corpuz, Mengru Wang, Mengxi Wu, Meredith Price, Meriem Boubdir, Micah Schaffer, Michael Andersch, Michael Boone, Michael Gschwind, Michael Lightstone, Michael Loh, Michal Bien, Michal Zawalski, Michelle Gill, Miguel Martinez, Mikail Khona, Mike Chrzanowski, Mike Houston, Mingyuan Ma, Minseok Lee, Mohamed Fawzy, Mohammad Dabbah, Mohammad Shoeybi, Mostofa Patwary, Nabin Mulepati, Najeeb Nabwani, Namit Dhameja, Narimane Hennouni, Natalie Hereth, Nathaniel Pinckney, Nave Algarici, Nave Assaf, Netanel Haber, Nicholas Knight, Nick Reamaroon, Nickson Quak, Nidhi Bhatia, Nikhil Desai, Nikolai Ludwig, Nima Tajbakhsh, Ning Xu, Nir Ailon, Nirmal Juluru, Nitin Nitin, Ofri Masad, Oleg Rybakov, Oleksii Hrinchuk, Oleksii Kuchaiev, Olivia Viessmann, Olivier Delalleau, Oluwatobi Olabiyi, Omer Ullman Argov, Omri Puny, Oren Tropp, Pablo Ribalta, Pallab Bhattacharya, Panos Lampropoulos, Parth Mannan, Pasha Shamis, Patrick Legresley, Paul Gibbons, Pavlo Molchanov, Pawel Morkisz, Peter Dykas, Peter Jin, Pierre-Yves Aquilanti, Pinky Xu, Piotr Januszewski, Piotr Laskiewicz, Pooya Jannaty, Prakash Gurumurthy, Pranav Prashant Thombre, Prasoon Varshney, Pritam Gundecha, Przemek Tredak, Puhui Meng, Qiyu Wan, Rabeeh Karimi Mahabadi, Rachel Oberman, Rachit Garg, Radha Sri-Tharan, Rahul Kandu, Rakshit Sanadhya, Ran El-Yaniv, Ran Zilberstein, Rasoul Shafipour, Ray Macalisang, Rayen Tian, Reka Kovacs, Renjie Pi, Rick Izzo, Rima Shahbazyan, Rishabh Garg, Rishi Puri, Rita Fernandes Neves, Ritchie Zhao, Ritika Borkar, Ritu Gala, Riyad Islam, Robert Clark, Robert Hesse, Robert Kirby, Roger Waleffe, Rohit Watve, Roi Koren, Ron Banner, Ruoxi Zhang, Russell J. Hewett, Ryan Prenger, Ryan Stewart, Ryota Egashira, Sadegh Mahdavi, Saee Paliwal, Sagar Singh, Sahil Modi, Salika Dave, Samantha Shinagawa, Samuel Kriman, Sandip Bhaskar, Sangkug Lym, Sanjay Kariyappa, Sanjeev Satheesh, Saran Vikas Murari, Satish Pasumarthi, Saurabh Mishra, Saurav Muralidharan, Scott Hara, Sean Narentharen, Selvaraj Anandaraj, Seonjin Na, Seonmeyong Bak, Seonmyeong Bak, Sepehr Sameni, Seph Mard, Serge Panev, Seth Henneman, Seth Poulos, Shahar Mor, Shantanu Acharya, Shaona Ghosh, Sharath Turuvekere Sreenivas, Sharon Mendelson, Shaun Kotek, Shawn Wang, Shay Aharon, Shaya Gharghabi, Sheng-Chieh Lin, Shi Chen, Shiqing Fan, Shirish Baskaran, Shreya Gopa, Shrimai Prabhumoye, Shubham Pachori, Shubham Toshniwal, Shuoyang Ding, Shwetha Krishnamurthy, Siddharth Singh, Simeng Sun, Sirshak Das, Sivakumar Arayandi Thottakara, Smita Ithape, Somshubra Majumdar, Soumye Singhal, Sri Harsha Singudasu, Sridhar Bhuvanapalli, Srimukh Veccham, Stas Sergienko, Stefania Alborghetti, Stephen Ge, Su Rong, Sugam Dipak Devare, Sukrit Rao, Sumeet Kumar Barua, Sungsoo Ha, Sunny Gai, Suriya Gunasekar, Suseella Panguluri, Suyog Gupta, Sviataslau Hinzburh, Sweta Priyadarshi, Syeda Nahida Akter, Talor Abramovich, Tan Bui, Tanay Varshney, Tatevik Ter-Hovhannisyan, Teodor-Dumitru Ene, Terry Kong, Thanh Do, Tianhe Zhang, Tiffany Moore, Tijmen Blankevoort, Tim Moon, Tiyasa Mitra, Tom Balough, Tomasz Grzegorzek, Tomasz Hliwiak, Tomer Asida, Tomer Bar Natan, Tomer Keren, Tomer Ronen, Tony Salim, Tony Wang, Traian Rebedea, Tugrul Konuk, Twinkle Vashishth, Udi Karpas, Ushnish De, Vahid Noorozi, Venkat Srinivasan, Venmugil Elango, Vibhor Agrawal, Victor Cui, Vijay Korthikanti, Vikas Mehta, Vinay Rao, Virginia Wu, Vitaly Kurin, Vitaly Lavrukhin, Vladimir Anisimov, Vu Pham, Wanli Jiang, Wasi Uddin Ahmad, Wataru Ishihara, Wei Du, Wei Ping, Weiheng Chai, Wenliang Dai, Wesley Helmholz, Will Jennings, Will Zhu, Wojciech Prazuch, Xiaowei Ren, Xiwen Yu, Yan Breek, Yang Chen, Yang Yu, Yangyi Chen, Yaniv Galron, Yashaswi Karnati, Yejin Choi, Yev Meyer, Yi-Fu Wu, Yian Zhang, Ying Lin, Yonatan Geifman, Yonggan Fu, Youngeun Kwon, Yu Yao, Yugi Guvvla, Yuki Huang, Yunsheng Liu, Zach Moshe, Zachary Newell, Zhilin Wang, Zhiyu Li, Zhongbo Zhu, Zhuolin Yang, Zihan Liu, Zijie Yan, Zsolt-Alon Wertheimer

机构 * NVIDIA(英伟达)

专题命中 效率与部署 :SFT(abstract,abstract_cn);LLM(abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出550B总参数量、55B激活参数的混合专家Mamba-Attention语言模型Nemotron 3 Ultra,通过20T tokens预训练、1M上下文扩展及后训练,在推理吞吐量提升约6倍的同时保持与顶尖模型相当的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12342 2026-06-11 cs.CL cs.AI cs.ET cs.LG 新提交 83%

ALIGNBEAM : Inference-Time Alignment Transfer via Cross-Vocabulary Logit Mixing

ALIGNBEAM: 通过跨词汇表logit混合实现推理时对齐迁移

Chirag Chawla, Pratinav Seth, Vinay Kumar Sankarapu

机构 * Lexsi Labs

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对领域微调降低大模型安全性的问题,提出无需训练的ALIGNBEAM方法,通过逐token翻译锚模型logit并选择最安全候选,实现跨词汇表的安全对齐迁移,保持任务准确性和推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11680 2026-06-11 cs.AI cs.CL cs.LG 新提交 83%

Organize then Retrieve: Hierarchical Memory Navigation for Efficient Agents

先组织再检索:面向高效智能体的层次化记忆导航

Hao-Lun Hsu, Nikki Lijing Kuang, Boyi Liu, Zhewei Yao, Yuxiong He

机构 * Duke University(杜克大学) Snowflake AI Research(Snowflake AI研究)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HORMA框架,通过构建文件系统式的层次化记忆结构并利用强化学习训练的轻量级导航代理,实现高效检索,在长时任务中提升性能并降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15225 2026-06-16 cs.LG cs.AI cs.IR 新提交 83%

Edu-Theater: A Data-Efficient Agent Framework for Scalable Learner Behavior Simulation through Staging Roll-Call

Edu-Theater: 一种通过点名排演实现可扩展学习者行为模拟的数据高效智能体框架

Weibo Gao, Qi Liu, Linan Yue, Zheng Zhang, Yichao Du, Fangzhou Yao, Ao Yu, Zhenya Huang, Shijin Wang

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) Southeast University(东南大学) Alibaba Group(阿里巴巴集团) iFLYTEK Co., Ltd.(科大讯飞股份有限公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出Edu-Theater框架,通过构建群体水平能力先验和少量诊断查询,利用LLM智能体模拟学习者行为,在减少数据需求的同时提高模拟精度,并增强下游自适应测试等应用。

Comments LLM Agent, Educational Data Mining, Data Synthesis, Human Simulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19889 2026-08-21 cs.AI cs.PL 新提交 83%

Write Once, Run Everywhere: The Axon DSL for Shape-Safe and Framework-Agnostic LLM Architectures

一次编写,随处运行:用于形状安全且框架无关的大语言模型架构的Axon领域特定语言

Jacob Nielsen, Danial Namazifard, Lukas Galke Poech, Peter Schneider-Kamp

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型架构的可移植性与效率瓶颈,提出强类型领域特定语言Axon,可编译为多框架实现,在467项基准测试中实现显著加速,突破部署锁定问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18982 2026-08-20 cs.LG q-bio.BM q-bio.QM 新提交 83%

Monroe: A Molecular Foundation Model for In-Context Probabilistic Inference

Monroe:用于上下文概率推理的分子基础模型

Blazej Banaszewski, Andrew W. Fitzgibbon

机构 * Graphcore(格弗科(Graphcore)) Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出新的分子基础模型Monroe,通过多方面创新提升性能,在多个基准测试中表现优异,且其下游适应策略可推广至其他模型。

Comments Preprint; Open source weights and code

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18849 2026-08-20 cs.LG stat.ME stat.ML 新提交 83%

GEAR: Generative Expansion and Real Anchoring for Two-Stage Distillation of Tabular Foundation Models

GEAR:面向表格基础模型两阶段蒸馏的生成式扩展与真实锚定

Qi Qin, Jiajie Zhu, Dali Chen, Yuzhao Zhang, Jia-Xing Han, Yu Su, Peng Zhang, Ying Yan, Yifan Sun

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 GEAR是一种两阶段蒸馏框架,可将表格基础模型蒸馏为轻量级预测器,在TALENT和TabArena上的实验显示其能显著降低推理开销并提升AUC,性能优于多种基准模型。

Comments 9 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15614 2026-08-18 cs.CV cs.AI 新提交 83%

EgoGazeLite: On-Device Egocentric Gaze Prediction for Token-Efficient Multimodal LLM Video Input

EgoGazeLite:面向 token 高效多模态大语言模型视频输入的设备内自我中心注视预测

Matteo Stoiber, Niels Buus Lassen

机构 * Copenhagen Business School(哥本哈根商学院)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 EgoGazeLite 是轻量双进程注视预测器,可在消费级硬件上实时运行,无需眼动追踪硬件即可实现 token 高效的自我中心视频理解,性能与真实注视裁剪无显著差异。

Comments 16 pages. Accepted at the WearableAI Workshop, ECCV 2026 (Archival Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08528 2026-08-11 cs.LG 新提交 83%

Task-to-Model Optimization for Enterprise LLM Coding Assistants: A Data-Driven Framework for Cost-Optimal Routing

面向企业大语言模型代码助手的任务到模型优化:一种成本最优路由的数据驱动框架

Srinivasan Manoharan, Junhua Zhao, Fangbo Tu, Haifeng Wu, Jian Wan, Maliah Rajan M, Ashwin Hegde, Mithun Sasidharan, Kalyan Chakravarthi Podamekala

机构 * PayPal(贝宝(PayPal))

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG

AI总结 本研究针对企业LLM代码助手的推理成本问题,提出T2MO数据驱动框架,通过任务分级与两级路由机制实现成本最优,可降低端到端成本并支持从静态策略到智能路由器的过渡。

Comments 11 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06763 2026-08-10 cs.LG cs.DC 新提交 83%

CubicQuant: Parametric Non-Uniform Codebooks for High-Throughput LLM Inference with 1-8-Bit Weights

CubicQuant:用于1-8比特权重的高吞吐量大语言模型推理的参数化非均匀码本

Xuetian Gao

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.LG

AI总结 研究针对LLM推理的权重量化问题,提出CubicQuant参数化非均匀标量格式,其在不同分布下的重构误差优于现有方案,且具备高效GPU执行潜力。

Comments 23 pages, 1 figure. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06628 2026-08-10 cs.LG 新提交 83%

Retrofitting Linear Attention into Diffusion Language Models

将线性注意力改造融入扩散语言模型

Jinha Kim, Younghun Roh, Jaeyeon Kim

机构 * Apple(苹果公司) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出分块混合注意力,将其融入预训练dLLM LLaDA~2.1得到LLaDA-Hybrid,在保持基准性能的同时提升解码吞吐量与并发请求支持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04390 2026-08-06 cs.CL cs.DB 新提交 83%

EdgeLM: Edge Demonstrations for Language Models' Table Understanding

EdgeLM:面向语言模型表格理解的边缘演示

Soroush Omidvartehrani, Mohammadamin Habibollah, Mohammadreza Daviran, Davood Rafiei

机构 * University of Alberta(阿尔伯塔大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 EdgeLM是一种检索框架,通过选择数据边缘和模型边缘两种互补的边缘证据,在五个数据整理任务、十五个数据集及五种LLMs上,始终取得最佳或接近最佳的表格理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏