arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2145 篇

2606.17368 2026-06-17 cs.AI cs.NI 新提交 70%

Distributed General-Purpose Agent Networks: Architecture, Key Mechanisms, and Prototypes

分布式通用智能体网络:架构、关键机制与原型

Shengli Zhang, Deen Ma, Zibin Lin, Taotao Wang

机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出分布式通用智能体网络架构,通过协议适配层连接上层任务语义与底层网络操作,解决语义公告传播、可信身份与多主题声誉、语义梯度机制设计三大核心问题,实现开放可信的智能体协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17029 2026-06-16 cs.CL 新提交 70%

DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research Agents

DEEPRUBRIC: 基于证据树规则监督的高效深度研究智能体强化学习

Minghang Zhu, Chuyang Wei, Junhao Xu, Yilin Cheng, Zhumin Chen, Jiyan He

机构 * Shandong University(山东大学) Zhongguancun Academy(中关村学院) Fudan University(复旦大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出DeepRubric框架,通过构建证据树生成查询-规则对,确保奖励信号准确评估查询所需信息,以13倍少的RL GPU时间达到与先前最优模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16652 2026-06-16 cs.CY cs.AI cs.SI 新提交 70%

Optimising Temporary Accommodation Placement Across London with AI-Powered SaaS in E-Governance Systems

利用AI驱动的SaaS优化伦敦临时住所安置:电子政务系统中的应用

Hankun He, Jordan Richards, Gopalakrishnan Netuveli, Kumar Aniket, Ramya Pachatcharam, Binta Ade-olusile, Nathan Nagaiah, Matthew I Bellgard

机构 * UK Centre for AI in the Public Sector(英国公共部门人工智能中心) Institute for Connected Communities(连接社区研究所) University of East London(东伦敦大学) London Borough of Newham(伦敦新ham区)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文介绍DOMUS系统,一个基于云的AI决策支持系统,通过规则过滤与大语言模型搜索结合,优化伦敦纽汉姆区的临时住所安置,显著减少搜索时间并提高合规性。

Comments 13 pages, 4 figures, to be published in International Conference on AI and Sustainability Advances 2026 Companion Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16527 2026-06-16 cs.CR cs.CL 新提交 70%

DoubtProbe: Black-Box Jailbreak Defense via Structural Verification and Semantic Auditing

DoubtProbe:通过结构验证与语义审计的黑盒越狱防御

Xuanyu Yin, Yilin Jiang, Jun Zhou, Kai Chen, Zhengfu Cao, Xiaolei Dong

机构 * East China Normal University(东华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出DoubtProbe双分支推理时防御框架,结合结构验证与语义审计,将黑盒越狱防御转化为受控变换下的一致性检查,在多个基准上实现更强更稳定的防御-效用权衡。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16384 2026-06-16 cs.LG 新提交 70%

Mixtures of Subspaces for Bandwidth Efficient Context Parallel Training

子空间混合:面向带宽高效上下文并行训练

Sameera Ramasinghe, Ajanthan Thalaiyasingam, Hadi Mohaghegh Dolatabadi, Gil Avraham, Violetta Shevchenko, Yan Zuo, Chamin Hewa Koneputugodage, Alexander Long

机构 * Pluralis Research

专题命中 效率与部署 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出一种基于子空间混合的压缩方法,在低带宽分布式训练中实现超过95%的通信压缩,支持百亿参数模型在100K上下文长度下高效训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16190 2026-06-16 cs.AR cs.AI 新提交 70%

Embedded Arena: Iterative Optimization via Hardware Feedback

嵌入式竞技场:通过硬件反馈的迭代优化

Zhihan Zhang, Alexander Le Metzger, Jiuyang Lyu, Chun-Cheng Chang, Jiayi Shao, Yujia Liu, Emmanuel Azuh Mensah, Edward Wang, Kurtis Heimerl, Gregory D. Abowd, Shwetak Patel, Natasha Jaques, Vikram Iyer

机构 * University of Washington(华盛顿大学) University of California San Diego(加州大学圣地亚哥分校) Northeastern University(东北大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出硬件在环智能体框架,通过迭代编译、烧录和测量真实硬件,实现模型与固件的闭环优化,在嵌入式设备上达到250倍压缩且精度损失<3.3%。

Comments Code: https://github.com/ubicomplab/embedded-arena

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16158 2026-06-16 cs.CV cs.CL 新提交 70%

Focus When Necessary: Adaptive Routing and Collaborative Grounding for Training-Free Visual Grounding

必要时聚焦:用于无训练视觉定位的自适应路由与协作定位

Yifan Wang, Peiming Li, Shiyu Li, Zhiyuan Hu, Xiaochen Yang, Wenming Yang, Yang Tang, Zheng Wei

机构 * East China University of Science and Technology(华东理工大学) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LazyMCoT动态框架,通过自适应路由评估不确定性,对简单查询跳过处理,对困难样本利用协作定位模块进行两阶段精炼,在提升推理精度的同时降低平均推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15768 2026-06-16 cs.RO cs.AI 新提交 70%

LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies

LaWAM: 用于高效动力学感知机器人策略的潜在世界行动模型

Jialei Chen, Kai Wang, Kang Chen, Shuaihang Chen, Feng Gao, Wenhao Tang, Zhiyuan Li, Weilin Liu, Zhuyu Yao, Boxun Li, Yuanbo Xu, Chao Yu

机构 * Tsinghua University(清华大学) Jilin University(吉林大学) Nankai University(南开大学) Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学) Zhongguancun Academy(中关村学院) Striding.AI Infinigence AI

专题命中 效率与部署 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 提出LaWAM模型,通过潜在视觉子目标预测场景变化,实现动力学感知的机器人控制,在多个基准上达到最优或竞争性成功率,且推理延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15517 2026-06-16 cs.CL 新提交 70%

SHARD: Safe and Helpful Alignment via Self-Reframing Distillation

SHARD: 通过自我重构蒸馏实现安全且有益的校准

Viswonathan Manoranjan, Amogh Gupta, Anvesh Rao Vijjini, Thomas Hofweber, Snigdha Chaturvedi

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SHARD方法,通过哲学准则重构敏感提示以暴露良性意图,并自我重构响应,在保持安全性的同时提升帮助性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15363 2026-06-16 cs.AI 新提交 70%

APEX: Adaptive Principle EXtraction A Three-Layer Self-Evolution Framework for Production AI Agents

APEX: 自适应原则提取——面向生产AI智能体的三层自进化框架

Ya-Chuan Chen, Tien-Jen Lai, Hsiang-Wei Hu

机构 * Grace AI Technology

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出APEX框架,通过三层协同进化(提示修复、原则蒸馏、工作流拓扑选择)提升AI智能体性能,在15节点计算集群上实现健康评分+90%。

Comments 8 pages, 1 figure, 4 tables. Evaluated on a production 15-node compute fleet with 114 real task traces. Code available at https://aispark.airlive.com/joe-hackathon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15179 2026-06-16 cs.AI 新提交 70%

CONCORD: Asynchronous Sparse Aggregation for Device-Cloud RAG under Document Isolation

CONCORD: 文档隔离下设备-云RAG的异步稀疏聚合

Xuedong Hu, Zhiqing Tang, Zhi Yao, Tian Wang, Weijia Jia

机构 * Beijing Normal University(北京师范大学) BNU-HKBU United International College(北师港浸大联合国际学院) University of Macau(澳门大学) Shenzhen Research Institute of Big Data(深圳市大数据研究院) Guangdong Key Laboratory of Artificial Intelligence and Multi-Modal Data Processing(广东省人工智能与多模态数据处理重点实验室)

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.AI

AI总结 针对文档隔离的双端RAG中频繁同步和密集证据传输导致的吞吐量低问题,提出异步稀疏聚合框架CONCORD,通过等待债务控制和证书引导最小补充机制,在保持答案质量的同时大幅提升吞吐量并降低通信量。

Comments to be published in IEEE ICWS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14875 2026-06-16 cs.CL 新提交 70%

Context Compression Is Not One Thing: Readable Symbolic Re-expression vs. Coherent Summary at Matched Budget

上下文压缩并非单一事物:在匹配预算下可读的符号化重新表达与连贯摘要的比较

Sisong Bei, Mikhail L. Arbuzov, Ziwei Dong, Dmitri Kalaev, Alexey Shvets

机构 * Independent Researcher(独立研究员) Palo Alto Networks

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 提出Telegraph English可读符号格式,将检索段落重写为结构化实体关系陈述,在匹配预算下比三种压缩基线及连贯摘要更有效,F1提升13-20个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14786 2026-06-16 cs.MM cs.AI cs.CV 新提交 70%

MatchLM2Lite: A Scalable MLLM-to-Lite Framework for Reproduced Content Identification

MatchLM2Lite: 一种可扩展的MLLM-to-Lite框架用于重复内容识别

Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Zirui Zhu, Kanchan Sarkar, Kun Xu

机构 * Tiktok(字节跳动) National University of Singapore School of Computing(新加坡国立大学计算机学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MatchLM2Lite框架,通过将多模态大语言模型蒸馏为轻量模型,实现视频、音频和文本联合建模的实时重复内容识别,在降低35倍计算成本的同时保持高准确率,并成功部署于大规模生产环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14327 2026-06-15 cs.SE cs.AI cs.ET 新提交 70%

I'm Sorry Driver, I'm Afraid I Can't Do That: Appraising the Safety of LLMs within Automotive Contexts

抱歉,司机,恐怕我不能这么做:评估LLMs在汽车环境中的安全性

Shaun Feakins, Ibrahim Habli, Kim Littler, Robert Palin

机构 * UKRI AI Centre for Doctoral Training in Safe Artificial Intelligence Systems (SAINTS)(英国研究理事会安全人工智能系统博士培训中心(SAINTS)) University of York(约克大学) Jaguar Land Rover(捷克·陆罗恩)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文从安全保证角度评估了将LLMs集成到汽车控制任务中的现有框架,指出其面临概念和具体挑战,并通过案例研究提出未来保障机制。

Comments Accepted at the Dependable AI in Embedded Systems (DAIES) Workshop at SAFECOMP 2026; 15 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13426 2026-06-12 cs.LG stat.ML 新提交 70%

Accelerating Speculative Diffusions via Block Verification

通过块验证加速推测性扩散

Alexander Soen, Hisham Husain, Valentin De Bortoli, Arnaud Doucet

机构 * KTH(皇家理工学院) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出一种针对扩散模型的推测性采样方案,通过块验证提高草稿接受率,无需训练的Free Drafter实现高达6.3%的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13262 2026-06-12 cs.AI 新提交 70%

From Verdict to Process: Agentic Reinforcement Learning for Multi-Stage Fact Verification

从判决到过程:面向多阶段事实核查的智能体强化学习

Rongxin Yang, Shenghong He, Siyuan Zhu, Chao Yu

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ProFact框架,通过智能体强化学习端到端优化多阶段事实核查流程,引入过程感知奖励解决稀疏延迟监督问题,提升验证性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13241 2026-06-12 cs.AI 新提交 70%

Brick: Spatial Capability Routing for the Mixture-of-Models (MoM) Paradigm

Brick: 面向混合模型范式的空间能力路由

Francesco Massa, Marco Cristofanilli

机构 * Regolo AI Seeweb

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Brick多模态路由器,通过六维能力评分与查询难度估计,结合成本惩罚几何规则调度模型,在质量与成本间实现灵活权衡。

Comments 17 pages, 5 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12917 2026-06-12 cs.LG 新提交 70%

Where Computation Lives Inside TabPFN: Causal Localisation of Attention Head Function

计算在 TabPFN 中的位置:注意力头功能的因果定位

Atharva Gupta, Dhruv Kumar, Murari Mandal, Saurabh Deshpande

机构 * Department of Computer Science, Birla Institute of Technology(比拉理工学院计算机科学系) School of Computer Engineering, Kalinga Institute of Industrial Technology(凯林加工业技术学院计算机工程系) Birla AI Labs, Office of Ananya Birla, Aditya Birla Group(比拉人工智能实验室,阿尼娅·比拉办公室,阿迪塔亚比拉集团)

专题命中 效率与部署 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 通过激活修补、消融和注意力熵分析,发现 TabPFN 2.5 中一个注意力头在峰值层的因果必要性比其他头高2-5倍,且其主导层随任务复杂度变化,其余头呈现对称的后期层轮廓。

Comments Accepted to Workshop FMSD @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12429 2026-06-12 cs.CY cs.AI 新提交 70%

Muse Spark Safety & Preparedness Report

Muse Spark 安全与准备报告

Cristina Menghini, Peter Ney, Hamza Kwisaba, Zifan, Wang, Miles Turpin, Felix Binder, Jean-Christophe Testud, Aidan Boyd, Nathaniel Li, Ivan Evtimov, Klaudia Krawiecka, Arman Zharmagambetov, Jeremy Kritz, Alexander R. Fabbri, Daniel Song, Jinpeng Miao, Joonas Hjelt, Meghna Ramani, Leona Lan, Reza Aghajani, Joanna Bitton, Mahesh Pasupuleti, Devin Norder, Khalid El-Arini, Paridhi Singh, Vítor Albiero, Sahana CB, Rashnil Chaturvedi, Elahe Dabir, Edoardo Debenedetti, Jim Gust, Ziwen Han, Kat He, Sean Hendryx, Lifeng Jin, Polina Kirichenko, Sandra Lefdal, Kenneth Li, Asad Liaqat, Inna Lin, Despoina Magka, Neal Mangaokar, Ishita Mediratta, Zach Miller, Smitha Milli, Niloofar Mireshghallah, Saba Nazir, Hung Nguyen, Maximilian Nickel, Kelvin Niu, Kerem Oktar, Bhargavi Paranjape, Parth Pathak, Maya Pavlova, Emmanuel Ramirez, David Renardy, Candace Ross, Yasha Sheynin, Claudia Shi, Shivam Singhal, Evangelia Spiliopoulou, Rakshith Sharma Srinivasa, Jamelle Watson-Daniels, Spencer Whitman, Adina Williams, Chen Xing, Andy Zou, Tommy Ma, Siqi Deng, James Beldock, Prashant Ratanchandani, Kate Plawiak, Taesung Lee, Ryan Victory, Lindsay Hundley, Rachad Alao, Himaghna Bhattacharjee, Jianfeng Chi, Gary Frost, Pegah Ghahremani, Niki Howe, Yuheng Huang, Saeed Jahed, Hannah Korevaar, Trang Le, Zhe Liu, Jinghong Luo, Qin Lyu, Nina Mehrabi, Abraham Montilla, Chirag Nagpal, Cyrus Nikolaidis, Rajvardhan Oak, Manoj Ravi, Vidya Sarma, Aman Shankar, Alana Shine, Eric Michael Smith, Mariana Tandon, Michael Tontchev, Caoyu Wang, Zihan Wang, Corinne Wong, Zheng Wu, Hongyuan Zhan, Justin Zhao, Zexuan Zhong, Chengxu Zhuang, Tristan Goodman, Ayaz Minhas, Harrison Rudolph, Victoria Jeffries, Ingrid Dickinson, Alex Vaughan, Lauren Deason, Kamalika Chaudhuri, Julian Michael, Shengjia Zhao, Summer Yue

机构 * Muse Spark

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Meta 发布 Muse Spark 大语言模型,评估其在化学/生物、网络安全和失控风险等灾难性风险领域的安全性,通过多层缓解措施将风险降至可接受水平,并作为 Meta AI 的基础模型发布。

Comments 159 pages, 57 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10423 2026-06-10 cs.CL 新提交 70%

WebChallenger: A Reliable and Efficient Generalist Web Agent

WebChallenger: 一个可靠且高效的通用型Web智能体

Jayoo Hwang, Xiaowen Zhang, Vedant Padwal

机构 * ML Collective longsurf.ai Independent(独立研究者)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出WebChallenger框架,通过PageMem结构化页面表示、分治观察、轻量探索记忆和复合动作工作流,复现人类认知优势,使开源模型在多个Web导航基准上接近前沿专有系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10334 2026-06-10 cs.AI 新提交 70%

Self-Distillation Policy Optimization via Visual Feedback: Bridging Code and Visual Artifacts

通过视觉反馈的自蒸馏策略优化:连接代码与视觉工件

Haoyu Dong

机构 * Microsoft(微软)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Visual-SDPO框架,利用渲染视觉反馈作为特权上下文,通过自蒸馏和视觉引导的代码信用加权优化代码生成视觉工件的质量,在图表、UI和幻灯片生成任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10173 2026-06-10 cs.CR cs.AI 新提交 70%

Local Is Not a Sufficient Privacy Boundary: Governing OS-Integrated On-Device AI

本地并非充分的隐私边界:治理操作系统集成的设备端AI

Jonghyun Chung, Sanket Badhe

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :foundation model(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一个以操作系统为中心的隐私框架,将隐私视为制度问责问题而非部署属性,通过威胁模型、六部分隐私风险分类、隐私架构控制和四级审计标准来治理设备端AI。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09885 2026-06-10 cs.LG stat.ML 新提交 70%

TENP: Trapezoidal Expert Neuron Pruning For Mixture-of-Experts

TENP:用于混合专家的梯形专家神经元剪枝

Jiangyang He, Shaolin Zhu, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院 TJUNLP实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出TENP框架,通过识别重要专家并对其余专家进行神经元剪枝,保留梯形参数模式,在40%路由专家稀疏度和平均63.76%激活参数下,DeepSeek模型准确率仅下降1点,代码生成任务提升10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09441 2026-06-09 cs.AI cs.AR 新提交 70%

SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance

SIFT: 利用注意力不变性实现RAG预填充快速计算的索引选择

Rya Sanovar, Srikant Bharadwaj, Hritvik Taneja, Moinuddin Qureshi

机构 * Georgia Institute of Technology(佐治亚理工学院) Microsoft(微软)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对RAG查询中文档重复导致预填充计算冗余和TTFT增加的问题,提出SIFT方法,通过离线提取文档高注意力分数位置并利用注意力不变性,在预填充时仅计算标记位置,将TTFT提升1.71倍且精度损失在1%以内。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08702 2026-06-09 cs.AI 新提交 70%

ConMem: Structured Memory-Guided Adaptation in Training-Free Multi-Agent Systems

ConMem: 无训练多智能体系统中的结构化记忆引导自适应

Zhixun Tan, Qiang Chen, Tairan Huang, Xiu Su, Yi Chen

机构 * Central South University(中南大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出ConMem框架,通过结构化记忆卡片和关系感知记忆图实现多智能体系统的高效自适应,无需额外训练,在多个基准上提升性能并降低推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08295 2026-06-09 cs.CL 新提交 70%

TLRD: Teaching LLMs to Reason over Tabular Data with Tri-Level Rationale Distillation

TLRD: 通过三级理由蒸馏教授LLMs在表格数据上进行推理

Tianyuan Liang, Xuwei Tan, Lei Shi, Junsheng Zhong, Ziyu Hu, Tian Xie, Zhiqun Zuo, Xiaodong Yu, Xueru Zhang

机构 * The Ohio State University(俄亥俄州立大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出TLRD框架,通过三级理由蒸馏将表格数据集转换为结构化理由监督,使LLMs在仅基于原始特征的情况下实现零开销预测和可解释推理,显著缩小与树集成模型的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07000 2026-06-08 cs.AI 新提交 70%

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

教方法而非答案:用于多模态策略优化的特权辅导蒸馏

Shizhe Xiang, Ke An, Wenlong Yu, Yue Liu, Jian Luan, Pei Fu, Qilong Wang

机构 * Tianjin University(天津大学) Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Xiaomi Inc(小米公司)

专题命中 效率与部署 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出PTD-PO框架,通过构建特权提示提供密集的令牌级监督,避免暴露答案,并采用Top-K JS散度稳定蒸馏,显著提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26872 2026-08-28 cs.CV 新提交 67%

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

Self-OPD:无需教师模型的流匹配模型的在线策略蒸馏

Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou, Jinlong Liu, Yunlong Yu, Jian Song, Hao Jiang, Pipei Huang, Bo Zheng

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出Self-OPD,一种无需教师模型的流匹配模型在线策略蒸馏框架,通过分支SDE候选与奖励比较优化速度场,在基准测试中优于现有无教师的RL和OPD方法。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26575 2026-08-28 cs.DC cs.CR 新提交 67%

Benchmarking Confidential Computing Performance on NVIDIA Blackwell GPUs

在NVIDIA Blackwell GPU上对机密计算性能进行基准测试

Daniyal Khan, Amean Asad, Ansgar Grunseid

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文在NVIDIA B200 GPU上结合Intel TDX机密VM与NVIDIA Blackwell GPU的CC技术,测试大语言模型推理/训练在TEE中的性能,得出正确配置下机密推理吞吐量仅增1%-3%等结果并给出部署指南。

Comments 23 pages, 3 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26070 2026-08-27 cs.CL cs.AI cs.LG 新提交 67%

Prefix Sliding for efficient test-time scaling

用于高效测试时缩放的前缀滑动

Niklas Muennighoff, Zhengyang Wang, Zeyi Chen, Weijia Shi, Binyuan Hui, John Yang, Dapeng Jiang, Mika Senghaas, Fares Obeid, Johannes Hagemann, Sami Jaghouar, Ludwig Schmidt, Percy Liang, Jason Wei, Andrew Y. Ng, Luke Zettlemoyer, Yejin Choi, Mike Lewis

机构 * Stanford University(斯坦福大学) University of California at Santa Barbara(加州大学圣巴巴拉分校) Prime Intellect University of Washington(华盛顿大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对测试时推理内存成本过高问题,提出Prefix Sliding方法,通过丢弃非关键标记限制内存,无需训练可提速3倍,结合强化学习训练后性能更优且优于其他基线

Comments 28 pages (9 main), 22 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏