arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-13 至 2026-08-13 共收录 282 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 47 篇

2608.00316 2026-08-13 cs.LG stat.ML 版本更新 70%

Agentic Bayesian Optimization through Surrogate-Augmented Autoresearch

基于代理的贝叶斯优化:通过代理增强的自动研究

Paul Brunzema, Louis Tiao, Nhat Le, Kevin De Angeli, Yao Xuan, Djordje Gligorijevic

机构 * Meta RWTH Aachen University(亚琛工业大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出代理式贝叶斯优化范式,构建Sara代理与lenz后端,在合成及真实基准测试中,其兼具可靠性与性能,还可动态重构优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17154 2026-08-13 cs.NI cs.DC cs.LG 版本更新 70%

OrderMoE: An expert similarity driven distributed edge MoE inference

OrderMoE:一种由专家相似度驱动的分布式边缘混合专家推理

Xin Yuan, Ning Li, Quan Chen, Wenchao Xu, Song Guo

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究在资源受限边缘基础设施部署MoE推理的挑战,提出OrderMoE框架,通过构建专家相似度模型、设计分组部署策略和选择算法,平衡推理延迟等指标,实验表明其能显著降低相关指标,仅带来小的推理质量下降。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17554 2026-08-13 cs.LG stat.ML 版本更新 70%

A Theoretical Framework for Modular Learning of Robust Generative Models

模块化鲁棒生成模型的理论框架

Corinna Cortes, Mehryar Mohri, Yutao Zhong

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出模块化鲁棒生成模型的理论框架,通过门控机制结合预训练专家,理论证明其在数据混合下的稳健性,并通过实验验证其优于整体模型的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11920 2026-08-13 cs.AR 新提交 67%

NITRO: High-Performance 3D NAND Flash-Based In-Storage Computing with Enhanced Activation Dataflow

NITRO:基于3D NAND闪存的高性能存内计算架构,具备增强型激活数据流

Sanghun Shin, Sangyeon Kim, Gisan Ji, Sungju Ryu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 针对NAND-PIM方案中间值数据流/缓冲的局限,提出带增强型激活缓冲的高性能NAND闪存ISC架构,结合分布式数据流方法,使推理延迟最高降低85%。

Comments Extended manuscript of DATE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11512 2026-08-13 cs.CY 新提交 67%

Cheap, Fallible Cognition and the Political Economy of Expertise

廉价、易出错的认知与专业知识的政治经济学

Christophe Kolb, Jim Caron

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文构建基于任务与制度的框架,引入任务脆弱性指数等,分析生成式AI对劳动力市场的影响,指出其命运是制度均衡,而非机械失业或自动充裕。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11775 2026-08-13 cs.AI cs.CL 新提交 62%

The Sleeping Agent: What Gist-Based Context Compression Loses and Why

休眠智能体:基于主旨的上下文压缩会丢失什么以及为什么

Nicholas E. Kyrkewood

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究以SWC为工具,发现主旨压缩对多跳推理等任务表现优于截断,但会损害时间相关问题的性能,通过修改提示可提升时间问题的评判准确率。

Comments 7 pages, 5 tables, appendices. Code and results at https://github.com/kyrkewood/sleeping-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11227 2026-08-13 cs.AI cs.LG 新提交 62%

Forecasting Side Effects of Activation Steering

预测激活引导的副作用

Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang, Jun Sun

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对激活引导易产生意外副作用的问题,构建交叉效应矩阵揭示副作用的系统性与可预测性,为激活引导的安全部署提供支持。

Comments 24 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11605 2026-08-13 cs.AI 新提交 57%

Foresight Without Seeing: Latent Futures for World Action Models

无视觉前瞻:面向世界动作模型的潜在未来

Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI

AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08847 2026-08-13 cs.CL 版本更新 57%

Explicit Boundary Markers for Subword Vocabularies

子词词汇的显式边界标记

Sander Land, Clara Meister

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 该研究提出用显式词边界标记替代标准空格约定,缓解了子词词汇的条目重复问题,虽未提升分词压缩率,但可改善语言建模性能。

Comments Code available at https://github.com/sanderland/script_tok

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12107 2026-08-13 cs.CV 新提交 50%

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

Avatar-Forever:用于高质量实时无限虚拟形象的解耦并行训练

Ruibin Li, Tao Yang, Zhiyuan Ma, Fangzhou Ai, Shilei Wen, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动) AMD(超威半导体公司)

专题命中 效率与部署 :foundation model(abstract)

AI总结 Avatar-Forever是一种解耦并行训练框架,通过双分支设计与ForeverCache机制,在单张H100 GPU上实现27.2 FPS的768x512音频驱动无限虚拟形象生成,保障质量与效率,推进稳定数字人研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11803 2026-08-13 cs.CY 新提交 50%

Silent Updates: Measuring and Closing the Post-Deployment Disclosure Gap

静默更新:测量并弥合部署后的披露差距

Sophia Abraham, Ben Bucknall

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文针对基础模型部署后的静默更新问题,分析了相关披露实践,推出了测量披露情况的评分卡,并提出了触发披露义务的三部分行为触发系统。

Comments Accepted to AIES-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11812 2026-08-13 cond-mat.mtrl-sci physics.comp-ph 新提交 50%

Data-Efficient Adaptation of DPA-4 Force Fields to DFT+U Energetics: A Case Study in NiO

面向DFT+U能量学的DPA-4力场的数据高效适配:以NiO为例

Fengyu Xie, Peiheng Jiang, Zhicheng Zhong

专题命中 效率与部署 :pretraining(abstract)

AI总结 本研究以NiO为案例,通过微调预训练的DPA-4力场,高效修正了源层面的错误相能量学,提出了一种预训练与目标微调结合的多保真度策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00237 2026-08-13 cs.CV cs.RO 版本更新 50%

Latent-Centroid Steering: Single-Pass Classifier-Free Guidance for Command-Aligned Autonomous Driving

隐式质心引导:用于指令对齐自动驾驶的单次无分类器引导

Meibo Hu, Jiamian Wang, Pichao Wang, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) NVIDIA(英伟达公司)

专题命中 效率与部署 :language model(abstract)

AI总结 针对视觉语言自动驾驶模型的指令跟随差距,提出单次引导机制LCS,降低推理延迟约50%,在Bench2Drive和nuScenes基准上提升指令遵循与驾驶性能。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17585 2026-08-13 cs.CV 版本更新 50%

Pixel-Space Diffusion Transformers

像素空间扩散变换器

Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Yimao Cai, Kilian M. Pohl, Guoying Zhao

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学) University of Oulu(奥卢大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文探讨像素空间扩散变换器,针对潜在扩散模型的局限,研究直接对原始像素建模的像素空间扩散方法,介绍其在高维建模中的挑战与多模态建模优势,从多方面回顾pDiTs,总结方法、识别挑战并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25758 2026-08-13 cs.CV 版本更新 50%

Dual Distribution Estimation for Zero-shot Noisy Test-Time Adaptation with VLMs

基于双分布估计的零样本噪声测试时自适应方法

Wenjie Zhu, Yabin Zhang, Liang Xu, Xin Jin, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :language model(abstract)

AI总结 针对噪声测试时自适应中分布外异常值问题,提出双分布估计框架,通过无训练的高斯分布建模实现零样本鲁棒自适应。

Comments Accepted by ECCV2026. Project Page:https://zhuwenjie98.github.io/DDE-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31591 2026-08-13 cs.CV 50%

CoFiDA-M: Concept-Aware Feature Modulation for Cross-Domain Adaptation with Image-Only Inference

CoFiDA-M: 面向仅图像推理的跨域自适应的概念感知特征调制

Nurjahan Sultana, Moi Hoon Yap, Xinqi Fan, Wenqi Lu

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(计算与数学系,曼彻斯特 Metropolitan 大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出CoFiDA-M框架,通过特权信息学习利用临床概念(如MONET概率)指导特征调制,训练仅图像的学生模型,在跨域皮肤癌筛查中显著提升黑色素瘤召回率。

Comments 'Accepted by CVPR 2026'

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 15060-15069

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 18 篇

2509.15122 2026-08-13 cs.CY 版本更新 91%

Prestige over merit: An adapted audit of LLM bias in peer review

声望胜过能力:对同行评审中大型语言模型(LLM)偏差的适应性审计

Anthony Howell, Jieshu Wang, Luyu Du, Julia Melkers, Varshil Shah

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究开发多角色LLM模拟系统,审计发现LLM在同行评审中存在偏差,机构声望是核心影响因素,低声望作者的论文更易被拒,训练数据的领域规范与声望先验是关键成因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11839 2026-08-13 cs.LG 版本更新 91%

Grounding Large Language Models as Generalizable Policies in Network Control

大语言模型作为网络优化的通用策略

Duo Wu, Linjia Kang, Zhimin Wang, Fangxin Wang, Wei Zhang, Chongbo Sun, Xuefeng Tao, Wei Yang, Le Zhang, Wenwu Zhu, Peng Cui, Zhi Wang

机构 * Bytedance(字节跳动) Shenzhen International Graduate School(深圳国际研究生院) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Department of Computer Science and Technology(计算机科学与技术系)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract)

AI总结 本文提出Trailblazer框架,利用大语言模型实现跨任务和环境的通用网络策略,通过网络对齐和策略协作机制提升效率与泛化能力。

Comments Arxiv version. Official version has been submitted to IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12025 2026-08-13 cs.SE cs.AI 新提交 91%

From Safety Documentation to Safety Knowledge Support: An Evidence-Grounded LLM Framework for Medical Devices

从安全文档到安全知识支持:面向医疗器械的基于证据的大语言模型框架

Tuhinangshu Gangopadhyay, Rasmus Adler, Peter Liggesmeyer, Jan Reich

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对现有LLM在医疗器械安全工程中源链接等支持不足的问题,本文提出基于证据的LLM框架,用于安全知识支持,不做安全判定,还给出对应评估策略。

Comments ISSRE 2026, AISQ, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11241 2026-08-13 cs.AI cs.IR 新提交 90%

RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle

RecSys Factory:限制LLM智能体在工业推荐生命周期内的自主决策点

Dongyang Ao, Kaixiang Fang, Shijie Xu

机构 * Tencent(腾讯) FiT(腾讯FiT)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 RecSys Factory 是限制 LLM 智能体自主到决策点的平台,解决工业推荐系统运营的三角困境,在腾讯三业务线部署 78 天,CLI 调度成功率达 78.6%。

Comments 21 pages, 6 figures, 9 tables. Reports a 78-day deployment across three heterogeneous industrial recommender business lines (1,624 CLI-tool dispatches). Companion paper: AutoResearch (P3b), which instantiates the same substrate for autonomous research

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16749 2026-08-13 cs.CR cs.AI 交叉投稿 90%

Evaluating LLM Generated Detection Rules in Cybersecurity

评估大语言模型(LLM)生成的网络安全检测规则

Anna Bertiger, Bobby Filar, Aryan Luthra, Stefano Meschiari, Aiden Mitchell, Sam Scholten, Vivek Sharath

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出开源评估框架与基准指标,以保留集法对比LLM与人工生成的网络安全规则,多维度评估LLM规则生成器有效性,并分析了Sublime Security的自动检测工程师(ADE)能力。

Comments Preprint of a paper accepted at the Conference on Applied Machine Learning in Information Security (CAMLIS 2025). 11 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11220 2026-08-13 cs.AI cs.MA 新提交 86%

LLMs in Process Diagram Engineering: From Optimal PFDs to Validated P&IDs

流程图表工程中的大语言模型:从最优工艺流程图到经验证的管道及仪表流程图

Timur Zakarin, Sergei Voitov, Sergei Shumilin, Evgeny Burnaev

机构 * Skoltech(斯科尔科沃科技学院) AIRI(人工智能研究院(AIRI))

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出P&ID Pilot端到端AI流水线,结合GA与LLM生成最优PFD,再通过基于LLM的智能体将其转换为100%执行成功的合规P&ID,实现工艺设计自动化并减少人工工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27723 2026-08-13 cs.LG stat.ML 版本更新 86%

Optimized Deferral for Imbalanced Settings

优化不平衡设置下的延迟策略

Corinna Cortes, Anqi Mao, Mehryar Mohri, Yutao Zhong

机构 * Google Research(谷歌研究) Courant Institute of Mathematical Sciences(Courant数学科学研究所)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在专家不平衡情况下两阶段学习延迟方法,提出新的成本敏感学习算法MILD,通过改进损失函数和保障机制,提升了图像分类和LLM路由任务的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12138 2026-08-13 cs.CL cs.AI cs.HC cs.IR cs.LG 新提交 86%

A corpus-specific clinical RAG system matches or outperforms newer frontier LLMs on HealthBench

针对特定语料库的临床检索增强生成(RAG)系统在HealthBench上的表现与较新的前沿大语言模型相当或更优

Praveen Reddy, Charuta Mandke, Suvrankar Datta, Sarah Khan, Siddharth Reddy Anthireddy, Shitij Arora, Vishal Singh

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文评估专为中低收入环境构建的临床RAG系统VITA,其在HealthBench基准测试中与前沿LLM表现相当或更优,语料库特异性可提升模型落地性但会降低沟通流畅度。

Comments 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11744 2026-08-13 cs.SE 新提交 86%

Harnessing LLMs for Document-Guided Fuzzing of Python Libraries

利用大语言模型(LLM)实现Python库的文档引导模糊测试

Bin Duan, Tarek Mahmud, Meiru Che, Yan Yan, Naipeng Dong, Dan Dongseong Kim, Guowei Yang

专题命中 领域大模型 :LLM(title_cn,summary_cn)

AI总结 本文提出VistaFuzz,一种基于本地开源LLM的文档引导模糊测试技术,用于测试Python库API,在12个库的7718个API上发现74个问题,其中43个已确认、29个已修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04571 2026-08-13 cs.AI 版本更新 81%

OpenAg: Democratizing Agricultural Intelligence

OpenAg:推动农业智能的平民化

Srikanth Thudumu, Jason Fisher

机构 * Institute of Applied Artificial Intelligence and Robotics (IAAIR)(应用人工智能与机器人研究所)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本研究提出OpenAg框架,结合多类技术构建农业通用人工智能系统,以解决现有农业智能系统的不足,助力符合当地实际的农业决策。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12228 2026-08-13 cs.SE 新提交 80%

Towards Automated Domain Model Extraction from Source Code using Heuristics and Open-Source LLMs

基于启发式方法与开源大语言模型(LLMs)从源代码中自动提取领域模型的研究

Alessandra Mancas, Mounir Ammam, Hyacinth Ali, Kevin Delcourt, Houari Sahraoui

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出结合启发式方法与开源LLMs的自动领域模型提取方法,克服上下文限制,在10个项目数据集上获高F1分数,适用于隐私敏感的工业逆向工程场景。

Comments To appear in the Proceedings of the 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11259 2026-08-13 cs.CY cs.AI 新提交 77%

Methodologies for Improving the Quality of AI Tutoring in K-12 Education

提升K-12教育中AI辅导质量的方法

Tushar Udeshi, Anna Khazenzon, Kabir Khan, Nick Breen, RJ Corwin, Chris DiGiano, Kodi Weatherholtz, Marek Zaluski

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文针对K-12教育中AI辅导质量提升问题,以Khanmigo为研究对象,介绍了相关衡量指标与实验,阐述了模型、提示工程等方面对指标产生积极影响的改动。

Comments 15 pages. Accepted at AIED 2026 (27th International Conference on Artificial Intelligence in Education). Published version: Artificial Intelligence in Education, LNCS vol. 16582, Springer, Cham, first online 25 June 2026 (cite as 2027)

Journal ref In: Blanchard, E.G., Chen, G., Chi, M., Isotani, S. (eds) Artificial Intelligence in Education. AIED 2026. Lecture Notes in Computer Science, vol 16582. Springer, Cham (2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18452 2026-08-13 cs.CL 77%

MedScore: Generalizable Factuality Evaluation of Free-Form Medical Answers by Domain-adapted Claim Decomposition and Verification

Heyuan Huang, Alexandra DeLucia, Vijay Murari Tiyyala, Mark Dredze

机构 * Center for Language and Speech Processing(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Added generalizability experiment and examples on non-medical free-form answer. Added ablation study for MedCorp verification corpus and MedScore decomposition prompt

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 14149-14180, San Diego, California, United States. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11420 2026-08-13 cs.AI cs.CL 新提交 73%

Social Chain of Thought: A Multi-Agent Architecture Grounded in Medical Differential Diagnosis Methodology

社会思维链:一种基于医学鉴别诊断方法论的多智能体架构

Del Coburn, Scott Sanner, Dan Silver

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出基于医学鉴别诊断方法论的多智能体架构SCoT,通过多轮专家协作提升复杂病例诊断召回率,其优势无法通过单一推理实现。

Comments 14 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏