arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1111 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1111 篇

2608.09290 2026-08-12 cs.SE 版本更新 80%

OpenCodeReview: Determinism over Non-Determinism for Cost-Effective Agent-Based Code Review

OpenCodeReview:面向成本效益型智能体代码评审的非确定性转确定性方案

Zhengfeng Li, Lei Zhang, Xianwei Wu, Zhengqi Zhuang, Yingjie Xu, Boge Wang, Shaofei Zhu, Chuan Wang, Peng Zhao, Xinyu Zheng, Guoping Rong

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 OpenCodeReview针对LLM代码评审智能体的非确定性与上下文局部性缺陷,通过在三个流水线节点注入确定性,在AACR-Bench上实现SEM-F1提升且大幅降低令牌消耗,性能优于主流编码智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16598 2026-08-11 cs.CV 版本更新 80%

VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs

VisionSelector:用于高效多模态大语言模型的端到端可学习视觉令牌压缩

Jiaying Zhu, Yurui Zhu, Xin Lu, Wenrui Yan, Dong Li, Kunlin Liu, Xueyang Fu, Zheng-Jun Zha

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 针对多模态大语言模型的视觉令牌压缩瓶颈,提出端到端可学习的VisionSelector框架,通过可微Top-K与课程退火策略实现高效自适应令牌选择,在压缩时保持优异性能并提升预填充速度。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31031 2026-08-04 cs.IR 版本更新 80%

GenPage: Towards End-to-End Generative Homepage Construction at Netflix

GenPage:面向Netflix主页的端到端生成式构建

Lequn Wang, Jiangwei Pan, Linas Baltrunas

专题命中 效率与部署 :LLM(abstract,abstract_cn);pretraining(abstract);post-training(abstract)

AI总结 提出GenPage,用单一Transformer替代传统多阶段推荐栈,通过自回归生成整个主页,结合预训练与后训练,在线A/B测试中核心指标提升0.24%,延迟降低20%。

Comments Accepted at ACM RecSys 2026. Author's accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10303 2026-07-22 cs.AR 版本更新 80%

DiffAxE: Diffusion-driven Hardware Accelerator Generation and Design Space Exploration

DiffAxE:扩散驱动的硬件加速器生成与设计空间探索

Arkapravo Ghosh, Abhishek Moitra, Abhiroop Bhattacharjee, Ruokai Yin, Priyadarshini Panda

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对硬件加速器设计空间探索难题,传统方法有局限。本文提出生成方法,将硬件设计建模为基于目标性能的一维图像合成,能有效学习相关映射,在降低生成误差、提升性能及加速搜索等方面有显著贡献。

Comments Accepted at ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02690 2026-07-21 cs.IR 版本更新 80%

AnnoRetrieve: Efficient Structured Retrieval for Unstructured Document Analysis

AnnoRetrieve:面向无结构文档分析的高效结构化检索

Teng Lin, Yuyu Luo, Nan Tang

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文提出AnnoRetrieve,通过结构化注释替代向量嵌入,实现高效精准的语义检索,降低LLM调用频率和成本,提升文档分析的准确性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11132 2026-07-15 cs.CV 版本更新 80%

From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering

从回顾到前瞻:面向知识驱动视觉问答的自我鼓励回顾蒸馏

Yu Zhao, Ying Zhang, Xuhui Sui, Baohang Zhou, Xinying Qian, Li Shen, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);preference optimization(abstract);prompting(abstract)

AI总结 本文提出HinD框架,通过知识鼓励偏好优化提升多模态大语言模型的知识推理能力,实验表明其在OK-VQA和A-OKVQA上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05240 2026-07-10 cs.RO cs.CV 版本更新 80%

StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

StreamVLN:通过快慢上下文建模实现流式视觉与语言导航

Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, Xihui Liu, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09016 2026-07-10 cs.RO 版本更新 80%

Open-Vocabulary Object-Goal Navigation by Generalizing Semantic Mapping with Dense CLIP

通过用密集CLIP泛化语义映射实现开放词汇目标导航

Meng Wei, Chenyang Wan, Tai Wang, Yuqiang Yang, Wenzhe Cai, Yilun Chen, Hanqing Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究面向对象的实体导航任务,提出OVExp框架,利用密集CLIP模型展示基于语义地图的目标预测网络泛化能力,设计跨模态转移策略解决训练成本高问题,在ObjectNav基准上对未知目标有强大泛化能力。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27742 2026-07-09 cs.CV 版本更新 80%

TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration

TIR-Agent:训练一个探索性且高效的图像修复代理

Guoli Jia, Yisheng Zhang, Haote Hu, Shanxu Zhao, Kaikai Zhao, Long Sun, Xinwei Long, Kai Tian, Che Jiang, Zhaoxiang Liu, Kai Wang, Shiguo Lian, Kaiyan Zhang, Bowen Zhou

机构 * Tsinghua University(清华大学) China Unicom(中国联通) Hunan University(湖南大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 效率与部署 :SFT(abstract,abstract_cn);language model(abstract);language agent(abstract)

AI总结 本文提出TIR-Agent,通过监督微调和强化学习两阶段训练,解决图像修复中任务调度和工具组合的效率问题,实验表明其在多个基准上表现优异且推理速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19487 2026-07-08 cs.NI 版本更新 80%

Revisiting and Expanding the IPv6 Periphery: Global-Scale Measurement and Security Analysis

重新审视并扩展IPv6网络边缘:全球规模测量与安全分析

Zixuan Xie, Zitao Yang, Shurui Fang, Zhaoyang Li, Wenxing Xie, Nannan Fu, Liangyu Dong, Xiang Li

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文重新审视并扩展了IPv6网络边缘的研究,通过全球范围内的测量发现超过2.8亿个活跃的IPv6网络边缘,揭示了服务暴露和路由环等安全问题,并提出Hierarchical LLM Exposure Verification框架以识别未授权访问风险。

Comments 13 pages, 7 figures, 8 tables. Submitted to IEEE Transactions on Information Forensics and Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00774 2026-06-16 cs.DB 版本更新 80%

SCOPE: Cost-Efficient Model Selection for Compound AI Systems under Quality Constraints

SCOPE: 质量约束下复合AI系统的成本高效模型选择

Yiqian Huang, Shiqi Zhang, Tianyuan Jin, Xiaokui Xiao

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 针对复合AI系统中各模块LLM选择问题,提出SCOPE算法,通过利用每查询结果估计成本和质量,构建置信界指导搜索,在满足质量阈值下最小化平均成本,理论保证质量达标和成本近似最优。

Comments Technical report for the paper accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29796 2026-06-16 cs.AI cs.CL cs.LG 版本更新 80%

SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search

SAAS:面向智能体搜索中过度搜索缓解的自我感知强化学习

Yunbo Tang, Chengyi Yang, Shiyu Liu, Zhishang Xiang, Zerui Chen, Qinggang Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SAAS强化学习框架,通过搜索边界建模、边界感知奖励和分阶段优化策略,使LLM智能体具备动态自我感知能力,在不降低准确率的前提下显著减少过度搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17103 2026-06-16 cs.DC 版本更新 80%

Distributed Load Balancing with Workload-Dependent Service Rates

具有工作负载相关服务速率的分布式负载均衡

Wenxin Zhang, Santiago R. Balseiro, Robert Kleinberg, Vahab Mirrokni, Balasubramanian Sivan, Bartek Wydrowski

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对服务速率随工作负载变化的分布式系统,提出最大边际服务速率(GMSR)策略,通过仅依赖局部信息的分散决策实现全局最优延迟性能,并证明其收敛性和吞吐量最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23294 2026-06-08 eess.SY cs.SY 版本更新 80%

Agentic AI-Enhanced Semantic Communications: Foundations, Architecture, and Applications

基于代理AI的语义通信:基础、架构与应用

Haixiao Gao, Mengying Sun, Ruichen Zhang, Yanhan Wang, Xiaodong Xu, Nan Ma, Dusit Niyato, Ping Zhang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文探讨代理AI如何赋能语义通信,提出统一框架并展示多场景应用,通过案例研究验证其有效性。

Comments This version is being withdrawn because we need to further reevaluate the attribution of contributions among the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08319 2026-08-24 cs.CV cs.LG 版本更新 79%

A continually expandable foundation model for brain MRI

可持续扩展的脑MRI基础模型

Michail Mamalakis, Carmen Jimenez-Mesa, Yonghao Li, Hao Chen, Chao Li, Antonios Mamalakis, John Suckling, Richard Bethlehem, Stephen J. Price, Richard J. Gilbertson, Pietro Lio

机构 * University of Cambridge(剑桥大学) University of Málaga(马拉加大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出可扩展的Alcmaeon脑MRI基础模型,结合体积编码、潜在扩散生成与Graph-Blueprint Pruning,在跨临床领域扩展时遗忘程度更低,可支持多种任务,为持续发展的脑MRI基础模型提供了可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23487 2026-08-21 cs.AI 版本更新 79%

CADRE: Stable, Parameter Efficient Adaptation of Medical Vision Language Models with Bounded Forgetting and Prior Drift

CADRE:具有有界遗忘和先验漂移的稳定、参数高效的医学视觉语言模型适应

Rishabh Jha, Amrita Singh, Prashanna Chudal

机构 * Mindriser's Consortium, Kathmandu, Nepal(Mindriser's 联盟,加德满都,尼泊尔) University of Victoria, BC, Canada(维多利亚大学,不列颠哥伦比亚省,加拿大)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出CADRE框架,通过结合低秩适应与弹性权重巩固及先验锚定惩罚,在仅训练0.23%参数下实现医学视觉语言模型的高精度、低遗忘和正向反向迁移,遗忘率降低约七倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18738 2026-08-21 cs.CL 版本更新 79%

Remask, Don't Replace: Token-to-Mask Refinement in Diffusion Language Models

重新标记,而非替换:扩散大语言模型中的令牌到标记细化

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文提出Token-to-Mask(T2M)方法,通过重新标记可疑令牌而非覆盖来提升扩散大语言模型的准确性,在AIME 2025和CMATH上分别提升13.33和8.56个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16207 2026-08-19 cs.AI cs.CR 版本更新 79%

JUMP: Single-Pass Membership Inference on Fine-Tuned Diffusion Language Models

JUMP:微调扩散语言模型的单通道成员推理

Yeachan Jun, Albert No

机构 * Yonsei University(延世大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 研究微调离散扩散语言模型的成员推理攻击,提出JUMP单通道评分攻击,利用dLLMs任意顺序可解码性和并行可解码性,在六个MIMIR域上的微调LLaDA - 8B - Base上提升了平均ROC - AUC并改善低FPR检测,且减少查询次数。

Comments 22 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29066 2026-08-18 cs.CL 版本更新 79%

$x$-Prediction Flow: Efficient Continuous Decoding for Masked Diffusion Language Models

掩码扩散解码作为 $x$-预测流

Weitian Wang, Lianlei Shan, Shubham Rai, Cecilia De La Parra, Akash Kumar

机构 * Robert Bosch GmbH(罗伯特博世集团) Ruhr University Bochum(博尔茨大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 针对掩码扩散语言模型标准解码中二元决策导致信息丢失和性能差的问题,提出连续解码框架,通过重新解释掩码预测为清洁状态预测,引入置信度驱动的异步更新和强化学习策略网络,在减少解码预算时保持高性能。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11211 2026-08-13 cs.CV cs.AI 版本更新 79%

A Simple Efficiency Incremental Learning Framework via Vision-Language Model with Nonlinear Multi-Adapters

通过非线性多适配器的视觉-语言模型实现简单的效率增量学习框架

Haihua Luo, Xuming Ran, Jiangrong Shen, Timo Hämäläinen, Zhonghua Chen, Qi Xu, Fengyu Cong

机构 * Faculty of Information Technology, University of Jyväskylä(信息科技学院,于韦斯屈耶大学) National University of Singapore(新加坡国立大学) Lab of Brain-Machine Intelligence, Zhejiang University(脑机智能实验室,浙江大学) School of Computer Science and Technology, Dalian University of Technology(计算机科学与技术学院,大连理工大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出SimE框架,利用视觉-语言模型与适配器提升增量学习效率,发现适配器连接数与模型能力呈非线性关系,实验表明在TinyImageNet和CIFAR-100上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18191 2026-08-13 cs.LG 版本更新 79%

Accelerating Time Series Foundation Models with Speculative Decoding

通过投机解码加速时间序列基础模型

Pranav Subbaraman, Fang Sun, Jinxi Yu, Yue Yao, Huacong Tang, Xiao Luo, Yizhou Sun

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 通过投机解码技术提升时间序列预测模型的推理效率,无需修改现有架构即可加速部署系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08086 2026-08-12 cs.CL 版本更新 79%

Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models

Archer:用于扩散语言模型高效回滚的缓存隐藏状态自适应复用方法

Xuning He, Zinan Sheng, Yongding Tao, Huanyu Liu, Ge Li, Xue Jiang, Yihong Dong

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文提出Archer方法,通过自适应复用缓存的提示隐藏状态,在保证扩散语言模型回滚能力的同时,实现了2.57倍平均加速与33.63%最佳平均性能,还提升了Pass@1指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16305 2026-08-11 cs.CV cs.AI 版本更新 79%

LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models

LookME:用于视觉语言模型层注入的基于查找的多模态嵌入

Zeyu Xu, Xingzhong Hou, Pengkai Guo, Siling Lin, Xiao Xu, Menghua Zhai, Haoyu Chen, Yunke Zhang, Fei Huang

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文针对视觉语言模型在资源受限环境中部署的问题,提出LookME框架。通过分层两级查找方法和稀疏注入策略,实现基于查找的多模态嵌入增强,实验表明该方法优于仅文本的PLE风格方法,有效提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02455 2026-08-11 cs.SD cs.CL eess.AS 版本更新 79%

Diagnostic-Driven Layer-Wise Compensation for Post-Training Quantization of Encoder-Decoder ASR Models

基于诊断的层间补偿用于编码器-解码器ASR模型的后训练量化

Xinyu Wang, Ziyu Zhao, Yajie Luo, Yihong Wu, Liheng Ma, Jingrui Tian, Lei Ding, Xiao-Wen Chang, Peng Lu

机构 * McGill University(麦吉尔大学) University of Manitoba(曼尼托巴大学) Mila - Quebec AI Institute(魁北克AI研究院)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.CL

AI总结 本文提出FADE框架,通过结合内在脆弱性评分和校准可靠性评分,为编码器-解码器ASR模型的各层分配适应性补偿系数,以平衡局部量化保真度与跨层误差校正,从而提升在3-4位精度下的词错误率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08390 2026-08-10 cs.LG 版本更新 79%

Inference-Time Scaling of Diffusion Language Models via Trajectory Refinement

通过轨迹细化提升扩散语言模型的推理时间扩展

Meihua Dang, Jiaqi Han, Minkai Xu, Kai Xu, Akash Srivastava, Stefano Ermon

机构 * Stanford University(斯坦福大学) Red Hat AI Innovation(红帽人工智能创新)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本文提出PG-DLM,通过轨迹级细化提升扩散语言模型的推理效率,引入新的缩放轴并实现自适应计算分配,实验显示在奖励引导生成任务中表现更优。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01263 2026-08-07 cs.LG 版本更新 79%

Distill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language Models

提炼学生可见内容:面向视觉语言模型的Fisher投影在线策略蒸馏

Leyan Xue, Feng Xiong, Mingjun Ma, Changqing Zhang

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 针对视觉语言模型在线策略蒸馏中教师修正与学生能力不匹配的问题,提出FP-OPD方法,在8B到2B的蒸馏中使7个多模态基准平均得分分别提升2.77和1.60个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03854 2026-08-06 cs.LG 版本更新 79%

Quantization Effects on Biomedical LLM Reliability

量化对生物医学大语言模型可靠性的影响

Anton Rasmussen, Hong Qin

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.LG

AI总结 该研究针对 Mistral-7B 变体在 PubMed RCT 句子分类任务上,评估量化及提示模板、评分规则等对生物医学大语言模型可靠性的影响,发现这些因素对校准和准确率的影响不可忽视。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11510 2026-08-04 cs.LG stat.ML 版本更新 79%

DAG-FM: A Foundation Model for Causal Discovery under Heterogeneous Causal Mechanisms

DAG-FM:异构因果机制下因果发现的基础模型

Yikang Chen, Zhengkang Guan, Haoyuan Qian, Xingxuan Zhang, Peng Cui, Yi Yang, Fei Wu, Kun Kuang

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 针对观测表格数据因果发现难题,提出DAG-FM基础模型,通过自回归阶段、表格交互块及叶专家混合处理复杂情况,经迭代推理构建DAG,在合成及真实数据集上性能优于传统算法和其他模型。

Comments 33 pages, 9 figures, 12 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18724 2026-08-04 cs.AI 版本更新 79%

Beyond One Output: Visualizing and Comparing Distributions of Language Model Generations

超越单一输出:语言模型生成分布的可视化与比较

Emily Reif, Claire Yang, Jared Hwang, Deniz Nazar, Noah A. Smith, Jeff Heer

机构 * University of Washington(华盛顿大学) Allen Institute for AI(Allen人工智能研究所)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出GROVE工具,通过可视化语言模型生成的分布结构,帮助用户更全面地理解生成过程中的模式和敏感性,提升任务迭代效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22949 2026-08-03 cs.LG cs.MA 版本更新 79%

MARGIN: Runtime Confidence Calibration for Multi-Agent Foundation Model Coordination

MARGIN:多智能体基础模型协调的运行时置信度校准

Joss Armstrong

机构 * Ericsson, Athlone, Ireland(爱立信,Athlone,爱尔兰)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 提出在线校准方法MARGIN,通过任务流学习每个智能体每个置信度带的校准因子,无需模型访问或重训练,在分布漂移下将校准误差降低3-6倍,并显著提升多智能体选择性能。

详情

展开后加载摘要…

URL PDF HTML 收藏