arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22496 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22496 篇

2605.28087 2026-05-28 cs.RO 80%

Whose Is This?: Context-Aware Object Ownership Inference with Uncertainty-Guided Questioning

这是谁的?:基于不确定性引导提问的上下文感知物体所有权推断

Saki Hashimoto, Akira Taniguchi, Shoichi Hasegawa, Yoshinobu Hagiwara, Tadahiro Taniguchi

机构 * Kyutech(京都科技大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种结合大语言模型和共形预测的上下文感知所有权推断框架(COIN),通过不确定性引导的交互式提问,在模拟家庭环境中实现高精度物体所有权估计。

Comments Under review in Advanced Robotics. Project page is https://emergentsystemlabstudent.github.io/COIN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21046 2026-05-28 cs.CV cs.RO 80%

CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification

CogVLA: 通过指令驱动路由与稀疏化实现认知对齐的视觉-语言-动作模型

Wei Li, Renshan Zhang, Rui Shao, Jie He, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract)

AI总结 提出CogVLA框架,通过指令驱动路由和稀疏化机制,在LIBERO基准和真实机器人任务上以2.5倍训练成本降低和2.8倍推理延迟降低实现97.4%和70.0%的成功率。

Comments Accepted to NeurIPS 2025, Project Page: https://jiutian-vl.github.io/CogVLA-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26486 2026-05-27 cs.CV 80%

LongCat-Video-Avatar 1.5 Technical Report

LongCat-Video-Avatar 1.5 技术报告

Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 效率与部署 :RLHF(summary_cn,abstract)

AI总结 本文提出 LongCat-Video-Avatar 1.5,一个通过升级音频编码器、优化训练策略、数据筛选和RLHF训练实现高精度唇同步、全身时间稳定性和长视频生成的开放框架,在多个基准测试中达到或超越商业系统性能。

Comments Homepage: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/ Github: https://github.com/meituan-longcat/LongCat-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26297 2026-05-27 cs.DC 80%

Agentic AI Workload Characteristics

Agentic AI 工作负载特征

Yichao Yuan, Ankita Nayak, Souvik Kundu, Nishil Talati

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文通过端到端追踪基础设施,在五个智能体基准测试上刻画 ReAct 风格智能体的 LLM 服务和工具执行特征,发现智能体工作负载并非简单长提示工作负载,其执行以解码为主且依赖长寿命 KV 缓存状态,工具使用具有从读/探索到执行/写的时序结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28096 2026-05-27 cs.NI 80%

Beyond Traffic Matrix: DELTA -- A DAG-Aware OCS Logical Topology Optimization for AIDCs

超越流量矩阵:DELTA——一种面向AIDC的DAG感知OCS逻辑拓扑优化

Niangen Ye, Jingya Liu, Guofu Zhu, Weiqiang Sun, Weisheng Hu

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出DELTA框架,利用计算通信有向无环图(DAG)将时变流量模式编码为混合整数线性规划(MILP)模型,通过可变长度时间间隔公式和双轨加速策略优化光学电路开关(OCS)逻辑拓扑,减少通信时间并节省光端口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26005 2026-05-26 cs.SE 80%

CelerLog: Fast Log Parsing via Dynamic Routing

CelerLog: 通过动态路由实现快速日志解析

Shiwen Shan, Yintong Huo, Minxing Wang, Zhiying Wu, Yuxin Su, Zibin Zheng

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出CelerLog,通过动态路由将日志分为密集和稀疏组,分别用统计方法和LLM处理,在保持高精度的同时大幅提升速度和降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25659 2026-05-26 cs.CV 80%

StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration

StreamChar: 基于解耦编排的长时程流式角色音频-视频生成

Linrui Tian, Qi Wang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出StreamChar流式框架,通过LLM编排器与联合音频-视频DiT解耦长时程编排与短窗去噪,实现实时、稳定、高质量的角色动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11367 2026-05-26 cs.DC 80%

Efficient Distributed MLLM Training with Cornstarch

使用Cornstarch高效分布式多模态大语言模型训练

Insu Jang, Runyu Lu, Nikhil Bansal, Ang Chen, Mosharaf Chowdhury

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出Cornstarch框架,通过冻结感知流水线并行和令牌工作负载平衡的上下文并行,解决多模态大语言模型训练中的异构性问题,平均吞吐量提升2.26倍。

Comments ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17260 2026-05-26 cs.CV 80%

LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs

LiteFrame: 高效视觉编码器解锁视频大语言模型中的帧缩放

Jihwan Kim, Nikhil Parthasarathy, Danfeng Qin, Junhwa Hur, Deqing Sun, Bohyung Han, Ming-Hsuan Yang, Boqing Gong

机构 * Seoul National University(首尔国立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对视频大语言模型处理长视频时视觉令牌上下文长度爆炸的问题,提出LiteFrame高效视频编码器,通过压缩令牌蒸馏(CTD)训练框架,使紧凑的学生模型直接预测教师模型的信息密集时空压缩表示,从而在降低35%端到端延迟的同时处理8倍帧数并提升视频理解精度。

Comments Project Page: https://jjihwan.github.io/projects/LiteFrame

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21889 2026-05-25 cs.CL cs.AI cs.LG 80%

TingIS: Real-time Risk Event Discovery from Noisy Customer Incidents at Enterprise Scale

TingIS:企业级规模下从嘈杂客户事件中实时发现风险事件

Jun Wang, Ziyin Zhang, Rui Wang, Hang Yu, Peng Di, Rui Wang

机构 * Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TingIS系统,通过多阶段事件链接引擎结合高效索引与大型语言模型,从嘈杂客户事件中稳定提取可操作事件,实现企业级实时风险发现。

Comments Accepted to ACL 2026 Industry Track (oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21604 2026-05-22 cs.MA 80%

Argo: Efficient Importance Labeling for Enterprise Email Systems

Argo:企业电子邮件系统中的高效重要性标注

Siddhant Ray, Ganesh Ananthanarayanan, Kevin Chian, Yan Guo, Cristina St Hill, Jack W. Stokes, Victor Wang, Junchen Jiang

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Argo框架,通过构建profiler高效搜索标注成本质量折衷空间,实现接近GPT水平的标注质量但成本显著降低,适用于大规模企业电子邮件标注。

Comments 15 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21434 2026-05-21 cs.SE 80%

Agentic Model Checking

代理模型检查

Youcheng Sun, Jiawen Liu, Daniel Kroening, Jason Xue

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文提出了一种代理模型检查方法,结合LLM代理与受限模型检查后端,通过代理提出任务并由求解器验证,以解决LLM生成系统代码的验证难题,包括规范缺失和安全合同隐式编码的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21035 2026-05-21 cs.HC 80%

The Quiet Path from Seemingly Minor Design Errors to Workplace AI Incidents

从看似微小的设计错误到工作场所AI事件的沉默路径

Julia De Miguel Velázquez, Sanja Šćepanović, Andrés Gvirtz, Daniele Quercia

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨了工作场所中人工智能系统设计与员工需求之间的不匹配问题,发现83%的工作场所AI事件源于员工与AI系统之间的不匹配,主要表现为员工期望系统精准、有洞察力或个性化,但实际获得的是基础、简单或通用的系统,且开发者过度关注效率和速度导致了大量问题。

Comments Accepted in April 2026 to be published in the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), June 25-28, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20563 2026-05-21 cs.MA cs.AI cs.CL cs.LG cs.SE 80%

Multi-agent Collaboration with State Management

具有状态管理的多智能体协作

Mengyang Liu, Taozhi Chen, Zhenhua Xu, Xue Jiang, Yihong Dong

机构 * Shanghai Jiaotong University(上海交通大学) Cortices AI Emory University(埃默里大学) Peking University(北京大学)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出STORM,一种面向多智能体协作的状态管理方法,通过在共享工作区中调解智能体的交互,确保每个智能体在一致的代码库视图上操作,并在写入时检测和解决冲突。STORM在多个LLM上优于基于git-worktree的多智能体基线,且在成本效率上具有竞争力,表明显式状态管理比工作区隔离更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20193 2026-05-21 cs.CL cs.AI cs.LG 80%

Improving Quantized Model Performance in Qualitative Analysis with Multi-Pass Prompt Verification

通过多轮提示验证提升量化模型在定性分析中的性能

Aisvarya Adeseye, Jouni Isoaho, Adeyemi Adeseye

机构 * University of Turku, Turku, Finland(图尔库大学,芬兰图尔库) Brilloconnetz Partners avoin yhtiö, Turku, Finland(Brilloconnetz Partners 有限公司,芬兰图尔库)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了不同位数量化级别和类型对LLaMA-3.1(8B)在定性分析中的性能影响,提出了一种量化感知的多轮提示验证方法以提高模型的稳定性和准确性,结果显示8位模型最接近黄金标准,4位模型在应用方法后变得稳定,3位和2位模型在提示设计和验证后性能有所提升。

Comments Accepted to publish in 12th Intelligent Systems Conference 2026; 3-4 September 2026 in Amsterdam, The Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20035 2026-05-20 cs.CV 80%

Stage-adaptive Token Selection for Efficient Omni-modal LLMs

面向高效多模态大语言模型的阶段自适应令牌选择

Zijie Xin, Jie Yang, Ruixiang Zhao, Tianyi Wang, Fengyun Rao, Jing Lyu, Xirong Li

机构 * Renmin University of China(中国人民大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SEATS方法,通过阶段自适应的令牌选择技术,有效提升多模态大语言模型的推理效率,在保留96.3%原始性能的同时,实现9.3倍的FLOPs减少和4.8倍的prefill加速。

Comments Code Link: https://github.com/xxayt/SEATS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19206 2026-05-20 cs.RO 80%

CLUE: Adaptively Prioritized Contextual Cues by Leveraging a Unified Semantic Map for Effective Zero-Shot Object-Goal Navigation

CLUE: 通过利用统一语义地图实现适应性优先级上下文线索

Taeyun Kim, Alvin Jinsung Choi, Dasol Hong, Hyun Myung

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 CLUE通过利用统一语义地图,采用适应性优先级上下文线索的方法,有效解决零样本物体-目标导航问题,提高了导航的鲁棒性和效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08738 2026-05-19 cs.LG cs.AI cs.CL 80%

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training

SlimQwen: 探索在大规模MoE模型预训练中的剪枝与知识蒸馏

Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang, Xiulong Yuan, Zihan Qiu, Zhiqiang Shen, Dayiheng Liu

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里公司) MBZUAI KAUST(卡士大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在大规模预训练中如何应用剪枝和知识蒸馏技术,探讨了剪枝在初始化方面的优势、专家压缩对最终模型的影响以及训练策略的有效性,最终将Qwen3-Next-80A3B压缩到23A2B模型并保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15220 2026-05-18 cs.CL cs.AI cs.LG 80%

Always Learning, Always Mixing: Efficient and Simple Data Mixing All The Time

始终学习,始终混合:始终高效且简单的数据混合

Michael Y. Hu, Apurva Gandhi, Kyunghyun Cho, Tal Linzen, Pratyusha Sharma

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软公司)

专题命中 效率与部署 :language model(abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OP-Mix算法,通过低秩适配器插值实现数据混合,提升预训练和持续学习性能,减少计算资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20206 2026-05-15 cs.CV 80%

RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling

RAPO++: 通过数据对齐和测试时缩放实现文本到视频生成的跨阶段提示优化

Bingjie Gao, Qianli Ma, Xiaoxue Wu, Shuai Yang, Guanzhou Lan, Haonan Zhao, Jiaxuan Chen, Qingyang Liu, Yu Qiao, Xinyuan Chen, Yaohui Wang, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 RAPO++通过数据对齐和测试时缩放,结合训练数据对齐、测试时迭代缩放和大语言模型微调,提升文本到视频生成效果,无需修改生成基础模型。

Comments arXiv admin note: text overlap with arXiv:2504.11739

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13875 2026-05-15 cs.GT 80%

Common-agency Games for Multi-Objective Test-Time Alignment

多目标测试时对齐的共同代理博弈

Baiting Chen, Tong Zhu, Rui Yu, Xiaowu Dai

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CAGE框架,通过游戏理论实现多目标测试时对齐,无需重新训练,支持灵活的权衡和弱到强泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13858 2026-05-14 cs.CV 80%

EDITS: Enhancing Dataset Distillation with Implicit Textual Semantics

EDITS: 通过隐式文本语义增强数据集蒸馏

Qianxin Xia, Jiawei Du, Guoming Lu, Zhiyong Shu, Jielei Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Centre for Frontier AI Research, Agency for Science, Technology and Research(前沿人工智能研究中心,科技研究局)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出EDITS框架,利用图像数据中的隐式文本语义提升数据集蒸馏效果,通过全局语义查询模块融合外部文本与图像特征,结合局部语义意识选择代表性样本构建图像和文本原型,最终通过双原型引导策略生成合成数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12942 2026-05-14 cs.CL cs.AI cs.LG 80%

A3 : an Analytical Low-Rank Approximation Framework for Attention

A3:一种用于注意力机制的分析低秩近似框架

Jeffrey T. H. Wong, Cheng Zhang, Xinye Cao, Pedro Gimenes, Christos-Savvas Bouganis, George A. Constantinides, Wayne Luk, Yiren Zhao

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院伦敦校区电子与电气工程系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出A3框架,通过将Transformer层分为QK、OV和MLP三个组件,提供分析解以减少隐藏维度并最小化功能损失,从而在不引入运行时开销的情况下降低模型大小、KV缓存大小和FLOPs,实验显示其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10130 2026-05-12 cs.CV 80%

Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection

Thermal-Det: 语言引导的跨模态蒸馏用于开放词汇热成像目标检测

Yasiru Ranasinghe, Elim Schenck, Florence Yellin, Shuowen Hu, Christopher Funk, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Kitware DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Thermal-Det,首个针对热成像的开放词汇检测器,通过合成数据集和跨模态蒸馏提升热成像目标检测性能,实验显示在公开基准上取得2-4%的AP提升。

Comments Accepted at CVPR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10050 2026-05-12 cs.CV 80%

EchoPrune: Interpreting Redundancy as Temporal Echoes for Efficient VideoLLMs

EchoPrune: 将冗余视为时间回声以实现高效的视频大语言模型

Jiameng Li, Minye Wu, Jiezhang Cao, Aleksei Tiulpin, Matthew B. Blaschko

机构 * KU Leuven(鲁文大学) Shanghai Jiaotong University(上海交通大学) Weill Cornell Medicine(韦尔医学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出EchoPrune方法,通过将冗余视频token视为时间回声,提升视频大语言模型在固定token预算下的时间分辨率,实验表明其在六个视频理解基准上使模型处理20倍帧数,性能提升8.6%且推理速度提升5.6倍。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09665 2026-05-12 cs.LG cs.AI cs.CL 80%

Learning Multi-Indicator Weights for Data Selection: A Joint Task-Model Adaptation Framework with Efficient Proxies

学习多指标权重用于数据选择:一种联合任务-模型适应框架与高效代理

Jingze Song, Zihao Chen, Wenqing Chen, Zibin Zheng

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种联合任务-模型适应框架,通过在紧凑的tiny-validation集上利用上下文学习信号,无需全量微调即可学习多指标权重,提升数据选择效率和性能。

Comments This work has been accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09656 2026-05-12 cs.RO 80%

ORICF -- Open Robotics Inference and Control Framework

ORICF -- 开源机器人推断与控制框架

Andrés Meseguer Valenzuela, Luís Miguel Bartolín Arnau

机构 * Instituto Tecnológico de Informática (ITI)(技术信息学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ORICF框架,通过模块化设计实现多模态机器人推断流水线,支持边缘计算,降低计算开销和能耗,保持模块化和可重复性。

Comments Accepted in ICRA26 Workshop: 8th International Workshop on Robotics Software Engineering (RoSE 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09375 2026-05-12 cs.AR 80%

31.1 A 14.08-to-135.69Token/s ReRAM-on-Logic Stacked Outlier-Free Large-Language-Model Accelerator with Block-Clustered Weight-Compression and Adaptive Parallel-Speculative-Decoding

31.1 一种14.08至135.69token/s的基于逻辑的堆叠异常自由大语言模型加速器,具备块聚类权重压缩和自适应并行推测解码

Pingcheng Dong, Yonghao Tan, Xuejiao Liu, Peng Luo, Yu Liu, Di Pang, Songchen Ma, Xijie Huang, Shih-Yang Liu, Dong Zhang, Zhichao Lu, Luhong Liang, Chi-Ying Tsui, Fengbin Tu, Liang Zhao, Kwang-Ting Cheng

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 本文提出了一种基于55nm推测解码的LLM加速器,采用基于突起的面对面ReRAM-on-logic堆叠技术,通过局部旋转单元实现无异常低比特量化,结合块级向量量化减少权重EMA开销,并采用自适应并行推测解码方案提升资源和带宽利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17671 2026-05-12 cs.LG cs.AI cs.CL 80%

LILO: Bayesian Optimization with Natural Language Feedback

LILO:带有自然语言反馈的贝叶斯优化

Katarzyna Kobalczyk, Zhiyuan Jerry Lin, Benjamin Letham, Zhuokai Zhao, Maximilian Balandat, Eytan Bakshy

机构 * Meta DAMTP, University of Cambridge(剑桥大学DAMTP)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LILO通过将大语言模型转化为结构化偏好信号,提升贝叶斯优化在复杂主观偏好下的适应性与效率,实验证明其在反馈受限场景中表现优异。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07865 2026-05-11 cs.LG cs.AI cs.CL 80%

KL for a KL: On-Policy Distillation with Control Variate Baseline

KL 为 KL:带有控制变量基线的在线蒸馏

Minjae Oh, Sangjun Song, Gyubin Choi, Yunho Choi, Yohan Jo

机构 * Graduate School of Data Science(数据科学研究生院) Seoul National University(首尔国立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出vOPD,通过引入控制变量基线将在线蒸馏转化为策略梯度强化学习,有效降低梯度方差,提升稳定性,并在多个基准上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏