arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-03 至 2026-03-03 共收录 599 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 107 篇

2603.00030 2026-03-03 cs.CL 79%

SimpleTool: Parallel Decoding for Real-Time LLM Function Calling

SimpleTool: 并行解码用于实时大语言模型功能调用

Xiaoxin Shi, Jiaxin Wan, Linkang Dong, Wei Jiang, Yue Liu, Zengfeng Huang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Fudan University, Shanghai, China(复旦大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL

AI总结 SimpleTool通过并行解码技术实现大语言模型功能调用的实时加速,提升效率并降低延迟,适用于实时应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18871 2026-03-03 cs.CL cs.AI 79%

How Do LLMs Use Their Depth?

大语言模型如何利用其深度?

Akshat Gupta, Jay Yeung, Gopala Anumanchipalli, Anna Ivanova

机构 * University of California Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型如何利用深度进行预测,提出'猜测-然后细化'框架,揭示了层间计算动态及深度使用机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22134 2026-03-03 cs.CL cs.AI 79%

Bridging Draft Policy Misalignment: Group Tree Optimization for Speculative Decoding

弥合草案策略不一致:为推测解码的组树优化

Shijing Hu, Jingyang Li, Zhihui Lu, Pan Zhou

机构 * Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GTO通过组树优化解决推测解码中草案策略不一致问题,提升LLM推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13305 2026-03-03 cs.CV 78%

Prune2Drive: A Plug-and-Play Framework for Accelerating Vision-Language Models in Autonomous Driving

Prune2Drive: 一种用于自动驾驶中加速视觉-语言模型的即插即用框架

Minhao Xiong, Zichen Wen, Zhuangcheng Gu, Xuyang Liu, Rui Zhang, Hengrui Kang, Jiabing Yang, Junyuan Zhang, Weijia Li, Conghui He, Yafei Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Carnegie Mellon University(卡内基梅隆大学) Sichuan University(四川大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 Prune2Drive通过视觉令牌修剪框架在自动驾驶中加速视觉-语言模型,实现显著速度提升和内存节省,性能影响小。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02092 2026-03-03 cs.LG math.OC 77%

Adam Converges Without Any Modification On Update Rules

Adam在更新规则上无需任何修改即可收敛

Yushun Zhang, Bingran Li, Congliang Chen, Zhi-Quan Luo, Ruoyu Sun

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究证明Adam在适当的问题依赖超参数下可收敛,并揭示了Adam在不同超参数组合下的相变特性,为优化器调参提供了理论依据。

Comments 66 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01639 2026-03-03 cs.CL 77%

Learning to Draft: Adaptive Speculative Decoding with Reinforcement Learning

学习草稿:基于强化学习的自适应推测解码

Jiebin Zhang, Zhenghan Yu, Liang Wang, Nan Yang, Eugene J. Yu, Zheng Li, Yifan Song, Dawei Zhu, Xingxing Zhang, Furu Wei, Sujian Li

机构 * National Key Laboratory for Multimedia Information Processing, Peking University(多媒体信息处理国家级重点实验室,北京大学) School of Computer Science, Peking University(计算机科学学院,北京大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LTD通过强化学习优化草稿-验证循环的吞吐量,实现比现有方法更高的解码效率。

Comments 22pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01399 2026-03-03 cs.DC cs.LG 77%

Quasar: Quantized Self-Speculative Acceleration for Rapid Inference via Memory-Efficient Verification

Quasar:量化自我推测加速以通过内存高效验证实现快速推理

Guang Huang, Zeyi Wen

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Quasar通过低比特量化技术提升验证阶段效率,实现快速推理的内存高效加速

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01376 2026-03-03 cs.LG stat.ML 77%

3BASiL: An Algorithmic Framework for Sparse plus Low-Rank Compression of LLMs

3BASiL: 一种用于大型语言模型稀疏加低秩压缩的算法框架

Mehdi Makni, Xiang Meng, Rahul Mazumder

机构 * Operations Research Center(运筹学研究中心) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 3BASiL-TM提出了一种高效的单次后训练方法,用于LLMs的稀疏加低秩分解,显著提升了压缩效果和效率。

Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01104 2026-03-03 cs.HC cs.AI cs.CV cs.CY 77%

Egocentric Co-Pilot: Web-Native Smart-Glasses Agents for Assistive Egocentric AI

第一人称共驾:面向辅助第一人称AI的网页原生智能眼镜代理

Sicheng Yang, Yukai Huang, Weitong Cai, Shitong Sun, Fengyi Fang, You He, Yiqiao Xie, Jiankang Deng, Hang Zhang, Jifei Song, Zhensong Zhang

机构 * Shenzhen International Graduate School Tsinghua University Shenzhen China(深圳国际研究生院清华大学深圳中国) Independent Researcher London United Kingdom(独立研究者伦敦英国) Queen Mary University of London London United Kingdom(女王玛丽大学伦敦英国) Imperial College London London United Kingdom(帝国理工学院伦敦英国) University Of Surrey Guildford United Kingdom(Surrey大学Guildford英国)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Egocentric Co-Pilot通过网页原生智能眼镜代理实现第一人称AI的持续辅助,结合神经符号框架和多模态意图层,展示了在日常生活中提升可及性和情境感知的实用路径。

Comments 14 pages, 6 figures, WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17702 2026-03-03 cs.CV cs.AI 77%

Seek-CAD: A Self-refined Generative Modeling for 3D Parametric CAD Using Local Inference via DeepSeek

Seek-CAD: 一种基于局部推理的自优化生成模型用于3D参数化CAD设计

Xueyang Li, Jiahao Li, Yu Song, Yunzhong Lou, Xiangdong Zhou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Seek-CAD通过结合视觉和链式思维反馈,利用本地开源模型生成3D参数化CAD模型,提升生成效率和实用性。

Comments Accepted to ICLR 2026. The datatset has been released publicly and can be acessed in https://github.com/Sunny-Hack/Seek-CAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17691 2026-03-03 cs.SE cs.AI cs.CR cs.LG cs.PL 76%

CASCADE: LLM-Powered JavaScript Deobfuscator at Google

CASCADE:谷歌的LLM驱动JavaScript去混淆工具

Shan Jiang, Pranoy Kovuri, David Tao, Zhixun Tan

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google(谷歌)

专题命中 效率与部署 :LLM(title);分类 cs.AI、cs.LG

AI总结 CASCADE是一种结合Gemini和JSIR的新型JavaScript去混淆工具,通过识别关键函数和转换代码以恢复原始语义,提升去混淆效率并减少逆向工程工作量。

Comments To appear in 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE-SEIP '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02075 2026-03-03 cs.DC 75%

Trident: Adaptive Scheduling for Heterogeneous Multimodal Data Pipelines

Trident:异构多模态数据流水线的自适应调度

Ding Pan, Zhuangzhuang Zhou, Long Qian, Binhang Yuan

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 Trident通过自适应调度框架提升异构多模态数据流水线的吞吐量,优化资源分配与配置转换,降低内存不足风险。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11332 2026-03-03 cs.DC cs.MA 75%

UFO3: Weaving the Digital Agent Galaxy

UFO3:编织数字代理银河

Chaoyun Zhang, Liqun Li, He Huang, Chiming Ni, Bo Qiao, Si Qin, Yu Kang, Minghua Ma, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 UFO3通过统一异构设备,实现高效且健壮的任务编排,提升跨设备协作与智能整合。

Comments We developed UFO$^3$ as a fully engineered system with over 73K lines of code, encompassing agent implementations and integrations for Windows, Linux, and Android mobile devices. The entire project is open-sourced at https://github.com/microsoft/UFO/, accompanied by detailed documentation and tutorials at https://microsoft.github.io/UFO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07530 2026-03-03 cs.RO cs.CV 75%

BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation

BitVLA:用于机器人操作的1位视觉-语言-动作模型

Hongyu Wang, Chuyan Xiong, Ruiping Wang, Xilin Chen

机构 * Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(人工智能安全重点实验室,计算技术研究所,中国科学院,中国科学院大学)

专题命中 效率与部署 :LLM(abstract);pretraining(abstract);post-training(abstract)

AI总结 BitVLA是一种用于机器人操作的1位视觉-语言-动作模型,通过模型设计和优化提升部署效率,实现内存和延迟的显著降低。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16953 2026-03-03 cs.CV 75%

Towards Real Zero-Shot Camouflaged Object Segmentation without Camouflaged Annotations

面向无遮蔽标注的零样本遮蔽物分割

Cheng Lei, Jie Fan, Xinran Li, Tianzhu Xiang, Ao Li, Ce Zhu, Le Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Space42

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种无需遮蔽标注的零样本遮蔽物分割框架,通过结合MIM、M-LLM和MFA机制,实现高效分割与快速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12635 2026-03-03 cs.CL cs.AI cs.LG 75%

Unleashing Low-Bit Inference on Ascend NPUs: A Comprehensive Evaluation of HiFloat Formats

释放Ascend NPUs上的低比特推理:HiFloat格式的全面评估

Pengxiang Zhao, Hui-Ling Zhen, Xing Li, Han Bao, Weizhe Lin, Zhiyuan Yang, Manyi Zhang, Yuanyong Luo, Ziwei Yu, Xin Wang, Mingxuan Yuan, Xianzhi Yu, Zhenhua Dong

机构 * Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 效率与部署 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文评估了HiFloat格式在Ascend NPUs上的低比特推理性能,揭示了不同格式在精度、效率及兼容性方面的关键差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18866 2026-03-03 cs.CL cs.AI cs.CV cs.LG cs.MA 75%

LightMem: Lightweight and Efficient Memory-Augmented Generation

LightMem: 轻量级和高效的内存增强生成

Jizhan Fang, Xinle Deng, Haoming Xu, Ziyan Jiang, Yuqi Tang, Ziwen Xu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) State Key Lab. for Novel Software Technology, Nanjing University, P.R. China(南京大学软件新技术国家重点实验室,中国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LightMem通过三阶段内存系统提升LLM在动态环境中的效率和性能,实现问答准确率提升和token使用减少。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22283 2026-03-03 cs.CV 75%

Rethinking Visual Token Reduction in LVLMs Under Cross-Modal Misalignment

重新审视在跨模态不匹配下的LVLMs视觉标记减少

Rui Xu, Yunke Wang, Yong Luo, Bo Du

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出VisionDrop方法,通过视觉-only修剪框架减少LVLMs中的视觉标记,无需额外训练,提升推理效率并保持性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01907 2026-03-03 cs.LG cs.CL 73%

Efficient RLVR Training via Weighted Mutual Information Data Selection

通过加权互信息数据选择实现高效的RLVR训练

Xinyu Zhou, Boyu Zhu, Haotian Zhang, Huiming Wang, Zhijiang Guo

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 InSight通过加权互信息数据选择方法提升RLVR训练效率,实现性能和加速的显著提升。

Comments 15 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14760 2026-03-03 cs.CL cs.AI 73%

Residual Connections and the Causal Shift: Uncovering a Structural Misalignment in Transformers

残差连接与因果偏移:揭示变换器中的结构性不一致

Jonathan Lys, Vincent Gripon, Bastien Pasdeloup, Axel Marmoret, Lukas Mauch, Fabien Cardinaux, Ghouthi Boukli Hacene

机构 * IMT Atlantique, Lab-STICC, UMR CNRS 6285, Brest, France(IMT Atlantique,Lab-STICC,CNRS 6285研究所,布列塔尼,法国) Sony Europe Ltd. Stuttgart Technology Center, EUREC, Germany(索尼欧洲有限公司,斯图加特技术中心,EUREC,德国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示了自回归变换器中残差连接与因果偏移的结构性不一致,并提出基于残差衰减的轻量级缓解方法,通过实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14513 2026-03-03 cs.HC cs.AI cs.LG 73%

State Your Intention to Steer Your Attention: An AI Assistant for Intentional Digital Living

阐明意图以引导你的注意力:一种用于有意数字生活的AI助手

Juheon Choi, Juyong Lee, Jian Kim, Chanyoung Kim, Taywon Min, W. Bradley Knox, Min Kyung Lee, Kimin Lee

机构 * Yonsei University(延世大学) Computer Science, University of Texas at Austin(德克萨斯大学计算机科学系) School of Information, University of Texas at Austin(德克萨斯大学信息学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于AI的助手,通过分析用户意图和行为偏差,帮助用户保持专注并使数字行为与意图一致。

Comments Accepted to CHI 2026. 29 pages. Added Related Work, Discussion, and Acknowledgments

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13648 2026-03-03 cs.CL cs.AI 73%

SimpleToM: Exposing the Gap between Explicit ToM Inference and Implicit ToM Application in LLMs

SimpleToM:揭示LLM中显式ToM推理与隐式ToM应用之间的差距

Yuling Gu, Oyvind Tafjord, Hyunwoo Kim, Jared Moore, Ronan Le Bras, Peter Clark, Yejin Choi

机构 * Allen Institute for AI(艾伦人工智能研究所) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SimpleToM通过多层级ToM推理和日常场景测试,揭示LLM在显式心理状态推理与隐式应用之间的能力差距。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04786 2026-03-03 cs.LG cs.AI 73%

AgentOCR: Reimagining Agent History via Optical Self-Compression

AgentOCR: 通过光学自压缩重新想象代理历史

Lang Feng, Fuchao Yang, Feng Chen, Xin Cheng, Haiyang Xu, Zhenglin Wan, Ming Yan, Bo An

机构 * NTU(国立科技大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 AgentOCR通过光学自压缩技术,将代理历史转换为紧凑图像,从而在保持性能的同时显著减少token消耗和内存使用。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21314 2026-03-03 cs.LG cs.AI stat.ML 73%

A Convergence Analysis of Adaptive Optimizers under Floating-point Quantization

自适应优化器在浮点量化下的收敛性分析

Xuan Tang, Jichu Li, Difan Zou

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出理论框架分析自适应优化器在浮点量化下的收敛性,揭示Adam和Muon在不同量化下的表现差异,通过实验验证理论结果。

Comments 68 pages, 13 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16056 2026-03-03 cs.LG cs.AI 73%

Not All Models Suit Expert Offloading: On Local Routing Consistency of Mixture-of-Expert Models

并非所有模型都适合专家卸载:混合专家模型的局部路由一致性

Jingcong Liang, Siyuan Wang, Miren Tian, Yitong Li, Duyu Tang, Zhongyu Wei

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出两个指标衡量混合专家模型的局部路由一致性,发现局部路由一致性与局部负载平衡存在权衡,而全局负载平衡可共存,并揭示领域专用专家对路由一致性贡献更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00031 2026-03-03 cs.CL cs.LG 73%

GRIP: Geometric Refinement and Adaptive Information Potential for Data Efficiency

GRIP:几何细化与自适应信息潜力用于数据效率

Changhao Wang, Jiaolong Yang, Xinhao Yao, Yunfei Yu, Peng Jiao, Lu Yu, Junpeng Fang, Riccardo Cantoro, Qing Cui, Jun Zhou

机构 * Politecnico di Torino(托斯托大学) Ant Group(蚂蚁集团) Renmin University of China(中国人民大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 GRIP通过几何细化和自适应信息潜力提升数据效率,优于现有基线方法,超越更大数据集的模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01784 2026-03-03 cs.CR cs.AI 70%

Co-Evolutionary Multi-Modal Alignment via Structured Adversarial Evolution

基于结构对抗进化的多模态对齐

Guoxin Shi, Haoyu Wang, Zaihui Yang, Yuxing Wang, Yongzhe Chang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CEMA框架,通过共进化对抗提升多模态对齐的鲁棒性和安全性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01486 2026-03-03 cs.AI 70%

Agentic Multi-Source Grounding for Enhanced Query Intent Understanding: A DoorDash Case Study

代理多源接地以增强查询意图理解:一个DoorDash案例研究

Emmanuel Aboah Boateng, Kyle MacDonald, Akshad Viswanathan, Sudeep Das

机构 * DoorDash, Inc.(DoorDash公司)

专题命中 效率与部署 :LLM(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出一种代理多源接地系统,通过目录检索和网络搜索结合,提升多意图查询的准确率,已在DoorDash实现90.7%的准确率提升。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22286 2026-03-03 cs.LG cs.IT math.IT 70%

OmniZip: Learning a Unified and Lightweight Lossless Compressor for Multi-Modal Data

OmniZip: 一种用于多模态数据的统一且轻量级无损压缩器

Yan Zhao, Zhengxue Cheng, Junxuan Zhang, Dajiang Zhou, Qunshan Gu, Qi Wang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 OmniZip是一种用于多模态数据的统一且轻量级无损压缩器,通过三种关键组件实现高效压缩,并在多个数据集上实现了更高的压缩效率。

Comments 8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12660 2026-03-03 cs.CL 70%

Learning Ordinal Probabilistic Reward from Preferences

从偏好中学习序概率奖励

Longze Chen, Lu Wang, Renke Shan, Ze Gong, Run Luo, Jiaming Li, Jing Luo, Qiyao Wang, Min Yang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Ritzz-AI Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出序概率奖励模型,通过区域淹没微调提升奖励模型的准确性和数据效率,有效捕捉绝对文本质量。

Comments 28 pages, 5 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏