arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-26 至 2026-02-26 共收录 204 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 15 篇

2602.21485 2026-02-26 cs.CL cs.HC 88%

Evaluating the Usage of African-American Vernacular English in Large Language Models

评估大型语言模型中非裔美国人俚语英语的使用情况

Deja Dunlap, R. Thomas McCoy

机构 * Yale University(耶鲁大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究评估了大型语言模型对非裔美国人俚语英语的表示准确性,发现模型在语法使用上存在偏差,并复制了刻板印象,需改进训练数据和公平性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00062 2026-02-26 cs.CV cs.AI cs.LG cs.RO 86%

World Simulation with Video Foundation Models for Physical AI

基于视频基础模型的世界模拟用于物理AI

NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Jenna Diamond, Yifan Ding, Jiaojiao Fan, Linxi Fan, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Zekun Hao, Jacob Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Pham, Morteza Ramezanali, Fitsum Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne Tchapmi, Wei-Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Dinghao Yang, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew Zhu, Yuke Zhu

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 Cosmos-Predict2.5和Cosmos-Transfer2.5通过统一生成和增强的模拟能力,推动物理AI领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01077 2026-02-26 cs.NE 85%

Zero-Shot Document-Level Biomedical Relation Extraction via Scenario-based Prompt Design in Two-Stage with LLM

零样本文档级生物医学关系抽取:基于场景的提示设计的两阶段方法与大语言模型

Lei Zhao, Ling Kang, Quan Guo

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出一种基于场景的提示设计的两阶段方法,利用通用LLMs在降低硬件和劳动力成本的同时实现文档级生物医学关系抽取的高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11910 2026-02-26 cs.CV 82%

Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models

看清森林与树木:面向长视频多模态语言模型的查询感知分词器

Siyou Li, Huanan Wu, Juexi Shao, Yinghao Ma, Yujian Gan, Yihao Luo, Yuwei Wang, Dong Nie, Lu Wang, Wenqing Wu, Le Zhang, Massimo Poesio, Juntao Yu

机构 * Queen Mary University of London(伦敦女王学院) University of Sheffield(谢菲尔德大学) Imperial College London(伦敦帝国学院) Pengcheng Laboratory(鹏城实验室) Meta Inc(Meta公司) Meituan Inc(美团公司) Nanjing University of Science(南京理工大学) University of Birmingham(伯明翰大学) Utrecht University(乌得勒支大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract)

AI总结 QTSplus是一种轻量高效的视觉token选择模块,通过动态选择重要视觉证据提升长视频多模态语言模型的性能,显著降低计算成本并提高处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06657 2026-02-26 cs.CV cs.AI cs.CL cs.LG 82%

Renaissance: Investigating the Pretraining of Vision-Language Encoders

文艺复兴:探究视觉语言编码器的预训练

Clayton Fields, Casey Kennington

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 文艺复兴通过元分析探究视觉语言编码器预训练的最佳实践,展示冻结大部分模型可节省计算资源,同时探讨基于视觉或文本模型构建变压器的影响。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22037 2026-02-26 cs.CL cs.LG 81%

ATLAS: Adaptive Transfer Scaling Laws for Multilingual Pretraining, Finetuning, and Decoding the Curse of Multilinguality

ATLAS:适应性迁移缩放定律用于多语言预训练、微调和解码的多语言诅咒

Shayne Longpre, Sneha Kudugunta, Niklas Muennighoff, I-Hung Hsu, Isaac Caswell, Alex Pentland, Sercan Arik, Chen-Yu Lee, Sayna Ebrahimi

机构 * MIT(麻省理工学院) University of Washington(华盛顿大学) Stanford University(斯坦福大学) Google Cloud AI(谷歌云人工智能) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG

AI总结 ATLAS提出了一种适应性迁移缩放定律,用于多语言预训练、微调和解码,解决了多语言学习中的性能瓶颈和计算优化问题。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07452 2026-02-26 cs.LG cs.AI cs.CL cs.CY 80%

When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment

当风格破坏安全性:防御大语言模型对抗浅层风格对齐

Yuxin Xiao, Sana Tonekaboni, Walter Gerych, Vinith Suriyakumar, Marzyeh Ghassemi

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了风格对齐对大语言模型安全性的影响,提出 SafeStyle 防御策略有效缓解了浅层风格对齐带来的风险。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22143 2026-02-26 cs.CV 78%

MedTri: A Platform for Structured Medical Report Normalization to Enhance Vision-Language Pretraining

MedTri:一种用于结构化医学报告标准化以增强视觉-语言预训练的平台

Yuetan Chu, Xinhua Ma, Xinran Jin, Gongning Luo, Xin Gao

机构 * King Abdullah University of Science and Technology (KAUST)(卡塔尔国王科技大学) Faculty of Computing, Harbin, China(哈尔滨计算学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 MedTri通过结构化医学报告标准化提升视觉-语言预训练效果,提供统一三元组格式并支持模块化增强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21736 2026-02-26 cs.RO 78%

Joint-Aligned Latent Action: Towards Scalable VLA Pretraining in the Wild

联合对齐的潜在动作:迈向大规模野外VLA预训练

Hao Luo, Ye Wang, Wanpeng Zhang, Haoqi Yuan, Yicheng Feng, Haiweng Xu, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 JALA通过联合对齐的潜在动作预训练框架,提升从人类数据中大规模预训练视觉-语言-动作模型的效率与性能。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21669 2026-02-26 cs.CL 70%

DWA-KD: Dual-Space Weighting and Time-Warped Alignment for Cross-Tokenizer Knowledge Distillation

DWA-KD:双空间加权与时间扭曲对齐用于跨分词器知识蒸馏

Duc Trung Vu, Pham Khanh Chi, Dat Phi Van, Linh Ngo Van, Sang Dinh, Trung Le

机构 * Hanoi University of Science and Technology(河内科学技术大学) University of Monash(莫纳什大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DWA-KD通过双空间加权和时间扭曲对齐提升跨分词器知识蒸馏效果,实现更精确的词级和序列级对齐。

Comments EACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22176 2026-02-26 cs.CV 67%

Mixed Magnification Aggregation for Generalizable Region-Level Representations in Computational Pathology

混合放大聚合用于计算病理学中的通用区域级表示

Eric Zimmermann, Julian Viret, Michal Zelechowski, James Brian Hall, Neil Tenenholtz, Adam Casson, George Shaikovski, Eugene Vorontsov, Siqi Liu, Kristen A Severson

机构 * Microsoft Research(微软研究院) Paige

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文提出混合放大聚合编码器,通过多分辨率特征捕捉提升计算病理学中区域级表示的通用性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21543 2026-02-26 cs.CL cs.AI cs.IR 62%

Enhancing Multilingual Embeddings via Multi-Way Parallel Text Alignment

通过多方向平行文本对齐增强多语言嵌入

Barah Fazili, Koustava Goswami

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 通过多方向平行文本对齐提升多语言嵌入,增强跨语言表示性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21824 2026-02-26 cs.LG 57%

DocDjinn: Controllable Synthetic Document Generation with VLMs and Handwriting Diffusion

DocDjinn: 基于VLMs和手写扩散的可控合成文档生成

Marcel Lamott, Saifullah Saifullah, Nauman Riaz, Yves-Noel Weweler, Tobias Alt-Veit, Ahmad Sarmad Ali, Muhammad Armaghan Shakir, Adrian Kalwa, Momina Moetesum, Andreas Dengel, Sheraz Ahmed, Faisal Shafait, Ulrich Schwanecke, Adrian Ulges

机构 * RheinMain University of Applied Sciences(莱茵-美因应用科学大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) DeepReader GmbH(DeepReader公司) Insiders Technologies GmbH(Insiders Technologies公司) National University of Sciences and Technology(国家科学与技术大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 DocDjinn利用VLMs和手写扩散生成可控合成文档,通过聚类和参数化采样从未标注种子生成高质量标注文档,实现隐私保护和高效数据生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11791 2026-02-26 cs.RO cs.LG 57%

Synthetic vs. Real Training Data for Visual Navigation

仿真与真实训练数据用于视觉导航

Lauri Suomela, Sasanka Kuruppu Arachchige, German F. Torres, Harry Edelman, Joni-Kristian Kämäräinen

机构 * Tampere University(塔尔基尔大学) Turku University of Applied Sciences(图尔库应用科学大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种基于预训练视觉表示的导航策略,通过仿真训练提升了视觉导航性能,实验表明其在导航成功率上优于真实数据训练和现有方法。

Comments ICRA2026 Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22131 2026-02-26 cs.HC 50%

Giving Meaning to Movements: Challenges and Opportunities in Expanding Communication by Pairing Unaided AAC with Speech Generated Messages

为动作赋予意义:通过将无辅助AAC与语音生成信息结合扩展沟通的挑战与机遇

Imran Kabir, Sharon Ann Redmon, Lynn R Elko, Kevin Williams, Mitchell A Case, Dawn J Sowers, Krista Wilkinson, Syed Masum Billah

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出AllyAAC系统,通过结合无辅助AAC与语音生成信息,解决个性化肢体动作识别挑战,提升沟通效率与可理解性。

Comments To appear in Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 9 篇

2602.22124 2026-02-26 cs.SE cs.AI cs.CL cs.LG 91%

SWE-Protégé: Learning to Selectively Collaborate With an Expert Unlocks Small Language Models as Software Engineering Agents

SWE-Protégé: 通过选择性协作专家解锁小型语言模型作为软件工程代理

Patrick Tser Jern Kon, Archana Pradeep, Ang Chen, Alexander P. Ellis, Warren Hunt, Zijian Wang, John Yang, Samuel Thompson

机构 * Meta University of Michigan(密歇根大学) Stanford University(斯坦福大学)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);SLM(abstract);post-training(abstract)

AI总结 SWE-Protégé通过选择性协作专家,使小型语言模型在软件工程任务中取得显著提升,实现42.4%的Pass@1成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21223 2026-02-26 cs.CL cs.AI 88%

Measuring Pragmatic Influence in Large Language Model Instructions

在大型语言模型指令中测量隐含影响

Yilin Geng, Omri Abend, Eduard Hovy, Lea Frermann

机构 * University of Melbourne(墨尔本大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种框架分解和分类方法,系统测量大型语言模型指令中的隐含影响,揭示了框架对指令优先级的可预测影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06060 2026-02-26 cs.CL cs.AI 88%

Simple Yet Effective: Extracting Private Data Across Clients in Federated Fine-Tuning of Large Language Models

简单而有效的:在联邦微调大型语言模型中提取客户端私有数据

Yingqi Hu, Zhuo Zhang, Jingyuan Zhang, Jinghua Wang, Qifan Wang, Lizhen Qu, Zenglin Xu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Kuaishou Technology(快手科技) Meta AI Monash University(墨尔本大学) Fudan University(复旦大学) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出三种简单有效的方法,用于在联邦微调大型语言模型中提取客户端私有数据,揭示了FedLLMs中的隐私风险并建立了评估框架。

Comments IJCNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01617 2026-02-26 cs.CV 75%

LLaDA-MedV: Exploring Large Language Diffusion Models for Biomedical Image Understanding

LLaDA-MedV:探索大规模语言扩散模型用于生物医学图像理解

Xuanzhao Dong, Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Peijie Qiu, Shao Tang, Xin Li, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) LinkedIn Corporation(领英公司) Washington University in St. Louis(圣路易斯华盛顿大学) Morgan Stanley(摩根大通)

专题命中 指令微调 :LLM(abstract);language model(abstract);instruction tuning(abstract)

AI总结 LLaDA-MedV通过视觉指令微调,首次在生物医学图像理解中应用大规模语言扩散模型,实现了在生物医学视觉对话任务中的性能提升,并在多个VQA基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21222 2026-02-26 cs.CL cs.AI cs.LG 75%

Task-Aware LoRA Adapter Composition via Similarity Retrieval in Vector Databases

基于向量数据库相似性检索的任务感知LoRA适配器组合

Riya Adsul, Balachandra Devarangadi Sunil, Isha Nalawade, Sudharshan Govindan

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于向量数据库相似性检索的LoRA适配器组合框架,通过动态合并适配器实现多任务学习,线性合并方法在PIQA和RTE任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21420 2026-02-26 cs.LG cs.AI 73%

Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning

过度自信的错误需要更强的纠正:强化学习中的非对称置信度惩罚

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang

机构 * LinkedIn Corporation(领英公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非对称置信度感知错误惩罚(ACE)以解决强化学习中过度自信错误的问题,通过动态调节负优势提升模型推理能力与生成多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17306 2026-02-26 cs.CL 70%

Refusal Direction is Universal Across Safety-Aligned Languages

拒绝方向在安全对齐语言中是普遍的

Xinpeng Wang, Mingyang Wang, Yihong Liu, Hinrich Schütze, Barbara Plank

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了多语言LLMs中拒绝方向的跨语言普遍性,发现英文提取的向量可有效绕过其他语言的拒绝,揭示了跨语言安全机制的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21716 2026-02-26 cs.CV 67%

TranX-Adapter: Bridging Artifacts and Semantics within MLLMs for Robust AI-generated Image Detection

TranX-Adapter: 在MLLMs中弥合artifact与语义以实现鲁棒的AI生成图像检测

Wenbin Wang, Yuge Huang, Jianqing Xu, Yue Yu, Jiangtao Yan, Shouhong Ding, Pan Zhou, Yong Luo

机构 * Wuhan University(武汉大学) Tencent YouTu Lab(腾讯YouTu实验室) Singapore Management University(新加坡管理学院)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 TranX-Adapter通过引入任务感知的最优传输融合和X-Fusion机制,在MLLMs中提升AI生成图像检测的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10082 2026-02-26 cs.CV 50%

LoRA-Edit: Controllable First-Frame-Guided Video Editing via Mask-Aware LoRA Fine-Tuning

LoRA-Edit: 通过掩码感知LoRA微调实现可控的第一帧引导视频编辑

Chenjian Gao, Lihe Ding, Xin Cai, Zhanpeng Huang, Zibin Wang, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) SenseTime Research(商汤科技研究院)

专题命中 指令微调 :pretraining(abstract)

AI总结 LoRA-Edit通过时空掩码引导LoRA微调,实现对视频编辑全过程的可控编辑,支持生成动态变化的视频内容。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 10 篇

2602.21728 2026-02-26 cs.CL 89%

Explore-on-Graph: Incentivizing Autonomous Exploration of Large Language Models on Knowledge Graphs with Path-refined Reward Modeling

在知识图谱上探索:通过路径细化奖励建模激励大语言模型自主探索

Shiqi Yan, Yubo Chen, Ruiqi Zhou, Zhengxi Yao, Shuai Chen, Tianyi Zhang, Shijie Zhang, Wei Qiang Zhang, Yongfeng Huang, Haixin Duan, Yunqi Zhang

机构 * Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国) Institute for Network Sciences and Cyberspace, Tsinghua University, Beijing, China(网络科学与网络空间研究院,清华大学,北京,中国) Ant International, Ant Group, Hangzhou, Zhejiang, China(蚂蚁集团,杭州,浙江,中国)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出Explore-on-Graph框架,通过强化学习和路径细化奖励建模,使大语言模型在知识图谱上自主探索更广泛的推理空间,实现对分布外推理问题的高效泛化。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21346 2026-02-26 cs.CL cs.AI 87%

Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment

基于对齐的DPO:一种原则性的推理方法以提高安全性对齐

Mengxuan Hu, Vivek V. Datla, Anoop Kumar, Zihan Guan, Sheng Li, Alfy Samuel, Daben Liu

机构 * University of Virginia(弗吉尼亚大学) Capital One

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文提出基于对齐的DPO方法,通过引入推理意识的后训练和对齐加权机制,提升大语言模型的安全性对齐鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20718 2026-02-26 cs.LG cs.AI cs.CL 87%

Stabilizing Off-Policy Training for Long-Horizon LLM Agent via Turn-Level Importance Sampling and Clipping-Triggered Normalization

通过回合级重要性采样和触发式归一化稳定长时程LLM代理的离策略训练

Chenliang Li, Adel Elmahdy, Alex Boyd, Zhongruo Wang, Siliang Zeng, Alfredo Garcia, Parminder Bhatia, Taha Kass-Hout, Cao Xiao, Mingyi Hong

机构 * Texas A&M University(德克萨斯A&M大学) GE HealthCare(通用电气医疗) University of Minnesota(明尼苏达大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SORL通过回合级重要性采样和触发式归一化稳定长时程LLM代理的离策略训练,减少梯度方差并防止优化崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22146 2026-02-26 cs.LG cs.AI 86%

Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual

多目标安全大语言模型对齐的可证明最终迭代收敛性:基于乐观对偶算法

Yining Li, Peizhong Ju, Ness Shroff

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出了一种乐观对偶算法,用于多目标安全大语言模型对齐,解决了传统方法在最终迭代中的不稳定问题,并证明了该算法的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21765 2026-02-26 cs.LG cs.AI stat.ML 86%

Generalisation of RLHF under Reward Shift and Clipped KL Regularisation

基于奖励偏移和截断KL正则化的RLHF泛化

Kenton Tang, Yuzhu Chen, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于奖励偏移和截断KL正则化的RLHF泛化理论,分析了奖励偏移和KL截断对泛化误差的影响,并给出了优化KL截断阈值和预算分配的实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21461 2026-02-26 cs.CL 83%

VecGlypher: Unified Vector Glyph Generation with Language Models

VecGlypher: 一种基于语言模型的统一向量图形单元生成方法

Xiaoke Huang, Bhavul Gauri, Kam Woh Ng, Tony Ng, Mengmeng Xu, Zhiheng Liu, Weiming Ren, Zhaochong An, Zijian Zhou, Haonan Qiu, Yuyin Zhou, Sen He, Ziheng Wang, Tao Xiang, Xiao Han

机构 * Meta AI

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 VecGlypher通过多模态语言模型直接生成高质量向量图形,无需位图中间步骤,显著提升字体创建效率和可编辑性。

Comments Accepted to CVPR'26. Project page: https://xk-huang.github.io/VecGlypher/

详情

展开后加载摘要…

URL PDF HTML 收藏