arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-27 至 2026-02-27 共收录 213 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 16 篇

2602.22760 2026-02-27 cs.DC cs.AI 89%

Distributed LLM Pretraining During Renewable Curtailment Windows: A Feasibility Study

分布式LLM预训练期间可再生能源削减窗口:可行性研究

Philipp Wiesner, Soeren Becker, Brett Cornick, Dominik Scheinert, Alexander Acker, Odej Kao

机构 * TU Berlin(柏林技术大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title);large language model(abstract);language model(abstract)

AI总结 本研究探讨在可再生能源削减窗口期间利用清洁廉价电力进行分布式LLM预训练的可行性,通过联邦学习框架实现跨地理分布集群的弹性训练,降低碳排放。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17562 2026-02-27 cs.CV 89%

Visual Instruction Pretraining for Domain-Specific Foundation Models

面向领域特定基础模型的视觉指令预训练

Yuxuan Li, Yicheng Zhang, Wenhao Tang, Yimian Dai, Ming-Ming Cheng, Xiang Li, Jian Yang

机构 * PCA Lab, VCIP, Computer Science, NKU, Tianjin, China(PCA实验室、VCIP、计算机科学、NKU、天津,中国) NKIARI, Futian, Shenzhen, China(NKIARI、福田、深圳,中国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);language model(abstract)

AI总结 本文提出ViTP,通过视觉指令预训练提升领域特定基础模型的感知与推理能力,在多个遥感和医学影像任务中取得新的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22557 2026-02-27 cs.AI cs.LG 84%

CourtGuard: A Model-Agnostic Framework for Zero-Shot Policy Adaptation in LLM Safety

CourtGuard:一种用于大语言模型安全的模型无关框架,用于零样本策略适应

Umid Suleymanov, Rufiz Bayramov, Suad Gafarli, Seljan Musayeva, Taghi Mammadov, Aynur Akhundlu, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系) School of IT(信息技术学院) Engineering, ADA University(工程学院,ADA大学) School of Law, ADA University(法学院,ADA大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CourtGuard通过证据辩论框架实现大语言模型的安全零样本适应,超越传统方法在多个安全基准测试中的表现,并具备跨领域泛化和自动数据审计能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22879 2026-02-27 cs.AI 83%

Towards LLM-Empowered Knowledge Tracing via LLM-Student Hierarchical Behavior Alignment in Hyperbolic Space

基于大语言模型的知识追踪:通过超几何空间中的LLM-学生层次行为对齐

Xingcheng Fu, Shengpeng Wang, Yisen Gao, Xianxian Li, Chunpei Li, Qingyun Sun, Dongran Yu

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出L-HAKT框架,通过超几何空间中的层次行为对齐,提升知识追踪对认知状态层次演化和个性化问题难度感知的建模能力。

Comments 9 pages, 6 figures, Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07452 2026-02-27 cs.CR cs.CL 79%

PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing

PATCH: 通过隐私意识的针对性电路修补缓解语言模型中的PII泄露

Anthony Hughes, Vasisht Duddu, N. Asokan, Nikolaos Aletras, Ning Ma

机构 * University of Sheffield(谢菲尔德大学) University of Waterloo(滑铁卢大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 PATCH通过针对性电路修补减少语言模型中的PII泄露,实现更好的隐私-实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06491 2026-02-27 cs.CV cs.RO 78%

PPT: Pretraining with Pseudo-Labeled Trajectories for Motion Forecasting

PPT:基于伪标签轨迹的运动预测预训练

Yihong Xu, Yuan Yin, Éloi Zablocki, Tuan-Hung Vu, Alexandre Boulch, Matthieu Cord

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 PPT通过利用伪标签轨迹进行预训练,提升运动预测的泛化能力和在低数据环境下的性能。

Comments 8 pages, 6 figures, accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23057 2026-02-27 cs.CL cs.AI 73%

Affine-Scaled Attention: Towards Flexible and Stable Transformer Attention

仿射缩放注意力:迈向灵活且稳定的Transformer注意力

Jeongin Bae, Baeseong Park, Gunho Park, Minsub Kim, Joonhyung Lee, Junhee Yoo, Sunghyeon Woo, Jiwon Ryu, Se Jung Kwon, Dongsoo Lee

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 仿射缩放注意力通过引入输入依赖的缩放和偏置项,提升Transformer模型的训练稳定性与注意力行为控制能力。

Comments Preprint. 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22223 2026-02-27 cs.IR cs.CL cs.LG 73%

SQaLe: A Large Text-to-SQL Corpus Grounded in Real Schemas

SQaLe:基于真实模式的大型文本到SQL语料库

Cornelius Wolff, Daniel Gomm, Madelon Hulsebos

机构 * Centrum Wiskunde & Informatica(荷兰数学与信息学研究中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 SQaLe是一个基于真实数据库模式的大型半合成文本到SQL数据集,通过结合模式采样、问题合成和SQL构建,生成了高质量的(问题,模式,查询)三元组,用于提升文本到SQL模型的泛化能力。

Comments Accepted at the AI for Tabular Data workshop at EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22765 2026-02-27 cs.CL 70%

Towards Better RL Training Data Utilization via Second-Order Rollout

通过二次回滚实现更好的RL训练数据利用

Zhe Yang, Yudong Wang, Rang Li, Zhifang Sui

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) ByteDance BandAI(字节跳动BandAI)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过二次回滚提升RL训练数据利用效率,联合训练生成与批判能力,实验表明在相同数据下性能更优,并揭示标签平衡与噪声问题的解决方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15210 2026-02-27 cs.LG 70%

ÜberWeb: Insights from Multilingual Curation for a 20-Trillion-Token Dataset

ÜberWeb: 多语言编纂对20万亿token数据集的洞察

DatologyAI, :, Aldo Gael Carranza, Kaleigh Mentzer, Ricardo Pio Monti, Alex Fang, Alvin Deng, Amro Abbas, Anshuman Suri, Brett Larsen, Cody Blakeney, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Haakon Mongstad, Haoli Yin, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Luke Merrick, Maximilian Böther, Parth Doshi, Paul Burstein, Pratyush Maini, Rishabh Adiga, Siddharth Joshi, Spandan Das, Tony Jiang, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 通过多语言数据编纂优化20万亿token数据集,显著提升多语言模型性能并降低计算需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08683 2026-02-27 cs.CV 67%

OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence

OneVision-Encoder: 编码对齐的稀疏性作为多模态智能的基础原则

Feilong Tang, Xiang An, Yunyao Yan, Yin Xie, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Chunyuan Li, Shikun Feng, Changrui Chen, Huajie Tan, Ming Hu, Manyuan Zhang, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

机构 * Glint Lab(Glint实验室) AIM for Health Lab(健康人工智能实验室) MVP Lab(MVP实验室)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract)

AI总结 OneVision-Encoder通过编码对齐的稀疏性原则,实现高效的多模态视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27566 2026-02-27 cs.IR 67%

Interact-RAG: Reason and Interact with the Corpus, Beyond Black-Box Retrieval

Interact-RAG: 基于语义交互的检索增强生成,超越黑盒检索

Yulong Hui, Chao Chen, Zhihang Fu, Yihao Liu, Jieping Ye, Huanchen Zhang

专题命中 预训练与数据 :LLM(abstract);SFT(abstract)

AI总结 Interact-RAG通过引入语义交互引擎,使LLM代理能够主动操控检索过程,从而提升复杂信息检索任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22481 2026-02-27 cs.CL cs.AI 62%

Sydney Telling Fables on AI and Humans: A Corpus Tracing Memetic Transfer of Persona between LLMs

悉尼在AI与人类之间讲述寓言:LLM间人设的语料追溯膜传

Jiří Milička, Hana Bednářová

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分析LLM生成的文本,探讨悉尼人设在AI与人类关系中的传播与影响,并构建了相关语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22865 2026-02-27 cs.CL 57%

Effective QA-driven Annotation of Predicate-Argument Relations Across Languages

跨语言有效的问题回答驱动的谓词-论元关系标注

Jonathan Davidov, Aviv Slobodkin, Shmuel Tomi Klein, Reut Tsarfaty, Ido Dagan, Ayal Klein

机构 * Bar-Ilan University(巴伊兰大学) Ariel University(阿里尔大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本文提出一种跨语言问题回答驱动的谓词-论元关系标注方法,通过重用英语QA-SRL解析器生成多语言高质量标注数据,提升语义解析效率。

Comments Accepted to EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23292 2026-02-27 cs.CV 50%

PGVMS: A Prompt-Guided Unified Framework for Virtual Multiplex IHC Staining with Pathological Semantic Learning

PGVMS: 一种基于提示的统一框架用于虚拟多色IHC染色与病理语义学习

Fuqiang Chen, Ranran Zhang, Wanming Hu, Deboch Eyob Abera, Yue Peng, Boyun Zheng, Yiwen Sun, Jing Cai, Wenjian Qin

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences and University of Chinese Academy of Sciences, Beijing, China(深圳先进技术研究院,中国科学院和中国科学院大学,北京,中国) Department of Pathology, Sun Yat-sen University Cancer Center, State Key Laboratory of Oncology in South China, Guangzhou, China(中山大学肿瘤中心病理科,南方肿瘤临床研究中心,广州,中国) Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学,香港特别行政区,中国) Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR 999077, China(电子工程系,香港中文大学,香港特别行政区,中国) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院,中国科学院,深圳,中国)

专题命中 预训练与数据 :language model(abstract)

AI总结 PGVMS提出了一种基于提示的统一框架,利用单染训练数据解决虚拟多色IHC染色中的语义指导、染色分布不一致和空间错位问题。

Comments Accepted by TMI

Journal ref IEEE Transactions on Medical Imaging, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22510 2026-02-27 cs.CV 50%

Pix2Key: Controllable Open-Vocabulary Retrieval with Semantic Decomposition and Self-Supervised Visual Dictionary Learning

Pix2Key: 通过语义分解和自监督视觉字典学习实现可控的开放词汇检索

Guoyizhe Wei, Yang Jiao, Nan Xi, Zhishen Huang, Jingjing Meng, Rama Chellappa, Yan Gao

机构 * Johns Hopkins University, Baltimore, US(约翰霍普金斯大学) Amazon.com, Seattle, US(亚马逊公司)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 Pix2Key通过语义分解和自监督视觉字典学习,实现可控的开放词汇检索,提升检索精度和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 20 篇

2510.06008 2026-02-27 cs.CV cs.AI 89%

Detection and Measurement of Hailstones with Multimodal Large Language Models

利用多模态大语言模型检测和测量冰雹

Moritz Alker, David C. Schedl, Andreas Stöckl

机构 * Digital Media Lab University of Applied Sciences Upper Austria(数字媒体实验室 上奥地利应用科学大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 利用多模态大语言模型检测和测量冰雹,通过社交媒体图像实现快速评估

Comments 6 pages, 5 figures, accepted at The 2nd International Conference on Electrical and Computer Engineering Researches

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22475 2026-02-27 cs.CL 88%

Mind the Gap in Cultural Alignment: Task-Aware Culture Management for Large Language Models

注意文化契合差距:面向任务的文化管理用于大语言模型

Binchi Zhang, Xujiang Zhao, Jundong Li, Haifeng Chen, Zhengzhang Chen

机构 * University of Virginia(弗吉尼亚大学) NEC Laboratories America(NEC美洲实验室)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出CultureManager,一种面向任务的文化管理方法,通过任务感知的文化数据对齐和文化路由器管理,提升大语言模型在文化敏感任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22368 2026-02-27 cs.SE cs.AI 85%

EyeLayer: Integrating Human Attention Patterns into LLM-Based Code Summarization

EyeLayer:将人类注意力模式整合到基于LLM的代码摘要中

Jiahao Zhang, Yifan Zhang, Kevin Leach, Yu Huang

机构 * Vanderbilt University(范德比尔特大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EyeLayer通过整合人类眼动模式提升LLM代码摘要效果,实现13.17%的BLEU-4提升。

Comments Accepted at the 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026), April 12-13, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10497 2026-02-27 cs.CV 82%

MERGETUNE: Continued Fine-Tuning of Vision-Language Models

MERGETUNE: 视觉-语言模型的持续微调

Wenqing Wang, Da Li, Xiatian Zhu, Josef Kittler

机构 * University of Surrey(萨里大学) Samsung AI Centre Cambridge(三星AI研究中心(剑桥)) Queen Mary University of London(伦敦大学女王学院)

专题命中 指令微调 :language model(title,abstract);pretraining(abstract)

AI总结 MERGETUNE通过持续微调和线性模式连接,恢复视觉-语言模型在微调中丢失的预训练知识,提升基础-新样本泛化和稳健微调性能。

Comments 20 pages, 5 figures

Journal ref ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22554 2026-02-27 cs.LG 81%

Multilingual Safety Alignment Via Sparse Weight Editing

多语言安全对齐 via 稀疏权重编辑

Jiaming Liang, Zhaoxin Wang, Handing Wang

机构 * School of Artificial Intelligence, Xidian University(人工智能学院,西安电子科技大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

AI总结 本文提出基于稀疏权重编辑的多语言安全对齐方法,通过稀疏神经元映射降低低资源语言攻击成功率,同时保持通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22452 2026-02-27 cs.AI cs.RO 81%

CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines

CWM: 用于具身智能体流水线中动作可行性学习的对比世界模型

Chayan Banerjee

机构 * School of Electrical Engineering and Robotics, Queensland University of Technology(电气工程与机器人学学院,昆士兰理工大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 CWM通过对比训练提升动作可行性评分,优于SFT方法,提升精度并增强安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16661 2026-02-27 cs.CL cs.AI cs.LG cs.LO 80%

RLSF: Fine-tuning LLMs via Symbolic Feedback

通过符号反馈进行LLM微调:RLSF

Piyush Jha, Prithwish Jana, Pranavkrishna Suresh, Arnav Arora, Vijay Ganesh

机构 * Georgia Institute of Technology, USA(佐治亚理工学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RLSF通过符号反馈微调LLM,利用符号推理工具提供精细反馈,提升领域特定任务的性能,使小模型超越大模型。

Journal ref ECAI 2025, Frontiers in Artificial Intelligence and Applications, Vol. 413, pp. 1687-1694, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22293 2026-02-27 cs.LG physics.geo-ph 79%

Global River Forecasting with a Topology-Informed AI Foundation Model

基于拓扑信息的AI基础模型实现全球河流预报

Hancheng Ren, Gang Zhao, Shuo Wang, Louise Slater, Dai Yamazaki, Shu Liu, Jingfang Fan, Shibo Cui, Ziming Yu, Shengyu Kang, Depeng Zuo, Dingzhi Peng, Zongxue Xu, Bo Pang

机构 * College of Water Sciences, Beijing Normal University, Beijing, China(北京师范大学水科学学院) School of Geography and the Environment, University of Oxford, Oxford, UK(牛津大学地理与环境学院) Department of Transdisciplinary Science and Engineering, Institute of Science Tokyo, Tokyo, Japan(东京科学研究所跨学科科学与工程系) School of Systems Science, Beijing Normal University, Beijing, China(北京师范大学系统科学学院) Institute of Industrial Science, University of Tokyo, Tokyo, Japan(东京大学工业科学研究所) China Institute of Water Resources and Hydropower Research, Beijing, China(中国水利水电科学研究院) State Key Laboratory of Hydro-Science and Engineering, Department of Hydraulic Engineering, Tsinghua University, Beijing, China(清华大学水利科学与工程国家重点实验室) School of Artificial Intelligence, Beijing Normal University, Beijing, China(北京师范大学人工智能学院) School of Water Resources and Hydropower Engineering, Wuhan University, Wuhan, China(武汉大学水利水电学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 GraphRiverCast通过拓扑信息和物理对齐的神经操作符架构,实现了全球河流系统的系统性水动力模拟,无需历史数据即可进行稳健预测。

Comments 26 pages, 5 figures, 3 extended data tables, 3 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21306 2026-02-27 cs.CL 77%

PARL: Prompt-based Agents for Reinforcement Learning

PARL:基于提示的强化学习智能体

Yarik Menchaca Resendiz, Roman Klinger

机构 * Fundamentals of Natural Language Processing, University of Bamberg, Germany(自然语言处理基础,巴姆伯格大学,德国)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 PARL是一种基于提示的强化学习智能体,利用预训练语言模型在无需微调的情况下完成RL任务,适用于简单环境但受限于复杂数学运算任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22539 2026-02-27 cs.AI eess.SP 77%

Agentic AI for Intent-driven Optimization in Cell-free O-RAN

面向无细胞O-RAN意图驱动优化的代理AI

Mohammad Hossein Shokouhi, Vincent W. S. Wong

机构 * Department of Electrical and Computer Engineering, The University of British Columbia(电气与计算机工程系,不列颠哥伦比亚大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种面向无细胞O-RAN的代理AI框架,通过多代理协作实现意图驱动的优化,减少O-RU数量并降低内存使用。

Comments Accepted by IEEE International Conference on Communications (ICC), Glasgow, UK, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22938 2026-02-27 cs.CV cs.AI cs.LG 76%

pMoE: Prompting Diverse Experts Together Wins More in Visual Adaptation

pMoE:协同提示不同专家以赢得更多视觉适应

Shentong Mo, Xufang Luo, Dongsheng Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院)

专题命中 指令微调 :prompting(title);分类 cs.AI、cs.LG

AI总结 pMoE通过整合多个领域专家的知识,提升视觉适应任务的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22357 2026-02-27 astro-ph.IM 75%

STILTS-NLI: A Natural Language Interface for STILTS

STILTS-NLI:一种用于STILTS的自然语言接口

R. A. Shaw, S. Fotopoulou, M. Taylor, M. Bremer

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 STILTS-NLI通过微调开源大语言模型,为天文学数据处理提供自然语言接口,降低用户学习门槛并提升使用效率。

Comments Accepted for publication in RASTI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21294 2026-02-27 cs.CL 74%

UPDESH: Synthesizing Grounded Instruction Tuning Data for 13 Indic Languages

UPDESH: 为13种印地语系语言合成基于现实的指令微调数据

Pranjal A. Chitale, Varun Gumma, Sanchit Ahuja, Prashant Kodali, Manan Uppadhyay, Deepthi Sudharsan, Sunayana Sitaram

机构 * Microsoft Corporation(微软公司) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) Independent Researcher(独立研究者)

专题命中 指令微调 :instruction tuning(title);分类 cs.CL

AI总结 UPDESH通过基于维基百科内容的自下而上方法,生成高质量的多语言指令数据,提升多语言AI系统的文化适应性与性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22817 2026-02-27 cs.LG cs.AI 73%

Hierarchy-of-Groups Policy Optimization for Long-Horizon Agentic Tasks

长周期代理任务的分层组策略优化

Shuo He, Lang Feng, Qi Wei, Xin Cheng, Lei Feng, Bo An

机构 * Nanyang Technological University(南洋理工大学) Southeast University(东南大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HGPO通过分层组策略优化解决长周期代理任务中分步优势估计的上下文不一致问题,提升策略优化效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏