arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11619 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11619 篇

2605.12419 2026-05-13 cs.CL cs.IR cs.LG 82%

ORBIT: Preserving Foundational Language Capabilities in GenRetrieval via Origin-Regulated Merging

ORBIT:通过起源调节合并在生成检索中保留基础语言能力

Neha Verma, Nikhil Mehta, Shao-Chuan Wang, Naijing Zhang, Alicia Tsai, Li Wei, Lukasz Heldt, Lichan Hong, Ed Chi, Xinyang Yi

机构 * Johns Hopkins University(约翰霍普金斯大学) Google DeepMind(谷歌DeepMind) Google(谷歌)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 ORBIT通过跟踪模型权重距离并使用加权平均策略,在生成检索微调中减少模型漂移,有效保留语言基础能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01402 2026-05-12 cs.CL cs.CV cs.LG 82%

Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression

通过强化学习为深度不平衡回归注入分布意识

Yao Du, Shanshan Song, Xiaomeng Li

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于组相对策略优化的分布感知强化学习框架,通过一致性相关系数奖励实现跨样本关系监督,提升长尾回归任务的分布对齐能力,在中等和少样本场景下表现优异。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06761 2026-05-11 cs.AI cs.CV cs.LG 82%

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents

Weblica: 可扩展且可重复的视觉网络代理训练环境

Oğuzhan Fatih Kar, Roman Bachmann, Yuanzheng Gong, Anders Boesen Lindbo Larsen, Afshin Dehghan

机构 * Apple(苹果公司)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 Weblica提出一种可扩展且可重复的视觉网络代理训练框架,通过HTTP级缓存和LLM环境合成技术,实现大规模多样化的网络环境训练,其最佳模型在多个网络导航基准中表现优异。

Comments 28 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15270 2026-05-08 cs.CL cs.AI 82%

From Documents to Spans: Scalable Supervision for Evidence-Based ICD Coding with LLMs

从文档到跨度:基于LLM的证据导向ICD编码可扩展监督方法

Xu Zhang, Wenxin Ma, Chenxu Wu, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Kun Zhang, S. Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, USTC(生物医学工程学院,生命科学与医学系,中国科学技术大学) MIRACLE Center, Suzhou Institute for Advance Research, USTC(MIRACLE中心,苏州先进研究院,中国科学技术大学) Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology(江苏省多模态数字孪生技术重点实验室) State Key Laboratory of Precision and Intelligent Chemistry, USTC(精密与智能化学国家重点实验室)

专题命中 指令微调 :LLM(title_cn,abstract_cn);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Span-Centric Learning框架,通过局部跨度学习提升ICD编码能力,以更低成本实现宏F1提升8.2点,并提供明确证据支持预测代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23036 2026-04-28 cs.LG cs.CL 82%

Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning

在混合专家调谐中保持长尾专家信息

Haoze He, Xingyuan Ding, Xuan Jiang, Xinkai Zou, Alex Cheng, Yibo Zhao, Juncheng Billy Li, Heather Miller

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院) UCSD(加州大学圣地亚哥分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种无需辅助损失的MoE SFT框架,通过偏置驱动稀疏化与始终活跃的门控凝结专家,有效保留长尾专家信息,实验显示在数学推理和常识问答基准上优于现有方法。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09253 2026-04-24 cs.LG cs.AI 82%

RIFT: Repurposing Negative Samples via Reward-Informed Fine-Tuning

RIFT:通过奖励引导微调重用负样本

Zehua Liu, Shuqi Liu, Tao Zhong, Mingxuan Yuan

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 RIFT通过奖励引导微调利用所有自生成样本,重用负轨迹并重新加权损失,提升对齐效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19018 2026-04-22 cs.LG cs.AI cs.SY eess.SY math.OC stat.ML 82%

Local Linearity of LLMs Enables Activation Steering via Model-Based Linear Optimal Control

大模型的局部线性性使基于模型的线性最优控制能够实现激活引导

Julian Skifstad, Xinyue Annie Yang, Glen Chou

机构 * Georgia Institute of Technology, Atlanta, GA, USA. Schools of Electrical and Computer Engineering(佐治亚理工学院,亚特兰大,GA,美国。电气与计算机工程学院)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 通过利用大模型层间动力学的局部线性特性,本文将LLM推理建模为线性时变动态系统,采用线性二次调节器计算反馈控制器,实现激活的闭环控制,具有低计算开销和无离线训练的优势,同时提供理论误差界保证控制性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18936 2026-04-22 cs.LG cs.AI hep-ph hep-th 82%

Fine-Tuning Small Reasoning Models for Quantum Field Theory

对量子场论进行小规模推理模型的微调

Nathaniel S. Woodward, Zhiqi Gao, Yurii Kvasiuk, Kendrick M. Smith, Frederic Sala, Moritz Münchmeyer

机构 * Department of Physics, University of Wisconsin-Madison(威斯康星大学麦迪逊分校物理系) Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Perimeter Institute for Theoretical Physics(理论物理研究所)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在训练大型语言模型时,领域特定物理推理能力的发展,通过微调小规模推理模型,生成合成问题和人类编写的问题,进行强化学习和监督微调实验,分析推理错误的变化,并公开数据管道和训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13674 2026-04-21 cs.CL cs.AI 82%

PrefixMemory-Tuning: Modernizing Prefix-Tuning by Decoupling the Prefix from Attention

PrefixMemory-Tuning: 通过解耦前缀与注意力来现代化前缀微调

Haonan Wang, Brian Chen, Siquan Li, Xinhe Liang, Hwee Kuan Lee, Kenji Kawaguchi, Tianyang Hu

机构 * National University of Singapore(新加坡国立大学) Bioinformatics Institute, A*STAR(A*STAR生物信息研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PrefixMemory-Tuning,通过将前缀模块移出注意力头以提升表达能力,实验证明其在多个基准上优于传统前缀微调方法,并在通用任务中表现接近现代PEFT技术。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16335 2026-04-21 cs.LG cs.AI cs.SE 82%

Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents

超越可验证奖励:基于评分表的GRM用于强化微调SWE代理

Jiawei Huang, Qingping Yang, Renjie Zheng, Jiaze Chen

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于评分表的GRM,通过人类设计的评分标准提升强化微调SWE任务的性能,有效抑制不良行为并促进有益行为,提高最终测试准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12617 2026-04-20 cs.LG cs.AI 82%

SOAR: Self-Correction for Optimal Alignment and Refinement in Diffusion Models

SOAR:扩散模型中的自校正以实现最优对齐与细化

You Qin, Linqing Wang, Hao Fei, Roger Zimmermann, Liefeng Bo, Qinglin Lu, Chunyu Wang

机构 * Tencent Hunyuan(腾讯文汇)

专题命中 指令微调 :SFT(abstract,abstract_cn);pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 SOAR通过自校正方法改进扩散模型的对齐和细化,提升生成和OCR性能,同时兼容后续强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11867 2026-04-15 cs.LG cs.AI 82%

Disposition Distillation at Small Scale: A Three-Arc Negative Result

小规模下的行为蒸馏:一个三弧否定结果

Hari Sadasivan

机构 * Tinman Lab(Tinman实验室)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 研究尝试通过四阶段MIT蒸馏流程在小语言模型中训练行为倾向,但发现无操作能改变倾向而不损害内容或导致模仿。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01580 2026-04-13 cs.LG cs.AI 82%

The Two-Stage Decision-Sampling Hypothesis: Understanding the Emergence of Self-Reflection in RL-Trained LLMs

两阶段决策采样假说:理解RL训练LLM中自反思能力的产生

Zibo Zhao, Yuanting Zha, Haipeng Zhang, Xingcheng Xu

机构 * Arizona State University(亚利桑那州立大学) Shanghaitech University(上海科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 研究探讨了RL训练后LLM中自反思能力的形成机制,提出两阶段决策采样假说,通过梯度归因属性分析发现RL优于SFT的原因在于决策能力的提升而非生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03072 2026-03-26 cs.AI cs.CL cs.CV 82%

TikZilla: Scaling Text-to-TikZ with High-Quality Data and Reinforcement Learning

TikZilla: 通过高质量数据和强化学习扩展文本到TikZ

Christian Greisinger, Steffen Eger

机构 * University of Technology Nuremberg (UTN)(图恩堡技术大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出TikZilla,通过高质量数据和强化学习提升文本到TikZ的生成质量,解决现有数据小且噪声大、模型生成错误的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13590 2026-03-20 cs.CL cs.AI 82%

Vulnerability of LLMs' Stated Beliefs? LLMs Belief Resistance Check Through Strategic Persuasive Conversation Interventions

LLMs所声明信念的脆弱性?通过战略性说服对话干预检查LLMs信念抵抗性

Fan Huang, Haewoon Kwak, Jisun An

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过战略性说服对话干预评估LLMs在不同领域中的信念稳定性,发现小模型易受说服影响,而自信提示反而加剧了脆弱性,揭示了模型依赖性的鲁棒性限制。

Comments Updated new models and minor revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11408 2026-03-18 cs.LG cs.AI 82%

On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting

策略学习融合专家数据:通过动态加权实现监督微调与强化学习的和谐统一

Wenhao Zhang, Yuexiang Xie, Yuchang Sun, Yanxi Chen, Guoyin Wang, Yaliang Li, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文提出CHORD框架,通过动态加权将监督微调与强化学习统一,解决传统方法在整合时可能破坏响应模式和过拟合专家数据的问题,实验表明其在多个任务中具有稳定高效的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07527 2026-03-12 cs.AI cs.LG 82%

Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions

学习强化学习无法做到的:用于最难问题的交错在线微调

Lu Ma, Hao Liang, Meiyi Qiang, Lexiang Tang, Xiaochen Ma, Zhen Hao Wong, Junbo Niu, Chengyu Shen, Runming He, Yanhao Li, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京软件与硬件协同人工智能系统重点实验室)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 ReLIFT通过结合强化学习和在线微调,提升模型在复杂问题上的推理能力,实现超过5.2分的性能提升。

Comments 12 pages, 5 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22266 2026-03-09 cs.LG cs.AI 82%

LLMTM: Benchmarking and Optimizing LLMs for Temporal Motif Analysis in Dynamic Graphs

LLMTM:动态图中基于时间 motif 分析的 LLM 评估与优化

Bing Hao, Minglai Shao, Zengyi Wo, Yunlong Chu, Yuhang Liu, Ruijie Wang

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出 LLMTM 基准测试,评估 LLM 在动态图时间 motif 分析中的性能,并开发结构感知调度器以优化效率与精度的平衡。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21668 2026-03-05 cs.AI cs.CL cs.SC 82%

R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning

R1-Code-Interpreter: LLMs通过监督学习和多阶段强化学习进行代码推理

Yongchao Chen, Yueying Liu, Junwei Zhou, Yilun Hao, Jingquan Wang, Yang Zhang, Na Li, Chuchu Fan

机构 * MIT / Harvard(麻省理工学院/哈佛大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) MIT(麻省理工学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Harvard(哈佛大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 R1-Code-Interpreter通过监督学习和多阶段强化学习提升LLM的代码推理能力,实现对多样化任务的高效处理,显著提升模型性能。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07729 2026-02-25 cs.LG cs.AI 82%

Do We Need Adam? Surprisingly Strong and Sparse Reinforcement Learning with SGD in LLMs

我们是否需要Adam?在LLMs中使用SGD的 surprisingly 强大且稀疏的强化学习

Sagnik Mukherjee, Lifan Yuan, Pavan Jayasinha, Dilek Hakkani-Tür, Hao Peng

机构 * University of at Illinois, Urbana-champaign, USA(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo, Ontario, Canada(滑铁卢大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);pretraining(abstract);SFT(abstract)

AI总结 本文发现SGD在LLMs强化学习中表现优于AdamW,且更新稀疏性显著,挑战了传统优化方法的普遍认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02515 2026-02-19 cs.CL cs.LG 82%

PoeTone: A Framework for Constrained Generation of Structured Chinese Songci with LLMs

PoeTone: 一个用于基于LLM生成结构化中文词的约束生成框架

Zhan Qu, Shuzhou Yuan, Michael Färber

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 PoeTone框架通过约束生成和评估方法,提升LLM在生成结构化中文词中的表现,实现正式符合度提升5.88%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15874 2026-02-19 cs.CL cs.LG 82%

P-RAG: Prompt-Enhanced Parametric RAG with LoRA and Selective CoT for Biomedical and Multi-Hop QA

P-RAG:结合LoRA和选择性CoT的增强型参数RAG

Xingda Lyu, Gongfu Lyu, Zitai Yan, Yuxin Jiang

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 P-RAG通过LoRA和选择性CoT提升生物医学问答的准确性和可扩展性。

Journal ref Proceedings of International Conference on Computing and Data Science Symposium: Application of Machine Learning in Engineering, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06964 2026-02-17 cs.CL cs.LG 82%

Offline RL by Reward-Weighted Fine-Tuning for Conversation Optimization

通过奖励加权微调实现离线强化学习用于对话优化

Subhojyoti Mukherjee, Viet Dac Lai, Raghavendra Addanki, Ryan Rossi, Seunghyun Yoon, Trung Bui, Anup Rao, Jayakumar Subramanian, Branislav Kveton

机构 * Adobe Research(Adobe研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

AI总结 本文提出通过奖励加权微调实现离线强化学习,用于对话优化,相比传统方法在奖励和语言质量上取得显著提升。

Comments Advances in Neural Information Processing Systems 38

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16596 2026-02-11 cs.CL cs.AI 82%

Analyzing the Effects of Supervised Fine-Tuning on Model Knowledge from Token and Parameter Levels

分析监督微调对模型知识的影响:从token和参数层面

Junjie Ye, Yuming Yang, Yang Nan, Shuo Li, Qi Zhang, Tao Gui, Xuanjing Huang, Peng Wang, Zhongchao Shi, Jianping Fan

机构 * Fudan University(复旦大学) Lenovo Research(联想研究) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 研究发现监督微调对模型知识的影响显著,通过分析token和参数层面发现大部分参数更新不促进知识增强,恢复更新可提升封闭书问题回答性能。

Comments Accepted by EMNLP 2025 Main Conference. Codes for parameter restoration are available at https://github.com/UmeanNever/ParamRestore

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23753 2026-02-03 cs.LG cs.CL 82%

Anchored Supervised Fine-Tuning

锚定监督微调

He Zhu, Junyou Su, Peng Lai, Ren Ma, Wenjia Zhang, Linyi Yang, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文提出锚定监督微调(ASFT),通过引入KL正则化解决动态微调(DFT)的稳定性问题,在数学推理、医学知识和代码生成等领域取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09728 2026-01-16 cs.CL cs.AI 82%

Eliminating Agentic Workflow for Introduction Generation with Parametric Stage Tokens

通过参数化阶段令牌消除引言生成中的代理工作流

Meicong Zhang, Tiancheng su, Guoxiu He

机构 * School of Economics and Management, East China Normal University(经济管理学院,东华大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出STIG方法,通过参数化阶段令牌消除代理工作流,使LLM在单次推理中生成连贯的引言,提升逻辑结构和语义相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12281 2026-01-12 cs.CL cs.LG 82%

Cmprsr: Abstractive Token-Level Question-Agnostic Prompt Compressor

Cmprsr: 基于抽象的token级问题无关提示压缩器

Ivan Zakazov, Berke Argin, Oussama Gabouj, Kamel Charaf, Alexander Sharipov, Alexi Semiz, Lorenzo Drudi, Nicolas Baldwin, Robert West

机构 * Compresr Inc.(Compresr公司) EPFL(瑞士联邦理工学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 Cmprsr通过优化压缩元提示和微调技术,在多种压缩率下实现高效且高质量的提示压缩,适用于不同输入长度和领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03505 2026-01-08 cs.CL cs.AI 82%

Beyond Perplexity: A Lightweight Benchmark for Knowledge Retention in Supervised Fine-Tuning

超越困惑度:一种轻量级的知识保留监督微调基准

Soheil Zibakhsh Shabgahi, Pedram Aghazadeh, Farinaz Koushanfar

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);SFT(abstract)

AI总结 本文提出KR测试,一种轻量级基准,用于区分监督微调中的事实学习与语言学,通过对比示例评估知识保留,提升微调动态的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17636 2025-12-22 cs.LG cs.AI 82%

Trust-Region Adaptive Policy Optimization

信任区域自适应策略优化

Mingyu Su, Jian Guan, Yuxian Gu, Minlie Huang, Hongning Wang

机构 * The Conversational AI (CoAI) Group, Tsinghua University(清华大学对话式人工智能(CoAI)小组)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 TRAPO通过结合SFT和RL的训练流程,提升大语言模型的推理能力,实现更稳定的训练和更高效的探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01939 2025-12-22 astro-ph.IM astro-ph.SR cs.AI cs.LG 82%

SpecCLIP: Aligning and Translating Spectroscopic Measurements for Stars

SpecCLIP:对齐和翻译恒星光谱测量

Xiaosheng Zhao, Yang Huang, Guirong Xue, Xiao Kong, Jifeng Liu, Xiaoyu Tang, Timothy C. Beers, Yuan-Sen Ting, A-Li Luo

机构 * School of Astronomy Space Science, University of Chinese Academy of Sciences, Beijing 100049, People's Republic of China National Astronomical Observatories, Chinese Academy of Sciences, Beijing 100012, People's Republic of China Department of Physics \& Astronomy, The Johns Hopkins University, Baltimore, MD 21218, USA Zhejiang Laboratory, Hangzhou 311121, People's Republic of China Research Center for Astronomical Computing, Zhejiang Laboratory, Hangzhou 311121, People's Republic of China Department of Physics Astronomy, University of Notre Dame, Notre Dame, IN 46556, USA Joint Institute for Nuclear Astrophysics -- Center for the Evolution of the Elements (JINA-CEE), USA Department of Astronomy, The Ohio State University, 140 West 18th Avenue, Columbus, OH 43210, USA Center for Cosmology AstroParticle Physics (CCAPP), The Ohio State University, Columbus, OH 43210, USA

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 SpecCLIP通过对比学习和光谱意识解码器提升恒星光谱分析的精度和应用灵活性。

Comments 29 pages, 8 figures, 6 tables. Accepted for publication in ApJ. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏