arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-30 至 2026-01-30 共收录 258 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 18 篇

2502.04379 2026-01-30 cs.CV cs.AI cs.CL cs.HC 91%

Can Large Language Models Capture Video Game Engagement?

大语言模型能否捕捉视频游戏参与度?

David Melhart, Matthew Barthet, Georgios N. Yannakakis

机构 * Institute of Digital Games, University of Malta Msida, Malta(马耳他大学数字游戏研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究了大语言模型在多模态输入下预测视频游戏参与度的能力,发现尽管LLMs在多个领域表现优异,但其在连续情绪标注上仍无法超越人类注释。

Comments This work has been submitted to the IEEE for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21947 2026-01-30 cs.AI 90%

ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models

ToolWeaver: 为大语言模型中的可扩展工具使用编织协作语义

Bowen Fang, Wen Ye, Yunyue Su, Jinghao Zhang, Qiang Liu, Yesheng Liu, Xin Sun, Shu Wu, Jiabing Yang, Baole Wei, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR),自动化研究所,中国科学院(CASIA)) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 ToolWeaver通过编码工具为层次序列,解决大语言模型中工具使用中的语义和可扩展性问题,提升工具协作学习的效率与效果。

Comments 10pages, 12 figures, Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04177 2026-01-30 cs.CL cs.LG stat.ML 90%

Scaling Laws for Downstream Task Performance of Large Language Models

大语言模型下游任务性能的扩展定律

Berivan Isik, Natalia Ponomareva, Hussein Hazimeh, Dimitris Paparas, Sergei Vassilvitskii, Sanmi Koyejo

机构 * Google Research(谷歌研究) OpenAI(开放人工智能) Stanford University(斯坦福大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨了预训练数据规模和分布对齐对大语言模型下游任务性能的影响,揭示了扩展定律在迁移学习中的应用及翻译质量的预测方法。

Comments Published at the International Conference on Learning Representations (ICLR) 2025, with title: "Scaling Laws for Downstream Task Performance in Machine Translation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18834 2026-01-30 cs.CL 86%

Mix, MinHash, and Match: Cross-Source Agreement for Multilingual Pretraining Datasets

混合、最小哈希与匹配:多语言预训练数据集的跨源一致性

Sultan Alrashed, Francesco Orabona

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,comments);language model(abstract);分类 cs.CL

AI总结 通过跨源一致性技术,结合多语言语料库进行最小哈希去重,提升预训练数据质量并增加独特标记数量。

Comments Multilingual LLM pretraining dataset curation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10233 2026-01-30 cs.AI cs.LG cs.NE 84%

Bridging Synthetic and Real Routing Problems via LLM-Guided Instance Generation and Progressive Adaptation

通过LLM引导的实例生成和渐进适应弥合合成与现实路由问题

Jianghan Zhu, Yaoxin Wu, Zhuoyi Lin, Zhengyuan Zhang, Haiyan Yin, Zhiguang Cao, Senthilnath Jayavelu, Xiaoli Li

机构 * A*STAR(新加坡科技研究局)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过LLM引导的实例生成和渐进适应方法,提升神经求解器在现实路由问题中的泛化能力。

Comments 21 pages; Published in AAAI 2026, Main Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21768 2026-01-30 cs.CL 83%

Zonkey: A Hierarchical Diffusion Language Model with Differentiable Tokenization and Probabilistic Attention

Zonkey:一种具有可微分分词和概率注意力的分层扩散语言模型

Alon Rozental

机构 * Alon Rozental(独立研究者)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 Zonkey是一种通过可微分分词和概率注意力机制实现的分层扩散语言模型,能够从噪声中生成连贯文本并提升领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21631 2026-01-30 cs.CY 82%

Turning Language Model Training from Black Box into a Sandbox

将语言模型训练从黑箱转变为沙盒

Nicolas Pope, Matti Tedre

专题命中 预训练与数据 :language model(title,abstract);prompting(abstract)

AI总结 通过让学生直接训练语言模型,研究发现可视化训练过程能显著提升学生对AI数据驱动本质的理解。

Comments 4 pages, 2 figures, WIP, accepted to IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20884 2026-01-30 cs.LG cs.AI 81%

Finetune-Informed Pretraining Boosts Downstream Performance

微调引导预训练提升下游性能

Atik Faysal, Mohammad Rostami, Reihaneh Gh. Roshan, Nikhil Muralidhar, Huaxia Wang

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 FIP通过优化目标模态的表示学习,提升多模态下游任务性能,无需额外数据或计算资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00564 2026-01-30 cs.LG cs.AI 81%

Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining

通过联合优化的世界-动作模型扩展离线模型基于的强化学习

Jie Cheng, Ruixi Qiao, Yingwei Ma, Binhua Li, Gang Xiong, Qinghai Miao, Yongbin Li, Yisheng Lv

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Alibaba Group(阿里巴巴集团)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 JOWA通过联合优化的世界-动作模型扩展离线RL,实现高效泛化和高性能

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21334 2026-01-30 cs.CV 78%

Do Pathology Foundation Models Encode Disease Progression? A Pseudotime Analysis of Visual Representations

病理基础模型是否编码疾病进展?对视觉表示的伪时间分析

Pritika Vig, Ren-Chin Wu, William Lotter

机构 * Massachusetts Institute of Technology(麻省理工学院) Department of Pathology, Dana-Farber Cancer Institute(达纳-法伯癌症研究所病理部) Department of Data Science, Dana-Farber Cancer Institute(达纳-法伯癌症研究所数据科学部) Brigham and Women's Hospital(布里奇沃特医院) Harvard Medical School(哈佛医学院)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 研究探讨视觉基础模型是否能隐式学习连续疾病进程,通过伪时间分析发现模型在表示空间中能组织疾病状态,轨迹保真度与分类性能相关。

Comments 21 pages, 17 figures. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21665 2026-01-30 cs.CL 77%

AdaptBPE: From General Purpose to Specialized Tokenizers

AdaptBPE: 从通用到专用的分词器

Vijini Liyanage, François Yvon

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 AdaptBPE通过后训练适应策略优化分词器,提升特定领域或任务的分词效率。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13518 2026-01-30 cs.CV 67%

Text-driven Online Action Detection

基于文本的在线动作检测

Manuel Benavent-Lledo, David Mulero-Pérez, David Ortiz-Perez, Jose Garcia-Rodriguez

机构 * Department of Computer Technology, University of Alicante(阿拉维大学计算机技术系) ValgrAI - Valencian Graduate School and Research Network of Artificial Intelligence(瓦伦西亚人工智能研究生学校和研究网络) Institute of Informatics Research, University of Alicante(阿拉维大学信息研究所)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 本文提出TOAD模型,利用CLIP文本嵌入实现高效的零样本和少样本在线动作检测,其在THUMOS14数据集上的mAP达到82.46%

Comments Published in Integrated Computer-Aided Engineering

Journal ref Integrated Computer-Aided Engineering. 2025;32(4):415-423

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21517 2026-01-30 cs.CV 67%

HERS: Hidden-Pattern Expert Learning for Risk-Specific Vehicle Damage Adaptation in Diffusion Models

HERS:隐藏模式专家学习用于扩散模型中特定风险车辆损伤适应

Teerapong Panboonyuen

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 HERS通过领域特定专家学习提升扩散模型中车辆损伤生成的保真度与可控性,提高保险领域应用的安全性与可靠性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21391 2026-01-30 cs.LG cs.AI 62%

Intrinsic Reward Policy Optimization for Sparse-Reward Environments

内在奖励策略优化用于稀疏奖励环境

Minjae Cho, Huy Trong Tran

机构 * The Grainger College of Engineering, University of Illinois Urbana-Champaign, Urbana, USA(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 IRPO通过利用多种内在奖励直接优化策略,提升稀疏奖励环境下的性能和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20994 2026-01-30 cs.LG cs.AI 62%

The Depth Delusion: Why Transformers Should Be Wider, Not Deeper

深度幻觉:为什么Transformer应更宽而非更深

Md Muhtasim Munif Fahim, Md Rezaul Karim

机构 * Data Science Research Lab, Department of Statistics, University of Rajshahi, Rajshahi-6205, Bangladesh.(数据科学研究实验室,统计学系,拉贾沙希大学,拉贾沙希-6205,孟加拉国)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现Transformer模型应更宽而非更深,通过分析不同架构的缩放定律,揭示了增加层数反而会增加损失的现象,展示了宽度增长对模型性能的积极影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03779 2026-01-30 cs.CV cs.AI cs.LG 62%

FastDINOv2: Frequency Based Curriculum Learning Improves Robustness and Training Speed

FastDINOv2:基于频率的课程学习提高鲁棒性和训练速度

Jiaqi Zhang, Juntuo Wang, Zhixin Sun, John Zou, Randall Balestriero

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 FastDINOv2通过频率过滤课程学习和高斯噪声补丁增强,提升DINOv2的鲁棒性和训练效率

Comments Accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19946 2026-01-30 eess.AS cs.LG cs.SD 57%

MK-SGC-SC: Multiple Kernel Guided Sparse Graph Construction in Spectral Clustering for Unsupervised Speaker Diarization

MK-SGC-SC:多核引导的稀疏图构建在谱聚类中的语音说话人分离

Nikhil Raghav, Avisek Gupta, Swagatam Das, Md Sahidullah

机构 * Institute for Advancing Intelligence, TCG CREST(先进智能研究所) Department of Computer Science, RKMVERI(计算机科学系) Electronics and Communication Sciences Unit, Indian Statistical Institute(印度统计研究所电子与通信科学单元)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出基于多核引导的稀疏图构建方法,用于无监督语音说话人分离,通过多项式核和反余弦核测量嵌入相似性,提升局部相似性,实现高性能的说话人区域分割。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17209 2026-01-30 cs.SD cs.LG eess.AS 57%

Do Foundational Audio Encoders Understand Music Structure?

基础音频编码器是否理解音乐结构?

Keisuke Toyama, Zhi Zhong, Akira Takahashi, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation, Japan(日本索尼集团公司) Sony AI, USA(美国索尼人工智能)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本研究探讨了基础音频编码器在音乐结构分析中的有效性,发现自监督学习方法在该任务中表现优异。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 13 篇

2509.20758 2026-01-30 cs.CL 85%

SFT Doesn't Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs

SFT并不总是损害通用能力:重新审视LLM中的领域特定微调

Jiacheng Lin, Zhongruo Wang, Kun Qian, Tian Wang, Arvind Srinivasan, Hansi Zeng, Ruochen Jiao, Xie Zhou, Jiri Gesi, Dakuo Wang, Yufan Guo, Kai Zhong, Weiqi Zhang, Sujay Sanghavi, Changyou Chen, Hyokun Yun, Lihong Li

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University at Buffalo(布法罗大学) Northeastern University(东北大学)

专题命中 指令微调 :SFT(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了SFT对LLM通用能力的影响,发现较小学习率可缓解性能下降,提出TALR方法在平衡领域特定性能与通用能力方面表现优异。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13258 2026-01-30 cs.CL 85%

Towards Transparent RAG: Fostering Evidence Traceability in LLM Generation via Reinforcement Learning

迈向透明的RAG:通过强化学习促进LLM生成中的证据可追溯性

Jingyi Ren, Yekun Xu, Xiaolong Wang, Weitao Li, Ante Wang, Weizhi Ma, Yang Liu

机构 * DCST \& AIR, Tsinghua University Beijing, China DCST, Tsinghua University Beijing, China AIR, Tsinghua University Beijing, China DSCT \& AIR, Tsinghua University Beijing, China DCST \& AIR, Tsinghua University DCST, Tsinghua University AIR, Tsinghua University DSCT \& AIR, Tsinghua University

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 TRACE通过强化学习提升LLM生成中的证据可追溯性,实现透明输出和准确性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22128 2026-01-30 cs.AI cs.CE q-bio.QM 81%

The Patient is not a Moving Document: A World Model Training Paradigm for Longitudinal EHR

患者并非静态文档:一种用于纵向电子健康记录的world model训练范式

Irsyad Adam, Zekai Chen, David Laprade, Shaun Porwal, David Laub, Erik Reinertsen, Arda Pekis, Kevin Brown

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);SFT(abstract)

AI总结 本文提出SMB-Structure模型,通过结合联合嵌入预测架构和next-token预测,学习捕捉疾病动态的嵌入,实现对高异质性复杂任务的竞争力表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22158 2026-01-30 cs.CL 81%

Context Parametrization with Compositional Adapters

基于组合适配器的上下文参数化

Josip Jukić, Martin Tutek, Jan Šnajder

机构 * TakeLab, University of Zagreb, Croatia(Take实验室,扎格雷布大学,克罗地亚)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 CompAs通过组合结构的适配器参数,提升LLM在长上下文和多任务中的效率与稳定性,提供一种更高效的部署方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21670 2026-01-30 cs.CV cs.AI cs.LG physics.comp-ph 81%

MORPH: PDE Foundation Models with Arbitrary Data Modality

MORPH:具有任意数据模态的PDE基础模型

Mahindra Singh Rautela, Alexander Most, Siddharth Mansingh, Bradley C. Love, Alexander Scheinker, Diane Oyen, Nathan Debardeleben, Earl Lawrence, Ayan Biswas

机构 * Computing and Artificial Intelligence Division (CAI), Los Alamos National Laboratory, NM, US(计算与人工智能部门(CAI),洛斯阿拉莫斯国家实验室)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 MORPH是一种基于卷积视觉变压器的PDE基础模型,通过多模态处理和高效注意机制实现对异质科学数据的高效学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22047 2026-01-30 cs.CL 77%

On the Paradoxical Interference between Instruction-Following and Task Solving

关于指令遵循与任务解决之间的悖论性干扰

Yunjia Qi, Hao Peng, Xintong Shi, Amy Xin, Xiaozhi Wang, Bin Xu, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, BNRist(计算机科学与技术系,BNRist)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文揭示指令遵循可能干扰LLMs任务解决能力,并提出SUSTAINSCORE指标量化此干扰,通过实验表明添加自我显而易见约束会导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01918 2026-01-30 cs.LG quant-ph 77%

Superpositional Gradient Descent: Harnessing Quantum Principles for Model Training

叠加梯度下降:利用量子原理进行模型训练

Ahmet Erdem Pamuk, Emir Kaan Özdemir, Şuayp Talha Kocabay

机构 * Mustafa Hakan G\"uven c er Science High School Ankara, T\"urkiye \. I stanbul Erkek High School \. I stanbul, T\"urkiye T\"UB\. I TAK Science High School Kocaeli, T\"urkiye

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出叠加梯度下降方法,通过量子原理提升模型训练效率,实验证明其在序列分类和LLM微调中表现优于AdamW。

Comments Accepted at 2025 IEEE International Conference on Quantum Artificial Intelligence (IEEE QAI 2025). This is the accepted version of the paper. The final published version will appear in the IEEE proceedings. \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

Journal ref Proc. IEEE QAI 2025, Naples, Italy, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20901 2026-01-30 cs.CR 71%

Towards Sensitivity-Aware Language Models

面向敏感性感知的语言模型

Dren Fazlija, Iyiola E. Olatunji, Daniel Kudenko, Sandipan Sikdar

专题命中 指令微调 :language model(title)

AI总结 本文提出了一种方法,通过监督微调提升四比特量化LLMs的敏感性感知能力,使其在隐私保护方面表现更优,同时保持其他任务性能。

Comments 11 pages, 3 figures, 2 tables, AISTATS 2026; Project Page: https://drenfazlija.github.io/towards-sa-llms/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20911 2026-01-30 cs.CV cs.AI 70%

Non-Markov Multi-Round Conversational Image Generation with History-Conditioned MLLMs

非马尔可夫多轮对话图像生成与历史条件化大语言模型

Haochen Zhang, Animesh Sinha, Felix Juefei-Xu, Haoyu Ma, Kunpeng Li, Zhipeng Fan, Meng Dong, Xiaoliang Dai, Tingbo Hou, Peizhao Zhang, Zecheng He

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出非马尔可夫多轮对话图像生成方法,通过历史条件化框架和数据构建策略提升多轮一致性与指令遵循性,同时保持单轮编辑能力。

Comments 19 pages, 19 figures, plan for TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21426 2026-01-30 cs.CV 67%

MultiModal Fine-tuning with Synthetic Captions

多模态微调与合成描述

Shohei Enomoto, Shin'ya Yamaguchi

机构 * NTT Tokyo(日本NTT东京)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出通过多模态大语言模型生成合成描述,提升多模态微调效果,尤其在少样本学习中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21618 2026-01-30 cs.AI cs.CL 62%

Semantic Content Determines Algorithmic Performance

语义内容决定算法性能

Martiño Ríos-García, Nawaf Alampara, Kevin Maik Jablonka

机构 * Laboratory of Organic Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena, Humboldtstrasse 10, 07743 Jena, Germany HIPOLE Jena (Helmholtz Institute for Polymers in Energy Applications Jena), Lessingstrasse 12-14, 07743 Jena, Germany Center for Energy Environmental Chemistry Jena (CEEC Jena), Friedrich Schiller University Jena, Philosophenweg 7a, 07743 Jena, Germany Jena Center for Soft Matter (JCSM), Friedrich Schiller University Jena, Philosophenweg 7, 07743 Jena, Germany

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大语言模型的性能受输入语义影响,通过WhatCounts实验展示不同语义内容导致计数准确率显著变化,表明模型对输入意义存在隐性依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25889 2026-01-30 cs.LG 57%

$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models

$π_\ exttt{RL}$: 流基于视觉-语言-动作模型的在线强化学习微调

Kang Chen, Zhihao Liu, Tonghe Zhang, Zhen Guo, Si Xu, Hao Lin, Hongzhi Zang, Xiang Li, Quanlu Zhang, Zhaofei Yu, Guoliang Fan, Tiejun Huang, Yu Wang, Chao Yu

机构 * Tsinghua University(清华大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Carnegie Mellon University(卡内基梅隆大学) Infinigence AI Zhongguancun Academy(中关村学院)

专题命中 指令微调 :SFT(abstract);分类 cs.LG

AI总结 本文提出$π_\ exttt{RL}$方法,通过流噪声和流SDE技术,解决大规模流基于VLA模型中强化学习微调的挑战,提升模型在分布内和分布外任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏