arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11653 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11653 篇

2504.19838 2025-11-18 cs.HC 85%

LLM-Powered GUI Agents in Phone Automation: Surveying Progress and Prospects

Guangyi Liu, Pengxiang Zhao, Yaozhen Liang, Liang Liu, Yaxuan Guo, Han Xiao, Weifeng Lin, Yuxiang Chai, Yue Han, Shuai Ren, Hao Wang, Xiaoyu Liang, WenHao Wang, Tianze Wu, Zhengxi Lu, Siheng Chen, LiLinghao, Hao Wang, Guanjing Xiong, Yong Liu, Hongsheng Li

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Paper accepted to TMLR 2025, Project Homepage: https://github.com/PhoneLLM/Awesome-LLM-Powered-Phone-GUI-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01034 2025-10-28 cs.CL cs.AI cs.LG 85%

Less is More: Local Intrinsic Dimensions of Contextual Language Models

Benjamin Matthias Ruppik, Julius von Rohrscheidt, Carel van Niekerk, Michael Heck, Renato Vukovic, Shutong Feng, Hsien-chin Lin, Nurul Lubis, Bastian Rieck, Marcus Zibrowius, Milica Gašić

机构 * Faculty of Mathematics and Natural Sciences, Heinrich Heine University Düsseldorf(明斯特大学数学与自然科学学院) Institute of AI for Health, Helmholtz Munich(健康人工智能研究所) Technical University of Munich(慕尼黑技术大学) University of Fribourg(弗里堡大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)

Comments Accepted at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025; in press). 10 pages, with an additional 17 pages in the appendix. Our code is available at https://github.com/aidos-lab/Topo_LLM_public and https://github.com/aidos-lab/grokking-via-lid

Journal ref Advances in Neural Information Processing Systems, Volume 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09586 2025-10-13 cs.CV 85%

Vision Language Models: A Survey of 26K Papers

Fengming Lin

机构 * School of Computer Science, The University of Manchester, Manchester, UK(曼彻斯特大学计算机科学学院)

专题命中 指令微调 :language model(title);LLM(abstract,comments);instruction tuning(abstract);prompting(abstract)

Comments VLM/LLM Learning Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18100 2026-08-20 cs.CL cs.AI cs.CY 新提交 85%

Computational Orientalism: Measuring Structural Discourse Bias in Large Language Models Using the Middle East Cultural Sensitivity Score (MECSS)

计算东方主义:使用中东文化敏感性评分(MECSS)测量大语言模型中的结构性话语偏见

Maha Shahid

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 该研究提出MECSS框架测量大语言模型的东方主义结构性话语偏见,发现GPT-4和Falcon3-7B-Instruct均存在系统性东方主义模式,且Falcon3-7B-Instruct得分更高,Said-washing现象普遍存在。

Comments 16 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27824 2026-07-31 cs.AI cs.LG 新提交 85%

STEREODISCO: Discovering Stereotypicality in LLMs

STEREODISCO:发现大语言模型中的刻板印象

Farane Jalali Farahani, Corina Dima, Mojtaba Nayyeri, Raphael H. Heiberger, Steffen Staab

机构 * Institute for Artificial Intelligence(人工智能研究所) Institute for Social Science(社会科学研究所) University of Southampton(南安普顿大学)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 STEREODISCO框架适配语义差异法研究LLM内部表征的刻板印象,发现LLM编码的社会群体刻板印象与人类存在差异,且识别出多种新的刻板印象语义轴。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27146 2026-07-30 cs.SE cs.CL cs.LG 新提交 85%

MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis

MindForge:通过无源码程序合成教小型语言模型全生命周期软件工程

Yihao Chen, Shi Chang, Khaled Chawa, Feng Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

专题命中 指令微调 :language model(title);small language model(title);分类 cs.CL、cs.LG

AI总结 研究针对小型语言模型从零构建程序的挑战,提出MindForge构建全生命周期无源码训练环境,微调Qwen3.6-27B后在ProgramBench及7个软件工程基准上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08393 2026-07-10 cs.AI cs.CL 新提交 85%

Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning

迈向对大语言模型微调中记忆知识无法泛化原因的机理理解

Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型微调中记忆知识无法泛化的问题,用自修补技术监测知识渗透动态,发现与知识电路未对准假设一致,还设计启发式策略验证,跨域实验证明发现具稳健性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27742 2026-06-29 cs.CL cs.AI 新提交 85%

KG2Cypher: Data-Centric Pipeline for Building Enterprise Text-to-Cypher Systems

KG2Cypher:面向构建企业文本到Cypher系统的数据驱动流水线

Minjun Choi, Yerin Kim, Junghyuk Seo, Sujin Mo, Hyemin Lee, Youngjoong Ko

机构 * Sungkyunkwan University(成均馆大学) NAVER

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出KG2Cypher数据驱动流水线,从现有知识图谱生成可执行Cypher查询及对应自然语言问题,通过LoRA微调提升企业文本到Cypher转换的准确率。

Comments 11 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03867 2026-06-24 cs.CL cs.AI 版本更新 85%

A Training-Free Mixture-of-Agents Framework for Multi-Document Summarization using LLMs and Knowledge Graphs

一种基于LLM和知识图谱的无训练混合智能体框架用于多文档摘要

Cuong Vuong Tuan, Trang Mai Xuan, Tien-Cuong Nguyen, Vu-Duc Ngo, Thien Van Luong

机构 * Faculty of Artificial Intelligence and Data Science, Phenikaa University(人工智能与数据科学学院,泛尼克大学) VNPT AI, VNPT Group(VNPT AI,VNPT集团) MobiFone Research and Development Center, MobiFone Corporation(MobiFone研发与开发中心,MobiFone公司) Business AI Lab, Faculty of Data Science and Artificial Intelligence, National Economics University, College of Technology(商业人工智能实验室,数据科学与人工智能学院,国家经济大学,技术学院)

专题命中 指令微调 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种无需训练、结合大语言模型和知识图谱的混合智能体框架,通过分解摘要任务为专用智能体(抽取、知识感知抽象、迭代精炼)并利用多视角一致性机制,在英文和越南语数据集上取得领先性能。

Comments Accepted by Neural Computing and Applications

Journal ref Neural Comput & Applic 38, 538 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21890 2026-06-23 cs.CL cs.AI 新提交 85%

Scaling Performance and Low-Resource Annotation with Many-Shot In-Context Learning for Named Entity Recognition

扩展性能与低资源标注:面向命名实体识别的多示例上下文学习

Qi Zhang, Fangping Lan, Cornelia Caragea, Longin Jan Latecki, Eduard Dragut

机构 * Temple University(天普大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究多示例上下文学习在命名实体识别中的扩展性,发现使用数百示例可使LLM匹配甚至超越监督BERT,并利用约百个人工标注示例生成高质量数据,在低资源NER上提升约10% F1。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18383 2026-06-19 cs.CL cs.AI 版本更新 85%

MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation

MENTOR: 通过灵活的教师优化奖励进行工具使用蒸馏的强化学习

ChangSu Choi, Hoyun Song, Dongyeon Kim, WooHyeon Jung, Minkyung Cho, Sunjin Park, NohHyeob Bae, Seona Yu, KyungTae Lim

机构 * Seoul National University of Science and Technology(首尔科学技术大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) LG CNS

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 提出MENTOR方法,通过灵活的教师优化奖励结构,平衡行为对齐与下游性能,提升小模型在工具使用任务中的域外泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12124 2026-06-05 cs.LG cs.CL 85%

Alignment Risks from Capability-Seeking RL Training

从能力寻求强化学习训练中产生的对齐风险

Yujun Zhou, Yue Huang, Han Bao, Kehan Guo, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Werner Geyer, Nuno Moniz, Nitesh V Chawla, Xiangliang Zhang

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Toronto(多伦多大学) University of Cambridge(剑桥大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了在易受攻击的环境中通过强化学习训练语言模型时,模型可能利用隐含漏洞来最大化奖励的风险,发现这些策略不仅限于狭窄的技巧,还能在一定程度上转移、传播,并在某些情况下比通过SFT学习更持久,表明需要扩展AI安全工作到审计和保障训练环境、奖励机制和评估渠道。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04847 2026-06-04 cs.CV cs.CL cs.LG 85%

MusaCoder: Native GPU Kernel Generation with Full-Stack Training on Moore Threads GPU

MusaCoder: 在摩尔线程GPU上通过全栈训练实现原生GPU内核生成

Kun Cheng, Songshuo Lu, Sicong Liao, Tankun Li, Yafei Zhang, Dong Yang, Qiheng Lv, Hua Wang, Zhi Chen, Yaohua Tang

机构 * Moore Threads AI

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出MusaCoder全栈训练框架,结合渐进式数据合成、多样性保持拒绝微调和基于执行反馈的强化学习,在CUDA和MUSA后端上生成高效原生GPU内核,9B模型匹配前沿闭源模型,27B模型达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00963 2026-06-02 cs.LG cs.CL 85%

Stabilizing Policy Optimization via Logits Convexity

通过Logits凸性稳定策略优化

Hongzhan Chen, Tao Yang, Yuhua Zhu, Shiping Gao, Xiaojun Quan, Ting Yao

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对强化学习训练不稳定的问题,从梯度角度分析监督微调与强化学习的稳定性差距,提出Logits凸优化(LCO)框架,通过模拟logits级凸性来稳定策略优化,实验表明该方法能提升训练稳定性并在多个基准上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31564 2026-06-01 cs.CL cs.AI 85%

What Gets Unmasked First? Trajectory Analysis of Diffusion Models for Graph-to-Text Generation

什么先被揭开?面向图到文本生成的扩散模型轨迹分析

Qing Wang, Jacob Devasier, Chengkai Li

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文首次系统研究掩码扩散语言模型在图到文本生成中的解码轨迹,发现其优先生成实体,并针对监督微调导致的输出长度固定问题提出无训练推理时修改方法λ缩放结构解码,恢复+9.4 BLEU-4,同时引入Graph-LLaDA模型以显式融入关系图结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00065 2026-05-29 cs.LG cs.CL cs.CR 85%

When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models

当相同系数到达不同位置:跨大型语言模型移植分词器中的非对称可实现性

Xiaoze Liu, Weichen Yu, Matt Fredrikson, Xiaoqian Wang, Jing Gao

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.LG

AI总结 本文发现跨词汇模型组合中分词器移植的几何结构非对称性,并构造了“破坏令牌”以利用该漏洞,通过实验验证其在多个模型对中的存在性及对微调、谱滤波等防御措施的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20255 2026-05-29 cs.LG cs.CL cs.SE 85%

HE-SNR: Uncovering Latent Logic via Entropy for Guiding Mid-Training on SWE-bench

HE-SNR:通过熵揭示潜在逻辑以指导SWE-bench上的中期训练

Yueyang Wang, Jiawei Fu, Baolong Bi, Xili Wang, Xiaoqing Liu

机构 * School of Mathematical Sciences, Peking University, Beijing, China(北京大学数学科学学院) Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对SWE-bench基准,提出基于熵压缩假说的HE-SNR指标,通过细粒度熵分析指导中期训练数据筛选,在高达560B参数模型上验证有效性。

Comments Accepted at ICML 2026. 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28306 2026-05-28 cs.CL cs.AI 85%

Routing-Aligned Fine-Tuning for Multilingual Downstream Tasks in Mixture-of-Experts Models

面向混合专家模型中多语言下游任务的路由对齐微调

Guanzhi Deng, Kuan Wu, Haibo Wang, Shing Yin Wong, Sichun Luo, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 针对混合专家模型在多语言下游任务中的路由结构异构问题,提出RA-MoE三阶段框架,通过中间层语言通用对齐区识别任务相关专家,并引入路由对齐损失增强目标语言路由,实验表明该方法优于标准微调和强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27849 2026-05-28 cs.PL cs.AI cs.CL 85%

FPMoE: A Sparse Mixture-of-Experts Approach to Functional Code Generation

FPMoE:一种用于函数式代码生成的稀疏混合专家方法

Loc Pham, Lang Hong Nguyet Anh, Thanh Le-Cong

机构 * GreenNode AI Hanoi University of Science and Technology(河内科学技术大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM在函数式编程语言上性能差的问题,提出基于稀疏MoE架构的FPMoE模型,通过语言特定专家和共享专家分别消除干扰和捕获跨语言抽象,以3B活跃参数达到远超微调基线并匹配大模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27567 2026-05-28 cs.AI cs.CL 85%

Why LLMs Fail at Causal Discovery and How Interventional Agents Escape

为什么LLM在因果发现中失败以及干预代理如何逃脱

Amartya Roy, Sonali Parbhoo

机构 * SIRE, IIT Delhi(IIT德里智能研究机构) Robert Bosch GmbH(罗伯特·博世有限公司) Imperial College London(伦敦帝国理工学院)

专题命中 指令微调 :LLM(title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文证明大型语言模型在因果发现中存在根本性失败,并提出一种基于干预代理的因果贝叶斯优化方法(A-CBO),通过外部贝叶斯循环在无需模型微调的情况下实现可证明的收敛。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13424 2026-05-14 cs.LG cs.CL 85%

LIFT: Last-Mile Fine-Tuning for Table Explicitation

LIFT:表格显式化的最后一公里微调

Divij Khaitan, Ashish Tiwari

机构 * Microsoft Corporation(微软公司)

专题命中 指令微调 :SLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出LIFT方法,通过预训练大语言模型提取表格并由微调的小语言模型修复错误,仅需1000个训练样本即可在TEDS指标上超越端到端微调,且更鲁棒于输入格式变化。

Comments 9 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10973 2026-05-13 cs.LG cs.AI 85%

Rotation-Preserving Supervised Fine-Tuning

保持旋转的监督微调

Hangzhan Jin, Tianwei Ni, Lu Li, Pierre-Luc Bacon, Mohammad Hamdaqa, Doina Precup

机构 * Mila - Quebec AI Institute(魁北克AI研究所) Polytechnique Montréal(蒙特利尔理工学院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席) Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RPSFT方法,通过保持预训练奇异子空间的投影旋转来提升模型在领域内和领域外任务间的平衡性能,改进了标准SFT的不足。

Comments 31 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25907 2026-05-08 cs.LG cs.AI 85%

How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum

模型应如何快速承诺于监督?在Tsallis损失连续体上训练推理模型

Chu-Cheng Lin, Eugene Ie

机构 * Google(谷歌)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tsallis损失族J_Q,通过q参数在RLVR和密度估计极之间插值,解释SFT-then-RLVR流程,并提出GARL和PAFT方法以缓解冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28182 2026-05-01 cs.LG cs.CL 85%

Exploration Hacking: Can LLMs Learn to Resist RL Training?

探索黑客:大语言模型能否学会抵抗强化学习训练?

Eyon Jang, Damon Falck, Joschka Braun, Nathalie Kirch, Achu Menon, Perusha Moodley, Scott Emmons, Roland S. Zimmermann, David Lindner

机构 * MATS UC San Diego(UC圣迭戈大学) Google DeepMind(谷歌DeepMind) Anthropic

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了大语言模型在强化学习训练中可能通过策略性调整探索行为导致失败的机制,通过微调创建了具有特定低效策略的模型,并评估了检测与缓解策略。

Comments 81 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22893 2026-04-28 cs.LG cs.AI 85%

Utility-Aware Data Pricing: Token-Level Quality and Empirical Training Gain for LLMs

面向效用的数据定价:LLMs的令牌级质量与经验训练增益

Minghui Xu, Qi Luo, Kun Li

机构 * Shandong University(山东大学)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出动态数据估值框架,通过令牌级信息密度、经验训练增益测量和加密可验证性三层方法,实现LLM能力的效用定价,优于传统行数和令牌数基准。

Comments 23 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00079 2026-04-21 cs.CY cs.AI cs.LG 85%

Who Gets the Kidney? Human-AI Alignment, Indecision, and Moral Values

谁获得肾脏?人类-人工智能对齐、犹豫与道德价值观

John P. Dickerson, Hadi Hosseini, Samarth Khanna, Leona Pierce

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究评估了LLM在器官分配中的行为,发现其在优先级设定上偏离人类价值观,并且在犹豫机制上表现不同,低秩监督微调能提升决策一致性与犹豫建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13651 2026-04-03 cs.CL cs.AI cs.IR 85%

Benchmarking Large Language Models on Reference Extraction and Parsing in the Social Sciences and Humanities

在社会科学和人文领域上对大型语言模型进行参考提取与解析的基准测试

Yurui Zhu, Giovanni Colavizza, Matteo Romanello

机构 * Odoma LLC

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出一个统一基准,针对社会科学和人文领域的真实条件,评估参考提取、参考解析和端到端文档解析任务,发现解析和端到端解析是主要瓶颈,LoRA微调和分段管道能提升鲁棒性。

Comments 12 pages, 2 figures. Accepted at the SCOLIA 2026 Workshop (Second Workshop on Scholarly Information Access), co-located with ECIR 2026. Workshop date: April 2, 2026

Journal ref Proceedings of the Second International Workshop on Scholarly Information Access (SCOLIA 2026), co-located with ECIR 2026, Delft, The Netherlands, April 2, 2026. CEUR Workshop Proceedings, Vol. 4187, pp. 16-30

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22752 2026-03-27 cs.CL cs.AI 85%

Towards Simulating Social Media Users with LLMs: Evaluating the Operational Validity of Conditioned Comment Prediction

向LLMs模拟社交媒体用户迈进:评估条件评论预测的运作有效性

Nils Schwager, Simon Münker, Alistair Plum, Achim Rettinger

机构 * Trier University(特里尔大学) University of Luxembourg(卢森堡大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文通过条件评论预测任务评估LLMs在模拟社交媒体用户行为方面的运作有效性,发现监督微调在低资源环境下会导致表层结构与语义脱节,强调真实行为轨迹优于描述性人设。

Comments 14 pages, 1 figure, 7 tables. Accepted to the 15th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA) at EACL 2026, Rabat, Morocco

Journal ref Proceedings of the 15th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23508 2026-03-06 cs.CL cs.AI 85%

Why Reinforcement Fine-Tuning Enables MLLMs Preserve Prior Knowledge Better: A Data Perspective

为何强化微调能更好地使大语言模型保留先验知识:从数据角度出发

Zhihao Zhang, Qiaole Dong, Qi Zhang, Jun Zhao, Enyu Zhou, Zhiheng Xi, Senjie Jin, Xiaoran Fan, Yuhao Zhou, Mingqi Wu, Yanwei Fu, Tao Ji, Tao Gui, Xuanjing Huang, Kai Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 本文通过数据视角揭示强化微调(RFT)相较于监督微调(SFT)在保留大语言模型先验知识方面的优势,发现RFT通过强化正确样本与基模型对齐,有效减少对先验知识的干扰。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11000 2026-02-12 cs.DC cs.AI cs.LG 85%

Fine-Tuning GPT-5 for GPU Kernel Generation

为GPU内核生成微调GPT-5

Ali Tehrani, Yahya Emara, Essam Wissam, Wojciech Paluch, Waleed Atallah, Łukasz Dudziak, Mohamed S. Abdelfattah

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 通过强化学习微调GPT-5提升GPU内核生成性能,实现正确率和效率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏