arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11714 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11714 篇

2608.10867 2026-08-12 cs.LG 新提交 77%

Can Bayesian Optimization Efficiently Find a Strong Single Expert in Neural Thickets?

贝叶斯优化能否在神经丛中高效找到强单专家?

Nigel Bastian Cendra, Abdelhamid Ezzerg, Fernando Julio Cendra, Jeremias Knoblauch, Jakob Zeitler

机构 * University College London(伦敦大学学院) Institut Polytechnique de Paris(巴黎理工学院) University of Oxford(牛津大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文探究在适度评估预算下,贝叶斯优化能否在神经丛中高效找到强单专家,提出在权重空间随机线性嵌入中应用贝叶斯优化的无梯度方法,在Qwen2.5-Instruct模型基准测试中,该方法评估成本更低且性能优于随机优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24850 2026-08-12 cs.IR cs.LG 版本更新 77%

SearchArt: Training Long-Horizon Search Agent with Scalable Synthetic and Verified Task

SearchArt:使用可扩展的合成和经过验证的任务训练长视野搜索代理

Lang Mei, Xiaohan Yu, Chong Chen, Liyan Liu, Xiangnan Chen, Jinchao Ma, Chao Feng, Li Huang, Siyu Mo, Sichen Kang, Yunkun Xu, Zhihan Yang, Zhujun Xue, Jingren Zhang, Qing He, Yingdi Huang, Hao Jiang, Ziao Ma, Zewei Pan, Minhao Sun, Zhuo Tao, Jinzhao Xiao, Gangtao Xin, Huanyao Zhang, Wenjian Zhang, Jiangshan Zhang, Guojie Zhu, Fangzhou Zou, Jiaxin Mao, Wentao Zhang

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 针对训练长视野搜索代理的挑战,SearchArt提出通过验证驱动任务合成及多阶段训练管道的框架,构建大规模数据集并验证数据可靠性,经此训练的代理在多基准测试中表现出色,参数少却成绩优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00035 2026-08-12 cs.CR cs.AI 版本更新 77%

Protecting Creative Writing Copyright against AI Imitation via Implicit Watermarking

你的写作是否被AI模仿?通过隐形水印在创意写作中揭露模仿

Ziwei Zhang, Juan Wen, Wanli Peng, Zhengxian Wu, Yinghan Zhou, Yiming Xue

机构 * College of Information and Electrical Engineering, China Agricultural University, Beijing, China(信息与电气工程学院,中国农业大学,北京,中国)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出WIND方法,通过隐含编码在创意写作中实现可验证的版权保护,有效对抗AI模仿,达到高准确率的验证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09880 2026-08-11 cs.CV cs.LG 新提交 77%

Financial Numerical Prediction and Allocation as Token Generation

金融数值预测与分配:以 token 生成的方式实现

Xu Ouyang, Moontae Lee

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 本研究提出 FinATOM 框架,通过因果语言模型的 token 生成实现金融数值预测与 ETF 分配,在多组测试中显著提升了夏普比率与累计收益,验证了该方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28533 2026-08-11 cs.CL 版本更新 77%

GraphWalker: Agentic Knowledge Graph Question Answering via Synthetic Trajectory Curriculum

GraphWalker: 通过合成轨迹课程实现基于知识图谱的代理问答

Shuwen Xu, Yao Xu, Jiaxiang Liu, Chenhao Yuan, Wenshuo Peng, Jun Zhao, Kang Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 指令微调 :SFT(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 GraphWalker通过自动化轨迹合成和分阶段微调解决知识图谱问答中的探索与泛化问题,提升轻量强化学习性能,在CWQ和WebQSP上取得最优效果。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19897 2026-08-10 cs.LG 版本更新 77%

Self-Distillation Enables Continual Learning

自蒸馏使持续学习成为可能

Idan Shenfeld, Mehul Damani, Jonas Hübotter, Pulkit Agrawal

机构 * MIT(麻省理工学院) Improbable AI Lab(Improbable AI实验室) ETH Zurich(苏黎世联邦理工学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);foundation model(abstract);分类 cs.LG

AI总结 自蒸馏微调通过直接从演示中进行基于策略的学习,有效减少持续学习中的灾难性遗忘,提升新任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03605 2026-08-05 cs.AI 新提交 77%

FraQ: Efficient Coordinate-Space Recompression for Federated Low-Rank Adaptation

FraQ:用于联邦低秩适配的高效坐标空间重压缩方法

Shenghui Li, Thiemo Voigt

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FraQ是一种联邦低秩适配的高效坐标空间重压缩方法,可在接近未压缩基线准确率的同时减少下行通信,降低服务器端重压缩开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03341 2026-08-05 cs.SE cs.AI 新提交 77%

Route-Align-Verify for Functional Correctness in Code Generation

用于代码生成功能正确性的Route-Align-Verify

Erxue Zhou, Jingxiang Meng, Aofan Liu

机构 * Software Engineering Institute, East China Normal University(华东师范大学软件工程学院) University of Chicago(芝加哥大学) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出RAV框架,通过Route、Align、Verify三阶段协同优化,在不修改骨干模型的情况下,于MBPP基准上实现代码生成功能正确性的显著提升,性能优于基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27703 2026-08-05 cs.AI 版本更新 77%

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理

Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen, Caijun Yan, Jianyao Xu, Shunyu Liu, Weijie Fu, Peiliang Li, Xiaozhi Chen, Yuxiang Cai

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本研究提出SpatialCLI框架,通过三个阶段让视觉语言模型先借助专用空间工具推理,再内化感知能力,在MindCube上大幅提升了Qwen3-VL-8B-Instruct的性能,表现优于对比模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28568 2026-07-31 cs.CL 新提交 77%

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering

Frontis-MA1:训练AI4AI模型以实现机器学习工程中的递归自我改进

Junlin Yang, Che Jiang, Yu Fu, Tianwei Luo, Can Ren, Weizhi Wang, Kaikai Zhao, Hongyi Liu, Yuxin Zuo, Yuru Wang, Yuchen Fan, Kai Tian, Zhenzhao Yuan, Xiaojian Lin, Li Sheng, Rushi Qiang, Guoli Jia, Xingtai Lv, Ermo Hua, Dianqiao Lei, Youbang Sun, Ning Ding, Bowen Zhou, Kaiyan Zhang

专题命中 指令微调 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.CL

AI总结 该研究推出面向MLE中RSI研究的开源全栈系统OpenMLE,后训练Frontis-MA1(35B)作为元进化智能体,在多个基准测试中提升性能,相关模型与系统已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01097 2026-07-30 cs.LG 版本更新 77%

Understanding LoRA as Knowledge Memory: An Empirical Analysis

理解LoRA作为知识记忆:一项实证分析

Seungju Back, Dongwoo Lee, Naun Kang, Taehee Lee, S. K. Hong, Youngjune Gwon, Sungjin Ahn

机构 * New York University(纽约大学)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过系统实证研究,将低秩适配(LoRA)作为模块化知识记忆,探索其存储容量、内部化优化、多模块系统扩展及长上下文推理能力,提供LoRA记忆操作边界的实用指导。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26015 2026-07-29 cs.CL 新提交 77%

Instruction-Tuned Models Locally Reuse Human Syntax More Than Humans Do

指令微调模型在局部比人类更多地复用人类句法

Zandi Eberstadt

机构 * University of Oxford(牛津大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 研究大语言模型是否像人类一样句法趋同,通过替换范式数据在多个模型测量CFG规则复用。发现各模型与前一轮人类话语规则重叠多,指令微调模型有特点,还在词汇和语义相似度上有表现,揭示了模型在句法复用方面与人类的异同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24783 2026-07-29 cs.AI 新提交 77%

Unified Semantic Modeling Framework for Large-Scale Job Understanding at LinkedIn

领英大规模职位理解的统一语义建模框架

Dan Xu, Baofen Zheng, Jianqiang Shen, Qi Xiao, Benjamin Hoan Le, Wen Pu, Saurabh Gupta, Ran Zhou, Neha Saraf, Alice Leung, Qianqi Shen, Liangjie Hong, Jingwei Wu, Wenjing Zhang

机构 * LinkedIn Corporation(领英公司)

专题命中 指令微调 :language model(abstract);small language model(abstract);SLM(abstract);分类 cs.AI

AI总结 领英为应对职位理解系统构建挑战,提出统一语义建模框架。先微调小型语言模型,再引入多适配器架构。经离线评估和在线A/B测试,该框架提升了性能、降低了复杂性,为构建行业规模文本理解系统提供实用见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14405 2026-07-29 cs.CL 77%

Adding LLMs to the psycholinguistic norming toolbox: A practical guide to getting the most out of human ratings

Javier Conde, María Grandury, Tairan Fu, Carlos Arriaga, Gonzalo Martínez, Thomas Clark, Sean Trott, Clarence Gerald Green, Pedro Reviriego, Marc Brysbaert

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02271 2026-07-29 cs.AI 版本更新 77%

Real-time Spatial Retrieval Augmented Generation for Urban Environments

城市环境的实时空间检索增强生成

David Nazareno Campo, Javier Conde, Álvaro Alonso, Gabriel Huecas, Joaquín Salvachúa, Pedro Reviriego

机构 * ETSI de Telecomunicación, Universidad Politécnica de Madrid(电信工程学院,马德里理工大学) FIWARE Foundation(FIWARE基金会)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 针对城市环境中基础模型更新难及传统RAG架构不适用问题,提出实时空间RAG架构,利用链接数据的时空过滤能力,借助FIWARE实现,通过马德里旅游助手用例验证了该架构能正确集成基础模型。

Journal ref ACM Transactions on Intelligent Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15845 2026-07-28 cs.AI 版本更新 77%

Knowledge-Centric Agents for Workflow Generation in ComfyUI

用于工作流生成的以知识为中心的智能体

Zhendong Li, Lei Sun, Ruibo Ming, He Zhang, Danda Pani Paudel, Luc Van Gool, Jinjin Gu

机构 * INSAIT(未知机构) Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”分校) Adobe Research(Adobe研究院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视觉创作系统中工作流生成问题,提出以知识为中心的框架,通过知识反转、注入和可逆推理进行工作流生成,实验证明该方法生成的工作流在多样性、结构连贯性和执行成功率上优于现有系统。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22039 2026-07-27 cs.CL 新提交 77%

Enough is as good as a feast: A Comprehensive Analysis of How Reinforcement Learning Mitigates Task Conflicts in LLMs

过犹不及:强化学习如何减轻大语言模型中任务冲突的综合分析

Zixuan Ren, Jinliang Lu, Junhong Wu, Yang Zhao, Dai Dai, Hua Wu, Haifeng Wang, Chengqing Zong

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc.(百度公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 研究对比强化学习与监督微调训练的大语言模型的合并行为,经五项任务评估发现强化学习能减少任务冲突及合并后性能下降。通过实验和分析揭示三个关键因素,表明强化学习在模型合并中更具优势。

Comments Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20270 2026-07-23 cs.CL 新提交 77%

Which Values Do LLMs Confuse? A Schwartz-Based Recognition Study

大语言模型混淆了哪些价值观?基于施瓦茨的识别研究

Andrei Chetvergov, Stepan Ukolov, Timofei Sivoraksha, Alexander Evseev, Mikhail Solovev, Valeriia Kuschenko, Maria Chistyakova, Sergey Bolovtsov

机构 * Ivannikov Institute for System Programming of the Russian Academy of Sciences(俄罗斯科学院伊万尼科夫系统编程研究所) Russian Presidential Academy of National Economy and Public Administration(俄罗斯总统国民经济与公共管理学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型对施瓦茨十个基本价值观的识别,通过俄语情境文本评估 21 个指令微调的模型运行,分析准确率、混淆情况等,推动结合精确准确率、排序恢复和有向错误分析的价值识别评估。

Comments 14 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09767 2026-07-23 cs.SD cs.CL eess.AS 版本更新 77%

UtterTune: LoRA-Based Target-Language Pronunciation Edit and Control in Multilingual Text-to-Speech

UtterTune:基于LoRA的多语言文本到语音中目标语言发音编辑与控制

Shuhei Kato

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究提出UtterTune轻量级方法,用于适配多语言TTS系统。利用低秩适应,在零样本设置下对目标语言日语实现音素级发音控制,保持自然度和说话者相似度,经评估证实该方法有效。

Comments 7 pages. Corrects the accent-correctness evaluation to the crowdsourced listening test (v3 inadvertently reported the earlier author-scored results), and adds a note on the precedence of the proposed token-based pronunciation-control method relative to a subsequent technical report, together with links to the released code, training/evaluation data, LoRA weights, and audio samples

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28583 2026-07-15 cs.CV cs.AI cs.MM 版本更新 77%

Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering

穿越幻象:一种双路径代理框架用于鲁棒的误导图表问答

Yanjie Zhang, Yafei Li, Rui Sheng, Zixin Chen, Yanna Lin, Huamin Qu, Lei Chen, Yushi Sun

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出ChartCynics双路径框架,通过分离感知与验证,利用诊断视觉路径和OCR驱动数据路径解决图表误导问题,提升模型鲁棒性。

Comments 10pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07023 2026-07-09 cs.LG 新提交 77%

Online Data Selection Is Implicit Alignment

在线数据选择即隐式对齐

Aoxiong Zeng, Yuxin Yang, Xiangquan Yang

机构 * East China Normal University(华东师范大学) Shanghai University(上海大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);preference optimization(abstract);分类 cs.LG

AI总结 研究将在线数据选择视为隐式对齐机制,给定相同条件比较多种在线选择器在无偏好优化时引起的行为漂移,提出评估和量化方法,引入ADA和AAS,可在保持数据效率时限制安全和风格轴漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00572 2026-07-09 cs.AI cs.CR 新提交 77%

HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment

HARC:耦合有害性与拒绝方向以实现鲁棒的安全对齐

Shei Pern Chua, Hao Wu, Qianli Ma, Fangzhao Wu

机构 * Tsinghua University(清华大学) Southeast University(东南大学) Microsoft(微软公司)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出HARC微调方法,通过耦合提示和响应位置的有害性与拒绝方向,在不损害通用能力的情况下提升LLM安全对齐的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04619 2026-07-07 cs.SD cs.CL 新提交 77%

CARD: Cross-component Audio Representation Distillation for Encoder-Free Audio Captioning

CARD:用于无编码器音频字幕的跨组件音频表示蒸馏

Ganesh Pavan Kartikeya Bharadwaj Kolluri, Yuchen Zhang, Michael Kampouridis, Ravi Shekhar

机构 * School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院) Institute for Analytics and Data Science, University of Essex(埃塞克斯大学分析与数据科学研究所)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究提出无编码器音频字幕模型CARD,去除推理时的编码器,用含合并LoRA适配器的投影仪给冻结的语言模型供能。通过跨组件蒸馏预训练音频教师模型,提升了CIDEr-D指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10784 2026-07-07 cs.LG 77%

Preconditioned Inexact Stochastic ADMM for Deep Model

预条件近似随机ADMM用于深度模型

Shenglong Zhou, Ouya Wang, Ziyan Luo, Yongxu Zhu, Geoffrey Ye Li

机构 * School of Mathematics and Statistics, Beijing Jiaotong University, China(北京交通大学数学与统计学院,中国) ITP Lab, Department of EEE, Imperial College London, UK(帝国理工学院伦敦分校电子工程系ITP实验室,英国) National Mobile Communications Research Laboratory, Southeast University, China(东南大学国家移动通信研究实验室,中国)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出PISA算法,通过预条件技术解决分布式数据异质性问题,提升深度模型训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16331 2026-07-07 cs.CL 版本更新 77%

Re:Form -- Reducing Human Annotations in Scalable Formal Software Verification with RL in LLMs: A Preliminary Study on Dafny

Re:Form——利用大语言模型中的强化学习减少可扩展形式化软件验证中的人工标注:关于Dafny的初步研究

Chuanhao Yan, Fengdi Che, Xuhan Huang, Xu Xu, Xin Li, Yizhi Li, Xingwei Qu, Jingzhe Shi, Chenghua Lin, Yaodong Yang, Binhang Yuan, Hang Zhao, Yu Qiao, Bowen Zhou, Jie Fu

机构 * Shanghai AI Lab(上海人工智能实验室) University of Alberta(阿尔伯塔大学) Tsinghua University(清华大学) Chinese University of Hong Kong, Shenzhen(香港大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Nanyang Technological University(南洋理工大学) University of Manchester(曼彻斯特大学) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 研究利用形式语言Dafny减少人工标注,核心方法是引入自动可扩展数据处理流程及结合形式语言验证器反馈的强化学习设计,主要贡献是提升模型在DafnyComp基准测试表现。

Comments Published in Transactions on Machine Learning Research (TMLR), 05/2026. Reviewed on OpenReview: https://openreview.net/forum?id=cAQmIS4GOe

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02010 2026-07-03 cs.AI 新提交 77%

InduceKV: Fixed-Footprint Continual Adaptation of Multimodal LLMs via Inducing KV Memories

InduceKV: 通过诱导KV记忆实现多模态大语言模型的固定足迹持续适应

Qianyu Chen, Ziteng Feng, Canran Xiao, Runxuan Tang

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 提出InduceKV方法,通过检索将训练前缀存储为注意力就绪的记忆条目,在固定内存预算下实现多模态大语言模型的持续适应,无需更新骨干模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31392 2026-07-01 cs.AI 新提交 77%

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

ReGRPO: 用于工具使用智能体的反思增强策略优化

Binjie Zhang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出ReGRPO框架,通过反思数据引擎和联合优化反射令牌与纠正动作,提升工具使用智能体在故障后的恢复能力,在GTA和GAIA上取得最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29256 2026-06-30 stat.ML cs.LG 77%

Generalization Analysis of Transformers in Distribution Regression

Transformer在分布回归中的泛化分析

Peilin Liu, Ding-Xuan Zhou

机构 * School of Mathematics and Statistics, University of Sydney(悉尼大学数学与统计学学院)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出基于分布回归的Transformer学习框架,通过注意力算子实现分布到函数表示的无损压缩,并证明其在学习复杂结构泛函上优于CNN和全连接网络,最后给出泛化界并解释大模型技术原理。

Journal ref Neural Computation 37(2):260-293, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28436 2026-06-30 cs.SE cs.AI 77%

Dockerless: Environment-Free Program Verifier for Coding Agents

Dockerless: 面向编码智能体的无环境程序验证器

Wenhao Zeng, Yuling Shi, Xiaodong Gu, Chao Hu, Chaofan Wang, Yuhao Cui, Hongting Zhou, Mengnan Qi, Jianqiao Wangni, Zhaojian Yu, Shuzheng Gao, Kai Cai, Shilin He

专题命中 指令微调 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 提出Dockerless,一种无需执行代码即可验证补丁正确性的智能体验证器,通过智能体仓库探索收集证据判断补丁正确性,在验证基准上超越最强开源验证器14.3 AUC点,并实现完全无环境的训练后流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09038 2026-06-30 cs.AI 77%

SearchSkill: Teaching LLMs to Use Search Tools with Evolving Skill Banks

SearchSkill: 教授大语言模型使用搜索工具与演进技能库

Jinchao Hu, Meizhi Zhong, Kehai Chen, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院) TikTok Inc, Beijing(字节跳动北京公司)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 SearchSkill通过可重用的搜索技能显式规划查询,提升开放域问答中的检索效率和推理质量,改进了知识密集型问答基准的精确匹配表现。

详情

展开后加载摘要…

URL PDF HTML 收藏