arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-28 至 2026-08-28 共收录 37 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 37 篇

2608.27420 2026-08-28 cs.CL 新提交 92%

Boosting LLM Exploration via Weak-Model Guidance in RLVR

通过RLVR中的弱模型引导增强大语言模型探索能力

Xingyu Shen, Huishuai Zhang, Peng Li, Yinchun Wang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) National Engineering Research Center of New Electronic Publishing Technologies(国家新型电子出版技术工程研究中心)

专题命中 指令微调 :LLM(title,summary_cn);SFT(abstract,abstract_cn);language model(abstract);prompting(abstract)

AI总结 本研究提出弱模型引导的RLVR方法,通过弱模型的部分推理轨迹增强LLM探索,缓解熵崩溃,在数学基准上提升大k值下的推理性能与覆盖范围。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26651 2026-08-28 cs.CR 新提交 91%

Beyond Vector Hiding: Breaking and Mitigating Shared-Direction Weight Obfuscation in TEE-Offloaded Large Language Models

超越向量隐藏:破解与缓解TEE卸载大语言模型中的共享方向权重混淆

Menghui Zhang, Aoying Zheng, Guoxiao Liu, Zizhuang Deng, Jiejing Wen, Jincheng Zhuang, Ran Tao

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 该研究针对TEE卸载LLM中的共享方向权重混淆,提出SpectralLeak、LatticeLeak攻击破解方案,并设计ButterflyCloak防御方案,实现高效破解与防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21599 2026-08-28 cs.IR cs.AI cs.LG 版本更新 91%

Refine-POI: Reinforcement Fine-Tuned Large Language Models for Next Point-of-Interest Recommendation

Refine-POI: 通过强化微调优化大型语言模型用于下一步兴趣点推荐

Peibo Li, Shuang Ao, Hao Xue, Yang Song, Maarten de Rijke, Johan Barthélemy, Tomasz Bednarz, Flora D. Salim

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 Refine-POI通过拓扑感知ID生成和强化微调,解决LLMs在POI推荐中的语义连续性和top-k推荐问题,提升推荐准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26124 2026-08-28 cs.CL 新提交 90%

Natural-Language Policies to Executable Decisions: An Interpretable Large Language Model Framework

从自然语言政策到可执行决策:一种可解释的大语言模型框架

Ziqiang Zhang, Jing Ma, Zilong Wang, Jiayuan Chen, Yi Qiao, Yu He, Wei Zhang, Dai Cheng, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(东方理工大学宁波数字孪生研究院)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 针对旅游业定价自动化的挑战,提出一种可解释的LLM驱动定价系统,通过结构化提取、确定性数值计算等实现可靠可审计的定价,部署后大幅缩减团队规模并缩短订单处理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11515 2026-08-28 cs.LG cs.AI cs.CL 版本更新 89%

AirLLM: Diffusion Policy-based Adaptive LoRA for Remote Fine-Tuning of LLM over the Air

AirLLM:面向空中远程微调的基于扩散策略的自适应LoRA方法

Shiyi Yang, Xiaoxue Yu, Rongpeng Li, Jianhang Zhu, Zhifeng Zhao, Honggang Zhang

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Zhejiang Lab(浙江实验室)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AirLLM是一种分层扩散策略框架,通过PPO智能体与DDIM交替优化实现自适应LoRA秩配置,可提升LLM空中远程微调性能并降低传输成本。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26188 2026-08-28 cs.AI 新提交 89%

Is Your Neighborhood Safe? Place-based Stigma in Large Language Models' Urban Safety Judgments

你的社区安全吗?大型语言模型城市安全判断中的基于地点的污名

Huy Nguyen, Yue Lin

机构 * Augustana College(奥古斯塔纳学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 该研究探究大型语言模型的城市安全判断是否受社区名称携带的人口刻板印象影响,发现名称会降低边缘化群体占比高的社区的安全评分,移除名称可减少偏见与准确性损失。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26762 2026-08-28 cs.CL cs.IR cs.LG 新提交 89%

Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers

排名质量相当,决策却不同:训练顺序一致的大语言模型评分器

Markus Frohmann, Mahdiyar Alavi, Elizabeth Lingg, Navid Rekabsaz

机构 * Thomson Reuters Labs(汤姆森路透实验室) University of Toronto(多伦多大学) Vector Institute(矢量研究所)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究发现排名质量相当的大语言模型评分器决策存在差异,提出OC-SFT方法减弱顺序依赖性,提升决策稳定性,建议对比研究需报告阈值保留内容和读者回答而非仅排名质量。

Comments 9 pages main text, 45 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26126 2026-08-28 cs.CL cs.IT 新提交 88%

TelecomGPT-R1: A Unified Open-Source Reasoner for the Telecom Stack

TelecomGPT-R1:面向电信栈的统一开源推理器

Bohao Wang, Chenwei Wu, Haoyu Li, Hang Zou, Yu Tian, Lina Bariah, Li Wei, Chongwen Huang, Yongliang Shen, Zhaoyang Zhang, Merouane Debbah

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究发布开源电信推理器TelecomGPT-R1-9B,通过两阶段后训练方案优化,在公开电信基准中表现优于同类开源模型,性能接近闭源前沿推理器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27167 2026-08-28 cs.AI cs.CL 新提交 88%

Calibrated Enough to Know, Not Calibrated to Act: Fabricated Evidence Makes LLM Agents Commit to the Unknowable

足够校准以知晓,却未校准以行动:伪造证据使大语言模型智能体对不可知之事作出承诺

Pranav Aggarwal

专题命中 指令微调 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 该研究发现LLM智能体易被伪造证据诱导对不可知问题作出错误承诺,其「行动/弃权(不执行)」闸门可通过合成案例微调优化,但对僵化响应格式敏感,部署需兼顾这一特性。

Comments 28 pages, 6 figures. Code, data, pre-registration and all cached model outputs: this https URL (https://github.com/Pranav-1100/confidence-calibration-evaluation). Also archived at Zenodo, DOI https://doi.org/10.5281/zenodo.22043517

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27449 2026-08-28 cs.SE cs.AI cs.CL 新提交 87%

SWE-Prime: Fewer Trajectories, Better Performance

SWE-Prime:更少轨迹,更优性能

Dewu Zheng, Ruizhe Ye, Yanlin Wang, Yang Ye, Hongyu Zhang, Ensheng Shi, Xilin Liu, Yuchi Ma, Jianxing Yu, Zibin Zheng

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SWE-Prime是一种多粒度两阶段SFT数据选择方法,在SWE-Bench基准上仅用10%轨迹训练,就实现了优于全数据集训练的软件问题解决性能,相对提升最高达24.2%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22963 2026-08-28 cs.AI cs.CL 版本更新 87%

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

被文本债务掩埋:面向多模态大语言模型智能体的保留视觉证据的上下文剪枝

Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型智能体长轨迹中文本主导上下文、抑制视觉证据的问题,提出基于KL引导的SPARE框架,结合OPSD与SFT实现高效剪枝,在多步视觉工具使用基准中达到最优准确率与剪枝比例的权衡。

Comments 17 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-08-28 cs.IR 版本更新 87%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26661 2026-08-28 cs.IR 新提交 86%

When Does Supervised Fine-Tuning Reduce Instruction Sensitivity?

监督微调何时会降低指令敏感性?

Jaekeol Choi

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究探讨了监督微调(SFT)对大型语言模型指令敏感性的影响,发现SFT的稳健性效应因模型规模、类型及适应设置而异,且敏感性还受预测评分协议影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26197 2026-08-28 cs.SE 新提交 86%

Harness Engineering for Predictable Agentic Systems: An Empirical Study of Deterministic Execution Constraints

利用工程实现可预测的智能体系统:确定性执行约束的实证研究

Saransh Dhage

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过实证探究harness工程中确定性执行约束对LLM智能体的影响,发现添加结构化规划可提升可复现性与任务成功率,但延迟存在模型依赖的成本差异。

Comments 9 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24168 2026-08-28 cs.CL cs.SD 版本更新 85%

FireRedAudio: A General-Purpose Audio Language Model with Decoupled Continuous Representations for Understanding and Generation

FireRedAudio:一种具有解耦连续表示的通用音频语言模型,用于理解与生成

Feiyu Shen, Fenglong Xie, Junjie Li, Kun Xie, Lei Xie, Xu Tang, Xuelong Geng, Yan Jia, Yao Hu, Yichen Han, Yichen Wu, Ziqi Dai, Junjie Chen, Kai Huang, Manzhen Wei, Yixuan Li

机构 * Xiaohongshu(小红书)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 FireRedAudio是首个公开的统一音频-语言模型,采用解耦连续表示,支持音频理解、多语种ASR、各类TTS及语音编辑,性能优于相关模型。

Comments 20 pages, 3 figures. In this revision, the author list is ordered alphabetically by given name and an author-contribution statement is added; the technical content is unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02502 2026-08-28 cs.CL 版本更新 85%

CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning

CRAM:面向多模态持续指令调优的质心路由与自适应MoE

Jun-Tao Tang, Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CRAM方法,通过将任务特定模式隔离到独立模块、自适应秩实例化动态分配参数、质心路由激活现有专家以及正交惩罚约束更新方向,解决了多模态持续指令调优中任务竞争导致遗忘和参数效率低下的问题。

Comments Accepted to EMNLP 2026 (Main Conference). Code is available at [this URL]( this https URL (https://github.com/LAMDA-CL/EMNLP2026-CRAM) )

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27070 2026-08-28 cs.LG cs.CL 新提交 85%

Unifying Detection and Adaptation in Task-Free Continual Learning

统一无任务持续学习中的检测与适配

Dezheng Han, Anbang Zhang, Zhihao Zhu, Shuaishuai Guo

机构 * School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) The Hong Kong University of Science and Technology(香港科技大学) Shandong University(山东大学) Qilu Hospital of Shandong University(山东大学齐鲁医院)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出FiUni框架,通过K-FAC近似的Fisher主子空间正交性检测批量级任务,结合LoRA实现参数高效适配,动态平衡知识共享与任务隔离,缓解LLM持续学习的灾难性遗忘,性能优于先进方法且参数更少。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26155 2026-08-28 cs.CL cs.AI 新提交 85%

VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation

VFA:通过无视觉适配赋能多语言多模态大语言模型

Yixia Li, Yaqing Shi, Zhiwen Ruan, Dongdong Zhang, Lingjie Jiang, Shaohan Huang, Yun Chen, Guanhua Chen, Furu Wei

机构 * Southern University of Science and Technology(南方科技大学) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Peking University(北京大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本研究针对多模态大语言模型的英语中心化问题,提出VFA框架,通过组合任务向量实现多语言增强与视觉对齐解耦,仅用少量数据就提升了多语言模型性能并保留原有能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18383 2026-08-28 cs.CL cs.AI 版本更新 85%

MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation

MENTOR: 通过灵活的教师优化奖励进行工具使用蒸馏的强化学习

ChangSu Choi, Hoyun Song, Dongyeon Kim, Minkyung Cho, WooHyeon Jung, Sunjin Park, NohHyeob Bae, Seona Yu, KyungTae Lim

机构 * Seoul National University of Science and Technology(首尔科学技术大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) LG CNS

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 提出MENTOR方法,通过灵活的教师优化奖励结构,平衡行为对齐与下游性能,提升小模型在工具使用任务中的域外泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27417 2026-08-28 cs.CV 新提交 83%

Retrieval Heads Meet Vision: Uncovering How VLMs Locate and Extract Visual Information

检索头与视觉结合:揭示视觉语言模型如何定位和提取视觉信息

Chanho Park, Daehyeon Choi, Jihyun Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 该研究发现视觉语言模型(VLMs)中存在视觉检索头(VRHs),其占注意力头的1.7%-2.6%,负责将文本描述与图像区域建立因果关联,屏蔽前20个VRHs可使定位准确率降低多达80个百分点,且VRHs具备泛化性、功能特异性与架构共享性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22631 2026-08-28 cs.LG 版本更新 81%

Learning Generalizable Behaviors for Terminal Agents

学习终端智能体的可泛化行为

Yihang Yao, Bo Pang, Xuan Phi Nguyen, Ding Zhao, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce人工智能研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究针对终端智能体泛化问题,提出智能体组合泛化假设,开发训练方案River,其用不足30%的TMax环境使多规模模型在两个基准上RL增益平均提升超100%,且性能优于开源8B模型、可跨多维度泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18325 2026-08-28 cs.LG stat.ML 版本更新 81%

Learning to Reason with Curriculum I: Provable Benefits of Autocurriculum

学习与课程学习:自课程学习的可证明收益

Nived Rajaraman, Audrey Huang, Miro Dudik, Robert Schapire, Dylan J. Foster, Akshay Krishnamurthy

机构 * Microsoft Research(微软研究院)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文研究了自课程学习在提升语言模型推理能力方面的有效性,通过自适应数据选择技术,在监督微调和强化学习中分别减少了训练数据和计算成本。

Comments 39 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26743 2026-08-28 cs.AI 新提交 79%

Graph-Guided Selective Unlearning for Language Models: Controlling Support Routes Beyond Forget Seeds

面向语言模型的图引导选择性遗忘:控制遗忘种子之外的支持路径

Waqas Khan, Tabinda Sarwar, Jingyue Cong, Xun Yi, Estrid He

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 提出GRAPHSU图引导控制器,扩展语言模型选择性遗忘的删除范围,在TOFU和PISTOL基准上,相较仅种子基准降低最多49.5个百分点的软泄漏,验证控制支持路径的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26531 2026-08-28 cs.CV 新提交 78%

FAN-LoRA: A Fourier-Adaptive Nonlinear Low-Rank Adaptor for Medical Foundation Model Domain Adaptation

FAN-LoRA:用于医学基础模型领域适应的傅里叶自适应非线性低秩适配器

Ziquan Liu, Zhewei Zhu, Xuyang Shi

机构 * School of Information and Control Engineering, Southwest University of Science and Technology(西南科技大学信息与控制工程学院)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 针对SAM迁移至医学成像的领域差距问题,提出FAN-LoRA架构,通过频率解耦微调实现结构与纹理补偿,在三类基准上优于现有PEFT方法,提升分割性能且兼顾效率。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27101 2026-08-28 cs.AI 新提交 77%

pro-team at LLMs4OL 2026 Tasks Flagship and Reuse: Retrieval-Augmented Generation and Vocabulary-Constrained Filtering for Ontology Learning

LLMs4OL 2026任务的团队:旗舰任务与复用:面向本体学习的检索增强生成及词汇约束过滤

Shivam Mishra, Dhannu Ram Meena, Muneendra Ojha, Krishna Pratap Singh, Kuldeep Singh

机构 * Indian Institute of Information Technology Allahabad(印度阿拉哈巴德信息技术学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 该团队针对LLMs4OL 2026挑战赛的两个本体学习任务,采用检索增强生成与词汇约束过滤方法,取得了特定指标结果,但存在未提取非分类关系的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15763 2026-08-28 cs.CL 版本更新 77%

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

TaoLive数字虚拟人智能体技术报告:训练智能体随其Harness进化

TaoLive AIGC LLM Team: Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen

机构 * TaoLive(陶境科技)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract);分类 cs.CL

AI总结 本研究针对直播电商数字虚拟人主播的实时需求,提出HAT方法,结合HSA的三阶段训练,使35B紧凑模型在低延迟下适配Harness变化,性能优于基础模型及通用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26820 2026-08-28 cs.CV 新提交 75%

LLaVAFlow: Preserving Latent Alignment Flow for Parameter-Efficient Multimodal Fine-Tuning

LLaVAFlow:用于参数高效多模态微调的潜在对齐流保留方法

Muyao Yuan, Muyan Jiao, Jiangyong Ying, Weizhan Zhang, Yuanhong Zhang, Lan Ma, Yuan Gao, Haipeng Du

机构 * MOEKLINNS China Telecom(中国电信)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 针对多模态大语言模型微调的灾难性遗忘问题,本文提出即插即用的LLaVAFlow框架,通过信息论蒸馏保留跨模态对齐流,提升下游任务性能与泛化能力。

Comments Accepted by ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26991 2026-08-28 cs.AI 新提交 70%

ASIL: Replacing Screenshot-and-Click with Structured State and Semantic Actions

ASIL:用结构化状态与语义动作替代截图点击

Rui Xie, Lu Chen

机构 * Shanghai Jiao Tong University(上海交通大学) BIGAI(北京智源人工智能研究院)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ASIL智能体-软件交互层,以结构化状态与语义动作替代低效的截图点击界面,在多应用基准任务中表现优于截图点击,还可提升Qwen系列模型的性能。

Comments Accepted to Findings of EMNLP 2026. 19 pages, 7 figures: 9-page main paper followed by limitations, ethics, acknowledgments, references, and appendices A-E. Project page: this https URL (https://sharryxr.github.io/ASIL/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26013 2026-08-28 cs.CL 版本更新 70%

VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following

VISA:用于多模态指令遵循的智能体式自进化数据合成

Min Zeng, Guanxin Tan, Libin Cen, Yafei Wen, Rui Hu, Liuyang Bian, Xiaolong Chen, Xiaoxin Chen

机构 * vivo AI Lab(vivo AI实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21491 2026-08-28 cs.LG 版本更新 70%

Stable but Wrong: When Learning Stabilizes Away from the Truth

在潜在可靠性下学习可能稳定地收敛到错误信念

Zhipeng Zhang

机构 * China Mobile Research Institute(中国移动研究院) China Mobile GBA (Greater Bay Area) Innovation Institute(中国移动广州湾创新院) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究探讨了在不可观测的反馈可靠性下,学习系统可能稳定收敛到错误信念的问题,提出MTR框架通过信任变量调节更新,减少偏差积累并提升恢复能力。

Comments 28 pages, 6 figures; substantially revised and refocused version. The title, conceptual framing, theoretical analysis, experiments, presentation, and author list have been extensively updated; supplementary material is included in the appendices

详情

展开后加载摘要…

URL PDF HTML 收藏