When Role-playing, Do Models Believe What They Say?
角色扮演时,模型是否相信它们所说的话?
机构 * MATS
专题命中 指令微调 :LLM(summary_cn,abstract_cn);language model(abstract);SFT(abstract);prompting(abstract)
AI总结 通过线性真实探针研究角色扮演对LLM内部表征的影响,发现角色扮演主要改变输出而非内部真实表征,而紧急错位则更显著地改变内部表征。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
角色扮演时,模型是否相信它们所说的话?
机构 * MATS
专题命中 指令微调 :LLM(summary_cn,abstract_cn);language model(abstract);SFT(abstract);prompting(abstract)
AI总结 通过线性真实探针研究角色扮演对LLM内部表征的影响,发现角色扮演主要改变输出而非内部真实表征,而紧急错位则更显著地改变内部表征。
Stage-1 控制熵状态,而非最终结果
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 本文通过小数据实验研究两阶段后训练中Stage-1(SFT或OPD)的作用,发现其主要影响策略熵状态,但对最终性能影响有限。
RASFT: 用于推理的滚动自适应监督微调
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; New Jersey Institute of Technology(新泽西理工学院) ; Institute of Computing Technology, CAS(中国科学院计算技术研究所)
专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出RASFT框架,通过基于策略rollout的问题级可解性校准专家监督,在模型困难时加强指导、表现可靠时放松模仿并纳入自生成轨迹,同时使用裁剪逆比约束策略漂移,在多个推理基准上优于SFT和RL方法。
单独无害,联合有害:在自进化大语言模型智能体中利用经验组合
专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本研究提出EvoBreak攻击,利用自进化LLM智能体的良性经验组合,结合BreakGym生成训练目标,在保持高无害性的同时优于现有攻击,揭示了新的安全风险。
设备优先反馈:面向移动端原生大语言模型驱动的神经网络架构搜索
机构 * University of Würzburg(维尔茨堡大学) ; CAIDAS ; IFI
专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 该研究提出自动化移动端部署闭环流水线,针对CIFAR-10、CIFAR-100基准在三星平板验证,发现GPU微调无法保证移动端性能单调提升,需多数据集设备端测量。
Comments 11 pages, 4 figures, 4 tables. Code: https://github.com/ABrain-One/nn-gpt
基于大语言模型的自动出价的策略感知参数高效适配
专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。
M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化
专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);prompting(abstract)
AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。
MidTool:面向智能体工具使用的训练中期数据合成
机构 * University of Washington(华盛顿大学) ; Snowflake(雪花公司) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本研究提出MidTool流水线,构建面向智能体工具使用的训练中期数据,在MidTool-Mix上微调Qwen3模型,可显著提升工具使用相关下游任务性能,证明通用工具使用需专门训练中期调整。
Comments Data & Model: https://hf.co/collections/MidTool/midtool-release
DEPT:用于统一查询扩展与检索的文档嵌入保留调优
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出DEPT方法,通过端到端训练单个仅解码器LLM实现统一查询扩展与检索,保留调优文档嵌入以解决移动目标问题,在BE基准数据集上提升了检索质量。
将小型大语言模型(LLM)训练为空间多智能体策略
专题命中 指令微调 :LLM(title_cn,summary_cn);分类 cs.LG
AI总结 该研究针对小型冻结LLM在空间合作博弈中表现不佳的问题,通过机械合成可行性守卫构建符号选项库,用PA-MAGRPO训练LoRA适配器,实现了小型LLM的有效多智能体策略,并揭示奖励与合作解耦,需结合行为评估。
结合检索增强生成流程的大语言模型优化与约束建模
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出结合检索增强生成的大语言模型优化建模方法,通过合成数据集与检索指导提升Qwen 3 30B Instruct的优化建模准确率,为低成本部署LLM优化工具提供可行方案。
Comments 20 pages, 3 figures
CLIFT:通过非侵入式闭环迭代微调将Gemini机器人端侧模型转化为人形机器人专家
机构 * University of California, Berkeley(加州大学伯克利分校) ; Google DeepMind(谷歌DeepMind) ; NVIDIA Research(英伟达研究院)
专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract);foundation model(abstract);分类 cs.AI
AI总结 本研究针对闭源机器人模型的托管式SFT API范式,提出CLIFT方法,在不访问模型内部机制的情况下,将Gemini机器人端侧模型经两次飞轮循环提升至接近完美的敏捷接触任务成功率。
HSS-Synth:面向大语言模型的人文社科数据合成
机构 * Zhejiang University(浙江大学) ; Inclusion AI, Ant Group(蚂蚁集团Inclusion AI) ; Peking University(北京大学) ; Qwen Team, Alibaba Group(阿里巴巴集团通义千问团队)
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文针对LLM的HSS数据稀缺问题,提出以学科为中心的HSS-Synth流水线,生成23.7万指令微调样本,使Qwen3-8B-Base达SOTA并提升相关能力。
Comments ACL Findings 2026 Paper
通过两步验证增强生成式信息抽取:产品属性用例
机构 * Computer Science Institute, Ruhr West University of Applied Sciences(鲁尔西应用科学大学计算机科学学院)
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对数字产品护照领域标注数据稀缺问题,提出集成PLM模块的两步验证生成式信息抽取方法,可提升LLM对低显著性实体的抽取性能,中型模型表现接近大型模型,最小型开源模型效果有限,还开发了对应演示应用。
Comments 13 pages
CHS-SQL:一种基于置信度引导启发式搜索模式链接过程的文本到SQL方法
机构 * Hainan COSCO Shipping Technology Co., Ltd.(海南中远海运科技有限公司)
专题命中 指令微调 :SLM(summary_cn,abstract);language model(abstract);small language model(abstract);分类 cs.AI
AI总结 研究针对文本到SQL任务,提出CHS-SQL框架,在模式链接阶段结合模型内部置信度进行启发式搜索,平衡精确率和召回率,在SQL生成时进一步优化候选查询,避免局部最优,通过SLM取得了文本到SQL任务的最新成果。
ZO-Act: 通过一次性激活信息低秩子空间实现高效零阶微调
机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) ; IBM T. J. Watson Research Center(IBM托马斯·J·沃森研究中心)
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出ZO-Act方法,利用输入激活构建固定低秩子空间,仅优化系数矩阵,降低扰动维度并支持Adam优化器,实现高效零阶微调,在多个LLM上取得一致提升。
超越干净文本:评估编码器和解码器在孟加拉语噪声文本事件检测中的鲁棒性
机构 * Jahangirnagar University(贾汉吉尔纳加尔大学) ; Rajshahi University of Engineering & Technology(拉杰沙希工程技术大学) ; Bangladesh University of Engineering and Technology(孟加拉国工程技术大学)
专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)
AI总结 针对孟加拉语事件检测在噪声文本中的鲁棒性问题,构建含9,979句标注的基准数据集,系统评估编码器模型(BanglaBERT、XLM-R)与解码器LLM(Llama 3、Gemma 3),发现解码器模型鲁棒性更强,而编码器模型在干净文本上表现更好但受噪声影响大。
Comments 17 pages, 8 figures
Qwen-AgentWorld: 通用智能体的语言世界模型
机构 * Qwen Team(Qwen团队)
专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);foundation model(abstract);分类 cs.CL
AI总结 提出基于语言模型的世界模型Qwen-AgentWorld,通过三阶段训练(CPT、SFT、RL)模拟7个领域的智能体环境,并构建AgentWorldBench基准,实验表明其显著优于现有模型,且能作为环境模拟器和智能体基础模型提升下游性能。
社会结构在三维人-人交互生成中的重要性
机构 * University of New South Wales(新南威尔士大学) ; National University of Singapore(新加坡国立大学) ; NVIDIA(英伟达) ; Nanjing University(南京大学) ; University of Technology Sydney(悉尼科技大学) ; Australian National University(澳大利亚国立大学)
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出Solo-to-Social框架,利用LLM规划社会结构(阶段分解、角色分配)并指导运动执行器生成协调的双人3D运动,解决文本驱动的人-人交互生成问题。
迈向无风险的开源权重模型:在LLM中分离公共与私有能力
机构 * Mila and McGill University(Mila和麦吉尔大学) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ; ServiceNow Research(ServiceNow研究) ; McGill-NLP/tiered-language-models(麦吉尔-自然语言处理/分层语言模型)
专题命中 指令微调 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出层级语言模型(TLM),通过单一权重集和秘密密钥实现多级能力控制,公共配置保持基础能力,密钥配置解锁私有能力,抵抗微调提取和密钥部分泄露。
Comments Preprint. 28 pages
EstRTL:功能估计引导的RTL代码生成
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ; Defense Innovation Institute, Academy of Military Science (AMS)(军事科学院创新院) ; School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) ; Key Laboratory of Advanced Microprocessor Chips and Systems, Changsha, China, and College of Computer Science and Technology, National University of Defense Technology, Changsha, China(先进微处理器芯片与系统重点实验室,长沙,中国,和国防科技大学计算机科学与技术学院,长沙,中国) ; Defense Innovation Institute, AMS, Beijing, China and Qiyuan Lab, Beijing, China(军事科学院创新院,北京,中国和启元实验室,北京,中国)
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出EstRTL框架,通过静态功能评分估计,结合生成、评估和修正三阶段范式,提升LLM生成RTL代码的功能正确性,在通用LLM上正确率提升3.2%-9.0%。
聚合分数所遗漏的:商业大语言模型API迁移中项目级回归的测量
专题命中 指令微调 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对GPT-5.4到GPT-5.6 Sol的三次升级,发现聚合分数遗漏了项目级双向变化,发布了响应级档案与项目级评分输出。
Comments 25 pages, 1 figure, 10 tables (including 8 appendix tables)
基于指令微调的自然语言规则的领域无关文本脱敏
机构 * Mphasis Limited(美费西斯有限公司)
专题命中 指令微调 :instruction tuning(title);LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种基于指令微调语言模型的领域无关可解释文本脱敏方案,支持用户以自然语言定义敏感信息,可应用于法律、医疗等关键场景的自动文本脱敏。
IKS-Instruct:一个用于教授语言模型印度知识体系的包含24000个示例的多语言数据集
机构 * Intrinsic Lab, Centre for Sensors, Instrumentation and Cyber-Physical System Engineering (Centre for SeNSE), Indian Institute of Technology Delhi(印度理工学院德里分校传感器、仪器仪表和网络物理系统工程中心(传感中心)本征实验室) ; RSL Quantum, FITT, IIT Delhi(印度理工学院德里分校 FITT 学院 RSL 量子实验室)
专题命中 指令微调 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.LG
AI总结 研究针对现有指令数据集问题,提出IKS-Instruct多语言数据集教授语言模型印度知识体系,源于六种源类型,经多评判评估框架评估质量,展示了该数据集在特定模型微调上的效果及模型质量与数据整理的关系。
Comments 32 pages, 5 figures
FedLSG:用于联邦图后门防御的大语言模型增强语义校准
机构 * Southeast University(东南大学) ; Purple Mountain Laboratories(紫金山实验室) ; Institute of AI for Industries(人工智能产业研究院) ; Chinese Academy of Sciences(中国科学院)
专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对联邦图神经网络易受后门攻击问题,提出FedLSG框架,将大语言模型集成防御,通过图与行为到文本的转换及轻量级师生架构,在不损图完整性时显著提升对后门攻击的抵抗力。
人物角色制图:在权重空间中描绘语言模型的个性特征
机构 * dsit.gov.uk(数字科学与创新部)
专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG
AI总结 研究大型语言模型人物角色,用大五人格框架将其视为行为特征空间位置,训练低秩适配器控制特征,评估其效果,发现可构建混合人物角色并保持性能,还表明特征轴影响安全行为,引入无监督管道,为人格测量等架桥。
Comments 85 pages, 80 figures
TAG-DLM:面向文本属性图学习的扩散语言模型
机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) ; VISA(VISA研究院)
专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 提出TAG-DLM方法,通过掩码扩散语言模型统一文本推理与图消息传递,线性化邻域并利用拓扑注意力掩码实现图结构注入,无需微调即可适应节点分类、链接预测等任务,性能优于现有基线。
分工与合作:基于跨智能体学习信号的角色分解多智能体LLM训练
机构 * Seoul National University(首尔大学)
专题命中 指令微调 :LLM(title,title_cn);language agent(abstract);分类 cs.AI、cs.LG
AI总结 提出DAC框架,将多步推理分解为搜索和生成两个子任务,分别由专用智能体处理,并通过跨智能体学习信号解决信用分配问题,在QA基准上超越全参数微调的单体模型。
通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化
机构 * China University of Petroleum (East China)(中国石油大学(华东)) ; Shanghai Jiao Tong University(上海交通大学) ; Wuhan University(武汉大学) ; Great Wall Motor(长城汽车) ; Nanyang Technological University(南洋理工大学) ; The University of Hong Kong(香港大学)
专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。
Comments This paper has been accepted by ACM MM 2026
EnclaveX: 端到端机密AI与CPU/GPU TEE
专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出结合CPU和GPU TEE的端到端工作流,通过Intel TDX和AMD SEV-SNP等机制保障AI/LLM应用的机密性和完整性,并评估了性能开销。
Comments 8 pages, 2 figures