arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 834 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 80 篇

2606.01022 2026-06-02 cs.CV cs.AI 81%

ProductWebGen: Benchmarking Multimodal Product Webpage Generation

ProductWebGen: 多模态产品网页生成基准测试

Zhihong Liu, Siqi Kou, Zheng Li, Ye Ma, Quan Chen, Peng Jiang, Kai Yu, Zhijie Deng

机构 * School of Computer Science & Zhiyuan College(计算机科学学院及智远学院) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ProductWebGen基准,用于评估多模态生成模型从产品图像和指令生成一致产品展示网页的能力,并比较了基于编辑和基于统一模型两种工作流。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00686 2026-06-02 cs.LG 81%

Dialectics of Alignment: Harnessing Unsafe Knowledge for Dynamic Safety Routing

对齐的辩证法:利用不安全知识实现动态安全路由

Maryam Hashemzadeh, Jerry Huang, Minseon Kim, Marc-Alexandre Côté, Sarath Chandar

机构 * Chandar Research Lab(Chandar研究实验室) Mila – Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Microsoft Research(微软研究院) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出SafeMoE框架,通过混合专家模型将不安全知识隔离到领域特定的低秩适配器中,并训练轻量级门控网络动态路由这些专家,在保持安全性的同时生成信息丰富的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26436 2026-06-02 cs.CL cs.AI 81%

Targeted Remasking: Replacing Token Editing with Token-to-Mask Refinement in Discrete Diffusion Language Models

目标重掩码:在离散扩散语言模型中将令牌编辑替换为令牌到掩码的精炼

Lin Yao

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对离散掩码扩散语言模型中令牌编辑机制的局限性,提出无训练的令牌到掩码重掩码方法,通过将疑似错误令牌重置为掩码状态,利用扩散过程在更干净上下文中重新预测,显著提升数学等任务的性能。

Comments This paper has been significantly revised, expanded, and superseded by a more comprehensive version available at arXiv:2604.18738. The authors have chosen to withdraw this version to avoid overlap and direct readers to the updated work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00915 2026-06-02 physics.optics 80%

Autonomous agentic design for photonics

光子学的自主智能体设计

Prashanta Kharel, Amin Khavasi, Xinzhong Chen, Tyler W. Hughes

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种基于大型语言模型的自主智能体方法,通过自动设计循环(提出、模拟、评估、迭代)实现光子器件的高性能设计,并成功应用于无源、有源、射频及芯片布局四类问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29287 2026-06-02 cs.IR cs.CV 80%

UniNote: A Unified Embedding Model for Multimodal Representation and Ranking

UniNote: 一种用于多模态表示和排序的统一嵌入模型

Jinghan Zhao, Wenwei Jin, Anqi Li, Jintao Tong, Luya Mo, Jiawei Li, Bin Li, Yao Hu

机构 * Xiaohongshu Beijing China(小红书北京中国) Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 提出UniNote统一嵌入模型,通过两阶段训练(对比SFT和强化学习)解决工业级Item-to-Item检索中全局表示与局部检索的平衡、解耦流水线效率及精度-延迟权衡问题,在小红书部署后显著提升检索质量和成本效率。

Comments Accepted by KDD Ads Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14709 2026-06-02 cs.CV 80%

Breaking Dual Bottlenecks: Evolving Unified Multimodal Models into Self-Adaptive Interleaved Visual Reasoners

打破双重瓶颈:将统一多模态模型演化为自适应交错视觉推理器

Qingyang Liu, Bingjie Gao, Canmiao Fu, Zhipeng Huang, Chen Li, Feng Wang, Shuochen Chang, Shaobo Wang, Yali Wang, Keming Ye, Jiangtong Li, Li Niu

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 针对统一多模态模型在理解与生成之间的鸿沟导致的注意力纠缠和视觉细化瓶颈,提出一种自适应切换生成策略的框架,通过分层数据流水线和两阶段训练(SFT+RL)提升X2I任务性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01009 2026-06-02 cs.CV cs.MM 80%

POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency

POVQA: 基于偏好的视频问答与数据效率的推理

Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密西根州立大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);preference optimization(abstract)

AI总结 提出POVQA方法,通过时间池化压缩视频帧、监督微调加偏好优化,在长视频问答中实现数据高效推理。

Comments Accepted in MAR at CVPR Workshop (Proceedings Track)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 11533-11542

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06033 2026-06-02 cs.LG 79%

Can Vision Language Models Learn Intuitive Physics from Interaction?

视觉语言模型能否从交互中学习直观物理?

Luca M. Schulze Buschoff, Konstantinos Voudouris, Can Demircan, Eric Schulz

专题命中 指令微调 :language model(title,abstract);分类 cs.LG

AI总结 研究通过强化学习与环境交互训练视觉语言模型,发现交互学习能提升任务内性能,但无法产生可泛化的物理直觉。

Comments Updated accepted version for ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06163 2026-06-02 eess.IV cs.CV cs.LG physics.med-ph 79%

Cross-Modal Fine-Tuning of 3D Convolutional Foundation Models for ADHD Classification with Low-Rank Adaptation

基于低秩适应的3D卷积基础模型跨模态微调用于ADHD分类

Jyun-Ping Kao, Shinyeong Rho, Shahar Lazarev, Hyun-Hae Cho, Fangxu Xing, Taehoon Shin, C. -C. Jay Kuo, Jonghye Woo

机构 * National Institute of Mental Health, National Institutes of Health(国家精神卫生研究所,国立卫生研究院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 提出一种参数高效的迁移学习方法,通过3D低秩适应(LoRA)将预训练于CT图像的3D卷积基础模型微调至MRI的ADHD分类任务,在公开扩散MRI数据集上达到71.9%准确率和0.716 AUC,仅需164万可训练参数。

Comments Accepted for presentation at the IEEE International Symposium on Biomedical Imaging (ISBI) 2026

Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI), pp. 1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30280 2026-06-02 cs.RO cs.AI cs.CL 79%

Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

Qwen-VLA:统一跨任务、环境和机器人形态的视觉-语言-动作建模

Qiuyue Wang, Mingsheng Li, Jian Guan, Jinhui Ye, Sicheng Xie, Yitao Liu, Junhao Chen, Zhixuan Liang, Jie Zhang, Xintong Hu, Xuhong Huang, Pei Lin, Junyang Lin, Dayiheng Liu, Shuai Bai, Jingren Zhou, Jiazhao Zhang, Haoqi Yuan, Gengze Zhou, Hang Yin, Ye Wang, Yiyang Huang, Zixing Lei, Wujian Peng, Delin Chen, Yingming Zheng, Jingyang Fan, Xianwei Zhuang, Xin Zhou, Haoyang Li, Anzhe Chen, Tong Zhang, Xuejing Liu, Yuchong Sun, Ruizhe Chen, Zhaohai Li, Chenxu Lü, Zhibo Yang, Tao Yu, Xionghui Chen

机构 * Qwen Team(通义实验室)

专题命中 指令微调 :language model(abstract);foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出Qwen-VLA,一种基于DiT动作解码器的统一具身基础模型,通过大规模联合预训练和具身感知提示,将操作、导航和轨迹预测统一为动作-轨迹预测框架,实现跨任务、环境和机器人形态的泛化。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23197 2026-06-02 cs.CL cs.LG stat.ML 79%

Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models

微调不忘上下文学习:线性注意力模型的理论分析

Chungpa Lee, Jy-yong Sohn, Kangwook Lee

机构 * KAIST(韩国科学技术院)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文通过线性注意力模型理论分析,揭示了微调目标如何修改注意力参数并导致少样本性能下降的条件,提出仅更新值矩阵可保持上下文学习能力。

Journal ref International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01967 2026-06-02 cs.CL 77%

Training Prompt Matters: State-Adaptive Optimization for Robust Fine-Tuning

训练提示至关重要:面向鲁棒微调的状态自适应优化

Wenhang Shi, Yiren Chen, Shuqing Bian, Zhe Zhao, Jinhao Dong, Pengfei Hu, Wei Lu, Xiaoyong Du

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出状态自适应提示优化(SAPO)策略,通过将任务公式从静态输入转变为动态状态自适应变量,有效缓解灾难性遗忘并提升泛化能力,在多个基准上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10014 2026-06-02 cs.LG stat.ML 77%

A Task-Centric Theory for Iterative Self-Improvement with Easy-to-Hard Curricula

一种以任务为中心的迭代自改进理论,采用由易到难的课程

Chenruo Liu, Yijun Dong, Yiqiu Shen, Qi Lei

机构 * New York University(纽约大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过将自改进建模为基于奖励过滤分布的最大似然微调,推导了期望奖励的有限样本保证,并证明了在推理任务中由易到难的课程比固定任务混合训练具有更好的理论保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11056 2026-06-02 eess.SY cs.LG cs.SY 77%

BERT4beam: Large AI Model Enabled Generalized Beamforming Optimization

BERT4beam: 大型AI模型实现通用波束赋形优化

Yuhang Li, Yang Lu, Wei Chen, Bo Ai, Zhiguo Ding

机构 * State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行国家重点实验室) School of Computer Science and Technology(计算机科学与技术学院) School of Electronics and Information Engineering(电子与信息工程学院) School of Electrical and Electronic Engineering (EEE)(电子与电气工程学院)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于BERT的框架BERT4beam,将波束赋形优化转化为token级序列学习任务,通过预训练和微调实现单任务与多任务优化,在不同用户规模、系统效用和天线配置下均能接近最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00544 2026-06-02 cs.LG cs.CL 76%

Escaping the Mode Lottery: Multi-Response Training Improves Language Model Generalization

逃离模式抽彩:多响应训练提升语言模型泛化能力

Hasan Amin, Kian Ahrabian, Ming Yin, Rajiv Khanna

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)

专题命中 指令微调 :language model(title);分类 cs.CL、cs.LG

AI总结 本文提出多响应训练(MRT)方法,通过保留每个提示的多个有效响应来缓解传统单响应微调导致的“模式抽彩”问题,并从统计角度揭示了其提升分布泛化的原理和适用条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00155 2026-06-02 cs.CR cs.AI 76%

A Protocol-Language Model for Network Intrusion (Without Deep Packet Inspection)

一种用于网络入侵的协议语言模型(无需深度包检测)

Vivek Kumar Sharma

机构 * Palo Alto Networks(帕洛阿尔托网络)

专题命中 指令微调 :language model(title,comments);分类 cs.AI

AI总结 提出PLM-NIDS,利用RWKV-4状态空间模型将网络流作为语言处理,仅基于L3/L4包元数据检测攻击,无需深度包检测,实现零样本异常检测(PR-AUC=0.93)和加密协议透明处理。

Comments 20 pages Research paper on Packet Language Models for Network Intrusion Detection Systems(Without Deep Packet Inspection).Code available on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01386 2026-06-02 cs.AI cs.CL cs.DC cs.LG 75%

GuidaPA: Privacy-Preserving Chatbot for Public Administration via Federated Learning

GuidaPA: 通过联邦学习为公共行政提供隐私保护的聊天机器人

Daniel M. Jimenez-Gutierrez, Albenzio Cirillo, Raffaele Nicolussi, Alessio Beltrame, Andrea Vitaletti

机构 * University of Bologna(博洛尼亚大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出GuidaPA,一个基于联邦学习(FL)在意大利公共行政文档上训练的隐私保护聊天机器人,通过参数高效的联邦微调(QLoRA)和角色访问控制,在保持数据本地化的同时实现了接近集中式微调的答案质量。

Comments Accepted to the 2nd International Conference on Federated Learning and Intelligent Computing Systems (FLICS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01695 2026-06-02 cs.LG 74%

CANARY: Zero-Label Detection of Fine-Tuning Contamination in Language Models

CANARY: 语言模型中微调污染的无标签检测

Swapnil Parekh

机构 * Switzerland(瑞士)

专题命中 指令微调 :language model(title);分类 cs.LG

AI总结 提出CANARY方法,通过稀疏自编码器分析隐藏状态差异,在无标签情况下检测微调数据污染,实现1%污染率下AUROC=1.000,并支持检测、验证、优先排序和修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01080 2026-06-02 cs.LG cs.AI 73%

ThinkSwitch: Context Distillation with LoRA and Weight Interpolation for Specific-Purpose Reasoning Tasks

ThinkSwitch:基于LoRA和权重插值的上下文蒸馏用于特定目的推理任务

Dhruv Saini, Rohan Pandey

机构 * bellevue High School(贝尔维尤高中) DigitalOcean

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出ThinkSwitch方法,通过QLoRA蒸馏和球面权重插值协同训练指令模型和思考模型,在AIME 2026和PubMedQA上分别提升指令模型10/30→20/30和13/30→18/30,思考模型14/30→22/30和18/30→25/30,仅需15个训练提示和$2.86成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00257 2026-06-02 cs.LG cs.AI 73%

ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate

ARCA: 当令牌信号退化时的适配器-残差信用分配

Rodney Lafuente-Mercado

机构 * Rodney Lafuente-Mercado(罗伊德·拉福恩特-默茨)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对LoRA微调下令牌级信用分配信号退化的问题,提出ARCA方法,利用适配器隐藏状态残差作为令牌显著性度量,无需学习奖励模型或价值头。

Comments Accepted to DEMO 2026: ICML Workshop on Decision-Making from Offline Datasets to Online Adaptation. Non-archival report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00147 2026-06-02 cs.LG cs.AI 73%

RAFT: Data Refinement and Adaptive Distillation for Domain Fine-Tuning with Alleviated Forgetting

RAFT:用于缓解遗忘的领域微调的数据精炼与自适应蒸馏

Yuduo Li, Xiaofeng Shi, Qian Kou, Longbin Yu, Hua Zhou

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) Beijing Jiaotong University (BJTU)(北京交通大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出RAFT框架,通过数据精炼(自条件重写、语义过滤、答案融合)和答案条件在线蒸馏(top-K温度蒸馏、EMA自适应损失平衡)来解决领域微调中的监督兼容性差距和轨迹保持差距,在提升领域性能的同时缓解通用能力退化。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00132 2026-06-02 cs.LG cs.AI 73%

Foundation-Preserving Adaptation via Generalized Rayleigh-Quotient Optimization

基于广义瑞利商优化的基础模型保留适配

Dongjun Kim, Adrian de Wynter, Huancheng Chen, Heasung Kim, Haris Vikalo

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft(微软) Microsoft AI(微软人工智能) Meta

专题命中 指令微调 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出FoLoRA框架,通过广义瑞利商优化更新方向,在微调中平衡下游任务性能与预训练能力保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27835 2026-06-02 cs.LG cs.CL 73%

CAREF: Calibration-Aware Regularization for Explanation Faithfulness Without Rationale Supervision

CAREF: 面向解释忠实性的校准感知正则化,无需理由监督

Naphat Nithisopa, Teerapong Panboonyuen

机构 * MARSAIL Chulalongkorn University(朱拉隆梭大学) PBYAIL (Panboonyuen AI Lab)(PBYAIL(Panboonyuen人工智能实验室))

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出CAREF框架,通过校准感知正则化联合优化预测准确性和解释忠实性,无需理由监督,在四个NLE基准上以少量可训练参数取得最佳性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11177 2026-06-02 cs.CL cs.AI 73%

What Do LLMs Know About Alzheimer's Disease? Multi-loss Fine-Tuning and Probing for AD Detection

LLMs 对阿尔茨海默病了解多少?用于 AD 检测的多损失微调和探针分析

Lei Jiang, Yue Zhou, Natalie Parde

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过多损失微调 BERT、T5 和 Llama-1B 模型,在三个语料库上实现文本 AD 检测新 SOTA,并利用线性探针分析内部表征中 AD 相关信息的编码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09492 2026-06-02 cs.LG cs.AI 73%

Beware of the Batch Size: Hyperparameter Bias in Evaluating LoRA

当心批量大小:评估 LoRA 中的超参数偏差

Sangyoon Lee, Jaeho Lee

机构 * Pohang University of Science and Technology (POSTECH)(浦项科学技术大学(POSTECH))

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文发现批量大小是导致 LoRA 变体性能矛盾的关键因素,提出基于代理的高效调优策略,将批量大小提升为一阶设计参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08868 2026-06-02 cs.LG cs.AI 73%

AnomSeer: Reinforcing Multimodal LLMs to Reason for Time-Series Anomaly Detection

AnomSeer: 增强多模态大语言模型进行时间序列异常检测的推理能力

Junru Zhang, Lang Feng, Haoran Shi, Xu Guo, Han Yu, Yabo Dong, Duanqing Xu

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出AnomSeer,通过专家思维链和基于最优传输的时间序列接地策略优化,增强多模态大语言模型在时间序列异常检测中的细粒度推理能力,统一异常分类、定位和解释。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02001 2026-06-02 cs.CL 70%

Scaling Agentic Capabilities via Grounded Interaction Synthesis

通过基于交互合成扩展智能体能力

Wenhang Shi, Jinhao Dong, Yiren Chen, Zhe Zhao, Shuqing Bian, Wei Lu, Xiaoyong Du

机构 * Renmin University of China(中国人民大学) Peking University(北京大学) Tencent(腾讯)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出GAIS框架,通过两阶段接地机制(协议锚定环境和结构引导规划)自动生成多样化的环境和复杂任务,显著提升智能体在BFCL、τ²-Bench和ACEBench上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01412 2026-06-02 cs.LG cs.IT math.IT 70%

GPTQ-intrinsic LoRA: A Near-optimal Algorithm for Low-precision Quantization with Low-rank Adaptation

GPTQ-intrinsic LoRA: 一种用于低秩自适应低精度量化的近最优算法

Shihao Zhang, Rayan Saab

机构 * Department of Mathematics, University of California San Diego(数学系,加州大学圣地亚哥分校) Department of Mathematics and Halıcıoğlu Data Science Institute, University of California San Diego(数学系和Halıcıoğlu数据科学研究所,加州大学圣地亚哥分校)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出GPTQ-intrinsic LoRA算法,通过将低秩校正直接融入GPTQ量化过程,并利用信息论下界证明其近最优性,在语言和视觉模型上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01230 2026-06-02 cs.AI 70%

HomeFlow: A Data Flywheel for Smart Home Agent Training with Verifiable Simulation

HomeFlow: 面向智能家居智能体训练的可验证数据飞轮

Yi Gu, Huacan Wang, Shuo Zhang, Yuqing Hou, Lei Xue, Weipeng Ming, Chen Liu, Fangzhou Yu, Kuan Li, Ronghao Chen, Sen Hu, Xiaofeng Mou, Yi Xu

机构 * Midea Group(美的集团) Beijing University of Posts and Telecommunications(北京邮电大学) Donghua University(东华大学) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出HomeFlow,一种通过统一仿真环境HomeEnv、程序化家居生成HomeMaker、蓝图编译用户意图、MCTS-Flow合成可验证轨迹,并结合监督微调和逐步RLVE优化智能体的可验证数据飞轮方法,在SmartHome-Bench上达到84.60%和87.03%的任务成功率,其中8B模型超越GPT-5.5 1.23个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01148 2026-06-02 cs.CL 70%

Not All Explanations Simulate Equally: Comparing Verbalized Feature Attributions and Self-Generated Rationales

并非所有解释都能同等模拟:比较言语化特征归因与自生成理由

Pingjun Hong, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna(维也纳大学文学与文化研究系)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究通过反事实模拟设置,比较了言语化特征归因和自生成理由两种解释来源对问答模型行为可模拟性的影响,发现解释格式和粒度显著影响模拟效果。

详情

展开后加载摘要…

URL PDF HTML 收藏