arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 1045 篇

2608.17067 2026-08-19 cs.AI 新提交 70%

DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization

DiSCO:通过分布引导的对比提示优化防御文本到图像生成

Tong Zhang, Motasem Alfarra, Carlos Hinojosa, Christos Louizos, Bernard Ghanem

机构 * Qualcomm AI Research(高通人工智能研究院) King Abdullah University of Science Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 DiSCO是一种零样本黑盒防御模块,通过分布引导的对比提示优化,在I2P基准上分别将未防御、已防御模型的攻击成功率降低37.7%、25.13%,提升文本到图像生成的安全性且保持语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15215 2026-08-18 stat.ML cs.LG 新提交 70%

The Distributional View of Knowledge Distillation

知识蒸馏的分布视角

Gordei Verbii, Juho Lee

机构 * KAIST(韩国科学技术院)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出知识蒸馏的分布视角,将教师表示为多温度视角族,形式化设计空间并证明相关结果,在Pythia模型实验中得出三条经验规律,发现最佳KD损失取决于上限间隙Γ。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16622 2026-08-18 cs.CV cs.AI 新提交 70%

HarmTrace: Anchor-Calibrated Decoupled Optimization for Fine-Grained Target Identification in Harmful Memes

HarmTrace:用于恶意梗图细粒度目标识别的锚定校准解耦优化方法

Yujia Li, Yiqun Zhang, Zihan Cheng, Yijie Huang, Tenglong Ye, Zihan Wang, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对多模态恶意梗图检测中存在的目标识别错误问题,提出HarmTrace框架,结合实体感知微调与CTPO方法,在Qwen3-VL-8B上JRA提升至52.51%,还构建了Meme3W数据集与JRA指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15956 2026-08-18 cs.AI 新提交 70%

Navigation-Informed Embeddings: Dense-Retriever Adaptation from Agent Search Traces

导航启发式嵌入:基于智能体搜索轨迹的密集检索器适配

Shrey Shah, Levent Ozgur

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出 NIE 方法,利用智能体检索轨迹无需额外标注即可适配密集检索器,在基准任务上提升了 Recall@20、长路径性能及 nDCG@10 指标,提供轻量适配通道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15930 2026-08-18 cs.AI cs.CV 新提交 70%

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

UI-Mate:利用上下文内演示推进开放权重基础图形用户界面智能体

Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Lei, Hanxuan Li, Honglin Li, Xiyun Li, Zaitang Li, Leowei Liang, Xin Luo, Haozhe Ma, Jiayi Mao, Zhoujie Pan, Can Qin, Tianyuan Qu, Weiqi Wang, Wenkai Wang, Yonglin Wang, Yuxin Wang, Chenxu Wu, Yingchen Yu, Chenyu Zhang, Yuhao Zheng

机构 * Tencent Hy Frontier Team(腾讯 Hy 前沿团队)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 UI-Mate是集成环境基训练栈与上下文内演示学习的GUI智能体,在多计算机使用基准上创开放权重SOTA,提升了长周期办公任务的执行可靠性

Comments UI-Mate Technical Report. Project page: https://ui-mate.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14152 2026-08-17 cs.AI 新提交 70%

Towards Efficient Multimodal and Multilingual Opinion Extraction for STI: A QLoRA-Based Fine-Tuning Approach

面向科技情报(STI)的高效多模态多语言观点抽取:一种基于QLoRA的微调方法

Sheng Hong, Xuanqi Wang, Jiacheng Wang, Yuwei Wang

机构 * Beihang University(北京航空航天大学) Nanchang University(南昌大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对科技情报观点抽取的噪声过滤与结构化输出问题,提出基于QLoRA微调的多模态框架,在2194样本数据集上实现多语言观点抽取性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13951 2026-08-17 cs.AI 新提交 70%

HELIX: Model-Harness Co-evolution for Recursive Self-Improvement

HELIX:用于递归自我改进的模型-控制器协同进化

Tianyu Fan, Chao Huang

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 HELIX是支持模型-控制器协同进化的可溯源框架,在代码修复任务中,其65个候选组合提升了4.0%任务覆盖率,生成438条学习记录,形成模型、控制器与数据的反馈系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13495 2026-08-14 cs.CV cs.LG 新提交 70%

TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval

TraVEL:面向驾驶视频检索的轨迹引导视频嵌入学习

Yi-Chung Chen, Philip Jacobson, Tom Lampo, Yiren Lu, Jin Yao, David I. Inouye, Jing Gao, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(优步自动驾驶实验室) Purdue University(普渡大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出TraVEL框架,将通用多模态嵌入模型适配到驾驶视频检索,结合轨迹监督与Group Relative Policy Optimization,在nuReasoning基准上提升了不同规模模型的运动相关检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10333 2026-08-12 cs.LG 新提交 70%

MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale

MERA:面向大规模智能体系统的技能适配型模型演化与路由

Yuhang Yao, Zeyu Wang, Wanyi Chen, Tongyun Yang, Yuhang Han, Jie Xiao, Chengke Bao, Tianyi Zhao, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 MERA以单模型调用为适应单元,通过多轮适配提升小模型能力,结合带验证器回退的成本校准路由,在HumanEval+MBPP、TAU-2等数据集上实现小模型性能提升与成本降低。

Comments Preliminary version in CAIS RL-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06146 2026-08-07 cs.AI 新提交 70%

PaDoc: Layout-Grounded Parallel Decoding for Document Parsing

PaDoc:基于布局的文档并行解码方法

Hao Yu, Jiabo Zhan, Kang Liu, Linnan Zhao, Dongxu Yue, Rui Chen, Jinglin Wang, Chong Sun, Chen Li, Jing Lyu, Chun Yuan

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出PaDoc,一种基于布局的文档并行解码解析器,在OmniDocBench Full数据集上取得优异性能,且在A800 GPU上显著提升端到端文档解析的吞吐量并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06057 2026-08-07 cs.AI 新提交 70%

When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories

当历史失效:在误导性多轮历史下评估与改进工具使用

Xiaoqing Wu, Xingyu Fan, Feifei Li, Wenhui Que

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对多轮历史误导导致的工具调用智能体决策问题,提出可靠状态策略迁移方法,构建配对基准bench,在Qwen3模型上实现了优于多种基线的工具使用准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05790 2026-08-07 cs.AI cs.CR 新提交 70%

ChainClaw: A Layered Agent Framework for Reliable On-Chain Execution

ChainClaw:一种用于可靠链上执行的分层智能体框架

Jiacheng Wei, Zhaoxin Fan, Xin Wen, Yuqin Lan, Dongrun Li, Wenjun Wu, Faguo Wu, Xiao Zhang

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京航空航天大学未来区块链与隐私计算高精尖创新中心) Beihang University(北京航空航天大学) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Mathematical Sciences, Beihang University(北京航空航天大学数学科学学院) Zhongguancun Laboratory(中关村实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ChainClaw是基于OpenClaw的分层区块链原生智能体框架,通过三层架构解决链上执行的反应性、不可逆性和可观测性缺口,在自建基准上的安全性和任务完成度均优于代表性基线。

Comments 8 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05102 2026-08-06 cs.AI 新提交 70%

ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

ABSeeker:通过答案回溯信用分配训练长程搜索智能体

Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出答案回溯信用分配框架,训练ABSeeker智能体,在BrowseComp等数据集上性能优于同规模模型,接近30B级大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04347 2026-08-06 cs.LG 新提交 70%

Looking in the Mirror: Introspecting Side-Effect Misalignments Induced by Fine-Tuning

镜像审视:微调引发的副作用对齐偏差内省

Kotaro Yoshida, Laura Gomezjurado Gonzalez, Yukinori Yamamoto, Yuji Naraki, Ryotaro Shimizu, Wenya Wang

机构 * Institute of Science Tokyo(东京科学大学) ZOZO Research(ZOZO研究所) Stanford University(斯坦福大学) Waseda University(早稻田大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对微调引发的副作用对齐偏差问题,提出了Delta感知内省适配器(DAIA),构建了对应数据集,实验显示DAIA性能优于现有内省适配器且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03275 2026-08-05 cs.CL 新提交 70%

MoEGen: Mixture-of-Experts for Instance-Adaptive LoRA Generation

MoEGen:用于实例自适应LoRA生成的混合专家模型

Yiming Zeng, Lei Lu, Zexin Li, Zhuochun Li, Shuoqiu Li, Shuyi Liao, Xidong Wu, Zeyu Zhang, Minmei Wang, Yu Zhao, Tingting Yu, Shangqian Gao

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MoEGen是一种将MoE-based PEFT从专家选择转向专家条件参数生成的框架,通过将专家表示为可学习向量,解耦专家容量与适配器存储,在8个常识推理基准及医学、法律领域适配中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02276 2026-08-04 cs.AI 新提交 70%

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

Harness-R1:从智能体失败轨迹中学习编辑可执行运行时管控程序

Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Southeast University(东南大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Harness-R1是首个基于智能体失败轨迹学习编辑可执行运行时管控程序的方法,经WebShop等基准测试,可提升Qwen3.5-9B智能体成功率,为管控程序与智能体协同进化提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01904 2026-08-04 cs.AI 新提交 70%

CoEvoKG: Co-Evolving Knowledge Graphs with Self-Evolving Search Agents

CoEvoKG:用自演进搜索智能体协同演进知识图谱

Zhaoyang Li, Zenghuang Fu, Qiuyuan Ai, Ping Jiang, Haoyu Wu, Minghui Wu, Chenxu Zhao, Jie Song, Guannan He

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CoEvoKG框架将知识图谱作为训练任务源与智能体演进的持久证据记忆,联合训练任务生成器与搜索智能体,形成自演进与知识积累闭环,在六个问答基准上提升了三款骨干模型的准确率。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29601 2026-08-03 cs.LG 新提交 70%

The Parts Are Greater Than the Sum: Automated Task Sequencing for Efficient Training of Multi-Policy LLMs

部分之和大于整体:用于高效训练多策略大语言模型的自动任务排序

Jiajia Tang, Sizhe Yuen, Francisco Gomez Medina, Yali Du, Adam Sobey

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对多策略大语言模型训练中共享优化空间的干扰问题,提出自动多策略PEFT框架,通过任务分组排序组织独立QLoRA路径,在TRACE基准取得44.78的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29250 2026-08-03 cs.CL 新提交 70%

Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation

Data Turnstile:面向函数调用数据生成的可扩展开源框架

Goutham Ramakrishnan, Megha Sharma

机构 * Amazon AGI(亚马逊AGI)

专题命中 指令微调 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 该研究提出开源框架Data Turnstile,可基于用户定义API规范生成高质量函数调用合成训练数据,经其微调的小型语言模型在BFCL、τ²-bench等基准上性能大幅提升,缩小了与更大规模模型的差距。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28449 2026-07-31 cs.CL 新提交 70%

Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models

Lightning OPD 2.0:缓解大型推理模型跨教师在线策略蒸馏中的风格偏差

Yecheng Wu, Song Han, Han Cai

机构 * NVIDIA(英伟达)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 Lightning OPD 2.0通过交叉拟合风格残差化缓解大型推理模型跨教师在线策略蒸馏的风格偏差,在数学推理与代码生成基准中优于原方法,实现了跨教师设置下的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27699 2026-07-31 cs.CV cs.AI 新提交 70%

RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation

RefineSVG:视觉反馈驱动的图像转SVG生成强化学习

Shaobo Liu, Feiqiao Mao, Shuaishuai Zhou, Yan Zhan, Weiqi Tan, Zhiqiong Lu, Zhengping Liang

机构 * Shenzhen University(深圳大学) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RefineSVG是一种视觉反馈驱动的闭环框架,通过引入SVG语义词汇表和渐进式训练,使MLLM实现高保真图像转SVG生成,性能优于现有基线。

Comments 17 pages, 5 main-paper figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). Includes the complete supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26928 2026-07-30 cs.CL 新提交 70%

Latent-IM: Latent Interaction Management for Speech LLMs

Latent-IM:面向语音大语言模型的潜在交互管理

Adar Avsian, Atahan Dokme, Tony Woo, Larry Heck

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对语音大语言模型提出Latent-IM框架,将对话动作控制分为选择与实现两个耦合问题,可提升对话动作准确率12.5个百分点,性能与微调相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24570 2026-07-28 cs.CV cs.AI 新提交 70%

The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding

视觉瓶颈:用于联合时空视频定位的多模态大语言模型的稀疏帧适配

Jiameng Zhang, Srikanth Madikeri

机构 * University of Zurich(苏黎世大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型在视频定位中训练与部署条件不匹配问题,通过实验表明视觉特征提取是稀疏帧输入瓶颈,提出适配特定层及边界感知采样策略,证明训练策略对稀疏帧视频定位比模型规模更关键。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22035 2026-07-27 cs.LG 新提交 70%

DCS: A Unified Conditional Sensitivity Framework for Cross-Modal Copyright Infringement Detection

DCS:用于跨模态版权侵权检测的统一条件敏感度框架

Xiafeng Man

机构 * Fudan University(复旦大学)

专题命中 指令微调 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 研究针对基础模型版权侵权检测问题,提出统一的DCS框架,将侵权证据视为反事实条件分布转移,通过条件差分隐私形式化,创建双分支并结合多种因素界定敏感度,还定义校准统计量,适用于多种模型并以不同方式评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21978 2026-07-27 cs.CL 新提交 70%

MoE$^2$-LoRA: When MoE Models Meet MoE-style Low-Rank Adaptation

MoE$^2$-LoRA:当专家混合模型遇上专家混合风格的低秩自适应

Qingyu Yang, Haonan He, Minglei Li, Jingqi Ye, Tao Chen, Lei Bai, Peng Ye

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) KTH Royal Institute of Technology(瑞典皇家理工学院) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探索MoE模型的参数高效微调方法,提出MoE$^2$-LoRA,通过双通道RCP模块耦合预训练专家专业化与任务适应性,引入全局专家池,在多MoE主干上评估,能保持通用能力并实现最优下游精度。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21680 2026-07-27 cs.LG 新提交 70%

Encoding Invisible Causation for Bridge Diagnostic Agents: Triple-Guided Retrieval-Augmented Fine-Tuning with QLoRA

为桥梁诊断代理编码无形因果关系:基于QLoRA的三重引导检索增强微调

Takato Yasuno

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对桥梁损伤原因难以肉眼察觉及专家诊断依赖隐性知识的问题,提出基于QLoRA的三重引导检索增强微调方法(含知识三元组提取等组件),能在消费级硬件上实现内存高效、高精度的桥梁诊断代理。

Comments 13 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20581 2026-07-24 cs.CR cs.AI 新提交 70%

Geometric Configurations of Perturbed Jailbreak Prompts

受扰动越狱提示的几何配置

Lynn Delcon, Andres Algaba, Vincent Ginis

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究Qwen和Llama系列小权重模型中受扰动越狱输入的内部表示,选两个表示空间,在拒绝主导答案集中两空间均无行为超平面,仅特定模型的个别token与合规答案有关联。

Comments 21 pages, 9 figures, 7 tables, 2nd Workshop on Safe AI (SafeAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20472 2026-07-24 cs.AI 新提交 70%

Robust Critics: Defending LLMs Against Multi-Turn Attacks

鲁棒评论家:防御大语言模型免受多轮攻击

Roman Belaire, Arunesh Sinha, Pradeep Varakantham

专题命中 指令微调 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型在多轮攻击下的安全问题,提出对话评论家引导采样(DCGS)框架,通过推断用户意图、建模为马尔可夫决策过程并学习价值和遗憾评论家来生成回复,在多个数据集上评估优于基线和前沿模型,还能迁移提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18271 2026-07-22 cs.AI 新提交 70%

Using LLMs for Explainable, Data-Driven Insight Generation from Time Series

使用大语言模型从时间序列中生成可解释的、数据驱动的见解

Ria Mundhra, Gustavo Sato dos Santos, Michael Benedikt

机构 * University of Oxford(牛津大学) Vortexa

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对时间序列预测中解释生成难且易幻觉的问题,提出领域无关框架,含提取解释因素、基于证据生成解释及可扩展评估三组件,经案例研究验证,该框架能大规模实现有根据的解释生成,无需特定领域微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16412 2026-07-21 cs.AI 新提交 70%

Interactive Task Alignment as a POMDP

作为部分可观测马尔可夫决策过程的交互式任务对齐

Andy Dai, Zexue He, Zhenyu Zhang, Alex Pentland, Jiaxin Pei

机构 * Stanford University(斯坦福大学)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 研究语言模型在面对模糊用户任务时的任务对齐问题,引入基于部分可观测马尔可夫决策过程的框架,通过用户研究验证,发现模型任务对齐困难,训练能改善但仍落后于人类,揭示其缺乏关键交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏