arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 61 篇

2608.23145 2026-08-25 cs.MA physics.optics 新提交 93%

First Demonstration of Multi-Agent LLM System for Million-Scale Optical Link Management in Global Production AIDCs

面向全球生产型人工智能数据中心(AIDC)中百万级光链路管理的多智能体大语言模型(LLM)系统的首次演示

Jingyi Su, Yihao Zhang, Dianxuan Fu, Leiyan Fei, Juan Wang, Mengfan Dai, Qing Liu, Xiong Wu, Yufeng Jiang, Cheng Chen, Bowen Zhang, Peilong Wang, Xi Chen, Zonglong He, Hongchen Yu, Zhicheng Ye, Weisheng Hu, Qunbi Zhuge

专题命中 指令微调 :LLM(title,title_cn);SFT(summary_cn,abstract)

AI总结 该研究首次演示了用于全球生产型AIDC百万级光链路自主故障管理的多智能体LLM系统,经SFT和记忆演化优化,在十周现场数据中F1达97.7%、故障减少超60%,性能优于SOTA LLM。

Comments 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00869 2026-08-25 cs.LG 版本更新 92%

Enhancing LLM Metacognition via Cognitive Pairwise Training

通过认知成对训练增强LLM元认知

Weitao Li, Hao Zhou, Xuanyu Lei, Fandong Meng, Yuanhang Liu, Jingyi Ren, Ante Wang, Xiaolong Wang, Yuanchi Zhang, Fuwen Luo, Guangwen Yang, Lin Gan, Weizhi Ma, Yang Liu

机构 * National Engineering Laboratory for Intelligent Information Processing, Academy of Mathematics and Physics, Chinese Academy of Sciences(智能信息处理国家工程实验室,中国科学院数学物理研究所) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.LG

AI总结 提出认知成对训练(CPT),通过成对比较推理轨迹来学习区分可靠与不可靠推理,从而提升LLM的推理与元认知权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21939 2026-08-25 cs.IR 新提交 91%

Enhancing Group Recommendation with Memory-Augmented Reasoning in LLM Agent

基于记忆增强推理的大语言模型智能体群组推荐增强方法

Qimeng Niu, Bowen Hao, Zixuan Zhang, Shuyu Qu, Hongzhi Yin

专题命中 指令微调 :LLM(title,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出基于LLM智能体的AGR模型,通过记忆模块与推理模块建模群组偏好动态演变及决策过程,在公开数据集上显著提升了群组推荐的准确率与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17485 2026-08-25 cs.CR 版本更新 91%

KeyPooling: Measuring Where LLM API Relay Paths Collapse Prompt Cache Isolation

KeyPooling:测量LLM API中继路径在提示缓存隔离中的崩溃位置

Bowen Sun, Yixi Cai, Xiaogeng Liu, Zhengyue Zhao, Yinzhi Cao, Chaowei Xiao

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出KeyPooling测量方法,发现LLM API中继服务默认未将客户绑定到上游凭证,存在跨客户缓存读取漏洞,并提出防御契约及优化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24434 2026-08-25 cs.CL 版本更新 91%

LuxIT: A Luxembourgish Instruction Tuning Dataset from Monolingual Seed Data

LuxIT:从单语种子数据生成的卢森堡语指令微调数据集

Julian Valline, Cedric Lothritz, Siwen Guo, Jordi Cabot

机构 * Luxembourg Institute of Science and Technology(卢森堡科学技术研究院)

专题命中 指令微调 :LLM(summary_cn,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出LuxIT数据集,通过合成高质量卢森堡语指令-回答对,提升低资源语言LLM性能,实验显示在语言考试和NLP任务中均取得显著提升。

Comments To appear in proceedings of LaTeLL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23475 2026-08-25 cs.AI 新提交 90%

StrategyBench: Evaluating Explicit Strategy Induction in Large Language Models

StrategyBench:评估大语言模型中的显式策略归纳能力

Jinghan Tan, Yuanzheng Wang, Lu Chen, Zijun Chen, Yuqian Wang, Maosong Sun

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出StrategyBench基准,评估大语言模型显式策略归纳能力,通过多维度分析揭示策略效用的影响因素,相关基准已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09544 2026-08-25 cs.CL cs.AI cs.LG 版本更新 90%

Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

大语言模型通过一种独特的统一机制生成有害内容

Hadas Orgad, Boyi Wei, Kaden Zheng, Martin Wattenberg, Peter Henderson, Seraphina Goldfarb-Tarrant, Yonatan Belinkov

机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Princeton University(普林斯顿大学) Harvard University(哈佛大学) Cohere Technion—IIT(以色列理工学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过权重剪枝揭示大语言模型中有害生成的内部结构,发现有害内容生成依赖于一组通用且与良性能力不同的权重,表明对齐训练重塑了有害表示,解释了领域微调引发的广泛对齐偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22232 2026-08-25 cs.AI cs.CL cs.CV cs.MM 新提交 90%

Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models

超越表象:揭示多模态大语言模型的情境错觉

Zhiming Yang, Zhuoxi Xiong, Donglin Zhou, Wenjun Wei, Shiyao Cui, Jinqiao Shi

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文针对多模态大语言模型(MLLMs)面临的情境错觉问题,构建分类体系并推出MSIBench基准,发现27种模型配置均易受6类错觉影响,通过提示工程和监督微调最多提升性能20%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22188 2026-08-25 cs.LG cs.CL cs.DC 新提交 90%

Unveiling the Depth-Performance Dilemma in Split-Federated Fine-tuning of LLMs

揭示大语言模型的拆分式联邦微调中的深度-性能困境

Hariharan Ramesh, Someshwaran Murugaiyan, Jyotikrishna Dass

机构 * Vellore Institute of Technology(韦洛尔理工学院) University of Arizona(亚利桑那大学)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究针对拆分式联邦微调(SFF),识别出深度-性能困境,评估多种联邦适配器聚合方法后发现其无法缓解拆分架构缺陷,归因于Transformer拓扑,为分布式LLM微调提供结构基础。

Comments 24 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21970 2026-08-25 cs.CV 新提交 89%

Retrieval-Augmented Visual Prompting: Guiding Foundation Models in Two-Photon Imaging

检索增强型视觉提示:引导基础模型用于双光子成像

Salvatore Calcagno, Marco Finocchiaro, Giovanni Bellitto, Daniela Giordano, Concetto Spampinato, Federica Proietto Salanitri

机构 * University of Catania(卡塔尼亚大学)

专题命中 指令微调 :prompting(title,abstract);foundation model(title,abstract)

AI总结 该研究提出RAVP框架,通过在推理阶段注入外部视觉记忆引导基础模型,经Allen Brain Observatory实验验证,可提升零样本神经元检测与实例分割性能,单示例提示效果优于多示例。

Comments 14 pages, 4 figures, 6 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22557 2026-08-25 cs.LG cs.AI cs.CL 新提交 88%

BLADE: Bilevel Low-rank Augmented-Lagrangian Erasure for LLM Unlearning

BLADE:用于大语言模型遗忘的双层低秩增广拉格朗日擦除方法

Md Toufikuzzaman, Ahmad Mousavi, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) American University(美利坚大学)

专题命中 指令微调 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 BLADE是一种受约束的双层框架,通过钳制熵遗忘损失、非对称增广拉格朗日和LoRA适配器双层结构解决LLM遗忘的鲁棒性问题,在三类基准上性能优于基线,且可应对规模扩大和连续遗忘步骤。

Comments To Appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20360 2026-08-25 cs.AI 版本更新 88%

Evaluating Large Language Models for automatic analysis of teacher simulations

评估用于教师模拟自动分析的大型语言模型

David de-Fitero-Dominguez, Mariano Albaladejo-González, Antonio Garcia-Cabot, Eva Garcia-Lopez, Antonio Moreno-Cediel, Erin Barno, Justin Reich

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究评估了DeBERTaV3、Llama 3等LLMs在教师教育数字模拟响应特征识别中的性能,发现Llama 3检测新特征更稳定,可为相关自动评估研究提供指导。

Comments Final published version in the Heliyon journal. Volume 12, Issue 14, September 2026, e45323. DOI: this https URL (https://doi.org/10.1016/j.heliyon.2026.e45323)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22963 2026-08-25 cs.AI cs.CL 新提交 87%

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

被文本债务掩埋:面向多模态大语言模型智能体的保留视觉证据的上下文剪枝

Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型智能体长轨迹中文本主导上下文、抑制视觉证据的问题,提出基于KL引导的SPARE框架,结合OPSD与SFT实现高效剪枝,在多步视觉工具使用基准中达到最优准确率与剪枝比例的权衡。

Comments 14 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21750 2026-08-25 cs.CL 新提交 86%

FCPRAG: Fusion-Controller Parametric Retrieval-Augmented Generation for Stable Multi-Passage LoRA Injection

FCPRAG:融合控制器参数化检索增强生成,用于稳定多段落LoRA注入

Jinchang Zhu, Jindong Li, Yi Ding, Xiaojian Nie, Rong Fu, Shuangyong Song, Haowei He, Menglin Yang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Macau(澳门大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FCPRAG是一种融合控制的参数化RAG框架,通过轻量控制器实现样本级适配器融合,在多个数据集和LLM主干上提升了RAG的F1值,降低调优成本并增强鲁棒性。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14900 2026-08-25 cs.CL cs.AI 版本更新 84%

Deep Contrastive Unlearning for Language Models

用于语言模型的深度对比式遗忘

Estrid He, Tabinda Sarwar, Ibrahim Khalil, Xun Yi, Ke Wang

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大型语言模型遗忘特定训练样本的挑战,提出DeepCUT框架,通过优化潜在空间实现高效机器学习遗忘,实验显示其效果优于基线方法。

Comments The authors have withdrawn this manuscript because the work subsequently underwent substantial changes in scope, methodology, and/or conclusions, resulting in a materially different paper. To avoid potential confusion between the present manuscript and the subsequent peer-reviewed work, we withdraw this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04001 2026-08-25 cs.CV 版本更新 83%

Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos

Sa2VA:将SAM2与多模态大语言模型结合用于图像与视频的密集接地理解

Haobo Yuan, Xiangtai Li, Tao Zhang, Yueyi Sun, Zilong Huang, Shilin Xu, Shunping Ji, Yunhai Tong, Lu Qi, Jiashi Feng, Ming-Hsuan Yang

机构 * University of California, Merced(加州大学默塞德分校) Bytedance Seed(字节跳动种子) Wuhan University(武汉大学) Peking University(北京大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本研究提出Sa2VA,结合SAM2与MLLM实现图像视频密集接地理解,引入Ref-SAV数据集,在多任务中表现优异且可扩展至多款开源MLLM,代码模型已公开。

Comments Accepted by IEEE TPAMI. Code: this https URL (https://github.com/Bytedance/Sa2VA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22594 2026-08-25 cs.LG 新提交 83%

Tabular foundation models for non-tabular tasks

面向非表格任务的表格基础模型

Goran Nakerst, John Brennan, Wouter Beugeling, Masudul Haque

机构 * Technische Universität Dresden(德累斯顿工业大学) Maynooth University(梅努斯大学) Universität Würzburg(维尔茨堡大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究探究表格基础模型TabPFN v3是否可用于非表格任务,将MNIST手写数字识别、法德语言识别、Tiny ImageNet图像分类转为表格形式,其在部分任务上达到了对应专用模型的相当准确率。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03854 2026-08-25 cs.LG 版本更新 83%

When Calibration Depends on the Scoring Rule: Quantized Biomedical LLM Classification

量化对生物医学大语言模型可靠性的影响

Anton Rasmussen, Hong Qin

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对 Mistral-7B 变体在 PubMed RCT 句子分类任务上,评估量化及提示模板、评分规则等对生物医学大语言模型可靠性的影响,发现这些因素对校准和准确率的影响不可忽视。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23092 2026-08-25 cs.SD 新提交 82%

Reasoning-Oriented Post-Training and Inference-Time LoRA Rescaling for Audio-Dependent Question Answering

面向推理的后训练与推理时LoRA重缩放:针对音频相关问答任务

Weiteng Hu, Yin Cao, Jun Yang

专题命中 指令微调 :post-training(title,abstract);language model(abstract)

AI总结 该研究针对音频相关问答任务,提出面向推理的LoRA后训练与推理时重缩放方法,在Qwen和MOSS-Audio模型上验证了有效性,提交系统在挑战赛中获总体第三、轻量级系统第二。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21819 2026-08-25 cs.CV cs.AI cs.CL cs.LG 新提交 82%

PatchGate: Narrowing the Verbalization Gap with Intrinsic Object Inventories in Frozen Vision-Language Models

PatchGate:在冻结的视觉-语言模型中利用固有物体清单缩小语言表述差距

Jihyung Ko, Eunji Jung, Hyeongsub Kim, Ziseok Lee, Jae Won Cho, Sanghyun Jo, Kyungsu Kim

机构 * Seoul National University(首尔大学) LG CNS Konkuk University(建国大学) OGQ

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对冻结VLMs图像字幕的物体表述问题,提出无训练框架PatchGate,通过VEX和VIED两个阶段提升可见物体覆盖率并减少物体幻觉,在AMBER数据集上取得了显著效果。

Comments 31 pages, 9 figures. Code will be available

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22631 2026-08-25 cs.LG 新提交 81%

Learning Generalizable Behaviors for Terminal Agents

学习终端智能体的可泛化行为

Yihang Yao, Bo Pang, Xuan Phi Nguyen, Ding Zhao, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce人工智能研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究针对终端智能体泛化问题,提出智能体组合泛化假设,开发训练方案River,其用不足30%的TMax环境使多规模模型在两个基准上RL增益平均提升超100%,且性能优于开源8B模型、可跨多维度泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22429 2026-08-25 cs.AI 新提交 81%

Think with Structured Grounding: Perceptual Reinforcement Learning for Chart and Visual-Tabular Understanding

基于结构化接地的思考:面向图表与视觉表格理解的感知强化学习

Changjiang Jiang, Qiannian Zhao, Lei Xin, Jinxiang Xie, Preslav Nakov, Zhuohan Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Nanjing University(南京大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对MLLMs依赖外部工具感知图表等视觉内容的问题,提出TwSG框架,通过两阶段训练实现细粒度视觉推理,降低延迟并提升准确率与鲁棒性。

Comments Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18855 2026-08-25 cs.IR 版本更新 80%

Think-to-Personalize: Unifying Reasoning and Retrieval for User-Centric Personalized Dense Retrieval

思考以个性化:统一推理与检索的以用户为中心的个性化密集检索

Angqing Jiang, Gaoming Zhang, Jianchun Song, Kena Qi, Dayao Chen, Wei Lin, Defu Lian

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TTP框架,将用户意图推理与密集检索统一,经两阶段训练后在电商场景实验及在线测试中均取得优于基线的效果,提升了订单量。

Comments Accepted at CIKM 2026. 11 pages, 8 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21762 2026-08-25 cs.CV cs.CL 新提交 79%

Learning to Look Again: Loss-Gap Supervision for Free-form Crop Routing in Vision-Language Models

重新学习观察:面向视觉语言模型的自由格式裁剪重路由的损失间隙监督

Jinchang Zhu, Rong Fu, Yi Ding, Chenghao Wu, Ying Liu, Menglin Yang

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 提出GapSight框架,利用损失间隙监督让VLMs选择性重读图像局部区域,在多个基准测试中显著提升了LLaVA、InternVL2.5等VLMs的细节类任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01734 2026-08-25 cs.CV cs.LG cs.RO 版本更新 79%

FlatVPR: Plug-and-play Geo-linear Residual Adapter for Geometric Rectification of Foundation Model Feature Manifolds

FlatVPR: 用于基础模型特征流形几何校正的即插即用地线性残差适配器

Rai Hisada, Kanji Tanaka

机构 * Fundamental Engineering for Knowledge-Based Society, Graduate School of Engineering, University of Fukui(知识社会基础工程,工程研究生院,福井大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 提出FlatVPR范式,通过可学习残差适配器和Pullback Flatness Loss抑制特征流形曲率,实现稀疏锚点下的线性插值重建,在NCLT数据集上显著提升视觉位置识别精度。

Comments 16 pages, 4 figures, technical report; v2: Added supplementary materials for downstream tasks and included a supplementary roadmap in Section I

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23182 2026-08-25 cs.CL 版本更新 79%

FourierSampler: Unlocking Non-Autoregressive Potential in Diffusion Language Models via Frequency-Guided Generation

FourierSampler: 通过频率引导生成解锁扩散语言模型的非自回归潜力

Siyang He, Qiqi Wang, Xiaoran Liu, Hongnan Ma, Yiwei Shi, Yuerong Song, Ying Zhu, Tianyi Liang, Zengfeng Huang, Ziwei He, Xipeng Qiu

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 FourierSampler通过频域滑动窗口机制,在扩散语言模型中实现非自回归生成,提升生成效果并超越自回归模型

Comments 15 pages, 6 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21909 2026-08-25 cs.LG 新提交 77%

CD-LoRA: Consistency-Driven Low-Rank Adaptation for Multi-Task Fine-Tuning

CD-LoRA:面向多任务微调的一致性驱动低秩适配

Qian Zha, Jinda Liu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对多任务LoRA方法存在的训练-推理不一致问题,提出无路由的CD-LoRA,通过一致性驱动对齐机制提升多任务微调的稳定性与性能,优于现有多适配器基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21408 2026-08-25 cs.AI 新提交 77%

Hate Speech Classification In Roman Urdu: A Comparative Study On Parameter Efficient Fine-Tuning And Prompt Engineering

罗马乌尔都语仇恨言论分类:参数高效微调与提示工程的对比研究

Toneema Zubair

专题命中 指令微调 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本研究针对低资源的罗马乌尔都语,对比了LLM零样本推理、LoRA的PEFT、混合/人工提示调优、零/少样本提示工程四种仇恨言论分类方法,以确定最有效的技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15763 2026-08-25 cs.CL 版本更新 77%

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

TaoLive数字虚拟人智能体技术报告:训练智能体随其Harness进化

TaoLive AIGC LLM Team: Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen

机构 * TaoLive(陶境科技)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract);分类 cs.CL

AI总结 本研究针对直播电商数字虚拟人主播的实时需求,提出HAT方法,结合HSA的三阶段训练,使35B紧凑模型在低延迟下适配Harness变化,性能优于基础模型及通用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03318 2026-08-25 cs.CL 版本更新 77%

MIRROR: A Multi-Agent Framework with Iterative Adaptive Revision and Hierarchical Retrieval for Optimization Modeling in Operations Research

MIRROR: 一种用于运筹学优化建模的具有迭代自适应修正与分层检索的多智能体框架

Yifan Shi, Jiayi Wang, Minyi Wu, Ye Fan, Jialong Shi, Jianyong Sun

机构 * Xi’an Jiaotong University(西安交通大学) Northwestern Polytechnical University(西北工业大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 提出一种免微调的多智能体框架MIRROR,通过执行驱动的迭代自适应修正和分层检索机制,将自然语言优化问题直接转化为数学模型和求解器代码,在标准运筹学基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏