arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11619 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11619 篇

2608.19669 2026-08-21 cs.CV cs.LG 新提交 81%

Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning

搭建心智:优化多模态推理的潜在视觉目标表示

Haoqiang Kang, Yinpeng Chen, Luyang Liu, Jesper Sparre Andersen, Abhijit Ogale, Baochen Sun, Lichan Hong, Ed H. Chi

机构 * Google DeepMind(谷歌DeepMind) UC San Diego(加州大学圣迭戈分校)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.LG

AI总结 针对潜在推理框架的 SFT 阶段潜在表示对齐差、RL 阶段缺乏探索性潜在轨迹的局限,提出 Scaffolding Minds,学习专用搭建编码器与 RL 采样器的均值方差,在多基准任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12746 2026-08-20 cs.CV cs.CL 版本更新 81%

Dual-Stream Cross-Anchor Correction Grounding Long-Form Captions and the Domain Limits of Object-Level Anchors

双流跨锚校正:接地长文本描述与对象级锚点的域限制

Lingkai Bu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Yuteng Xiao, Jinyi Liang

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对多模态大语言模型的长文本描述对象幻觉问题,本文提出双流跨锚校正方法,通过耦合感知流与认知流提升精度,在长文本场景下实现最优性能,且存在域条件性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01324 2026-08-20 cs.AI 版本更新 81%

G-ReAct: Graph-Guided Deep Search via Structure-State Co-Evolution

G-ReAct:基于结构-状态协同演化的图引导深度搜索

Shaoxiong Yang, Mengyuan Zhang, Shaojun Lin, Chao Li, Wei Liu, Kun Shao, Jian Luan

专题命中 指令微调 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出图引导深度搜索框架G-ReAct,通过结构-状态协同演化解决现有LLM深度搜索的上下文遗忘等问题,仅用少量轨迹微调即提升模型在BrowseComp-ZH、XBench上的准确率,且推理时可增强现有LLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11426 2026-08-17 cs.CL 版本更新 81%

Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models

收敛是不可避免的吗?将输出同质性追溯至基础模型

Alexandrine Fortier, Hazel Chen, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);pretraining(abstract);prompting(abstract);分类 cs.CL

AI总结 该研究指出大语言模型的语义收敛或源于预训练目标,仅靠对齐后干预难缓解,通过实验证实基础模型可被提示诱导类指令式坍缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12675 2026-08-14 cs.AI cs.CR 新提交 81%

Privacy-Preserving RAG by Concealing Sensitive Information from External LLMs

通过向外部大语言模型隐藏敏感信息实现隐私保护的检索增强生成(RAG)

Saleh Almohaimeed, Saad Almohaimeed, Mousa Jari, Fahad Alotaibi, Khalid A. Alobaid

机构 * College of Applied Computer Science, King Saud University(沙特国王大学应用计算机科学学院) Institution of Public Administration(公共行政学院)

专题命中 指令微调 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SEAG隐私保护框架,通过构建实体替换表替换敏感信息,在向外部LLM隐藏敏感数据的同时保障RAG的回答准确性,相关模型在多维度评估中表现良好。

Comments Submitted to Knowledge-Based Systems Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10207 2026-08-12 cs.AI 新提交 81%

Mitigating Bus Bunching with Reinforcement Learning Enhanced by Semantic Stop Embedding

利用强化学习结合语义站点嵌入缓解公交车扎堆问题

Xin Dong, Vikash V. Gayah

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出LLM辅助的语义站点嵌入强化学习方法,在仿真中较Daganzo基线显著降低公交车扎堆及乘客等待时间,实现跨线路策略复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08907 2026-08-11 cs.CV cs.AI 新提交 81%

ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision

ToolVision:通过能力对齐监督学习何时以及如何使用视觉工具

Delin Mao, Chenghao Sun, Jingwei Song, Chishui Chen, Linfeng Zhang

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 针对多模态模型工具使用监督错位问题,提出ToolVision方法,通过能力对齐的SFT与RL监督优化工具使用学习,在多个视觉基准上实现性能提升并将公开发布相关资源。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09730 2026-08-11 cs.AI 版本更新 81%

SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research

SearchSwarm:面向长周期深度研究的代理LLM委托智能

Xiaochong Lan, Quan Chen, Kun Tao, Xinyu Tang, Tianshu Wang, Qianggang Cao, Xinyu Kong, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Tsinghua University(清华大学) Peking University(北京大学) Ant Group(蚂蚁集团) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 指令微调 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SearchSwarm框架,通过监督微调将任务分解与委托决策内化到模型权重中,在BrowseComp和BrowseComp-ZH上取得同规模最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06802 2026-08-10 cs.CL 新提交 81%

Simple-OPD: Demystifying Warm-up for On-policy Distillation

Simple-OPD:揭开策略内蒸馏的预热阶段之谜

Tao Liu, Taiqiang Wu, Mao Zheng, Xuan Luo, Runming Yang, Xuewei Yang, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) Tencent(腾讯)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL

AI总结 本文通过数据与训练视角研究OPD的预热阶段,发现预热依赖教师兼容CoT监督、LoRA近饱和训练优于全参数SFT,提出Simple-OPD方法并验证其有效性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06778 2026-08-10 cs.CR cs.CL 新提交 81%

Retrieval-Constrained Policy Optimization for Attack Technique Extraction from Cyber Threat Intelligence

用于从网络威胁情报中提取攻击技术的检索约束策略优化

Jiayun Zhang, Junshen Xu, Zejun Xie, Yi Fan

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 研究针对CTI文本提取MITRE ATT&CK技术的挑战,提出两阶段框架TTP-R1,在四个CTI基准测试中F1值最优,子技术级F1超带检索增强的Claude Sonnet 4.5且推理速度更快

Comments Accepted to the AI Agent for Information Retrieval (Agent4IR) Workshop at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06758 2026-08-10 cs.CL 新提交 81%

Stockmark-Nemotron-3-Nano-Omni-JapanDocReader: Structured Document Parsing via Capability Injection and Forgetting Control

Stockmark-Nemotron-3-Nano-Omni-JapanDocReader:基于能力注入与遗忘控制的结构化文档解析模型

Shi Chen, Hayato Aida, Makoto Morinaga, Shohei Tanaka, Kosuke Arima

机构 * Stockmark Inc.(斯托克马克公司)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL

AI总结 本研究提出Stockmark-Nemotron-3-Nano-Omni-JapanDocReader模型,通过能力注入与遗忘控制优化结构化文档解析性能,结合混合SFT与DAPO式RL取得优于SFT的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05250 2026-08-07 cs.LG 新提交 81%

Beyond Full-Model Rollback: AuroSFT for Adapter-State Multi-Task Fine-Tuning

超越全模型回滚:用于适配器状态多任务监督微调的AuroSFT

Yue Han, Ziniu Liu

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.LG

AI总结 针对多任务SFT的全模型回滚成本高的问题,提出参数高效框架AuroSFT,将状态转为可合并的适配器状态,在保留骨干网络的比较中平均准确率达61.36%,优于msft的59.85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05207 2026-08-07 cs.LG 新提交 81%

When Do Corrective Features Help? An Agent for Corrective Feature Discovery on Black-Box Forecasters

纠正特征何时有用?面向黑盒预测器的纠正特征发现智能体

Fangxin Wang, Ziyi Zhang, Diyi Zhuang, Langzhou He, Shiyu Wang, Baichuan Mo, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Texas A&M University(德克萨斯农工大学) Massachusetts Institute of Technology(麻省理工学院) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出CRAFTER智能体,挖掘黑盒冻结预测器的残差以生成纠正特征,在6个数据集和6个主干上优于现有系统,使改进翻倍、误差降27%,可归因特征来源。

Comments 23 pages, 14 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04010 2026-08-05 cs.CV cs.CL 新提交 81%

ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs

ParVL:面向多模态大语言模型的并行缩放与可扩展计算分配

Yang Yang, Qinyu Zhao, Mouxiang Chen, Xiaohui Li, Lixin Gu, Wenhai Wang, Hongjie Zhang, Wenwei Zhang

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对多模态大语言模型的计算分配僵化问题,提出ParVL框架,通过复用骨干参数扩展并行计算,在13B token上微调后,其多模态性能优于同配置单分支基线,且最优分配随任务变化。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03292 2026-08-05 cs.AI 新提交 81%

DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning

DocTrace:面向可追溯的长文档视觉问答的分层证据图推理方法

Le Xiang, Zhicheng Guan, Hong Chen, Xiaocong Lin, Zhenghua Lei, Teng Hu, Bolei He, Long Zeng

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DocTrace分层框架,将长文档视觉问答建模为显式证据图推理问题,经两阶段训练优化后,在三个基准上优于现有模型,且推理可追溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01458 2026-08-04 cs.CL 新提交 81%

PALMs: Using Multi Construct-Grounded Rationales for Modeling Population Preferences in LLMs

PALMs:使用多构造基础理由对大语言模型中的群体偏好进行建模

Priyanka Dey, Brihi Joshi, Preyashi Poddar, Jieyu Zhao, Emilio Ferrara

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 指令微调 :language model(abstract,abstract_cn);large language model(abstract);prompting(abstract);分类 cs.CL

AI总结 该研究提出了群体对齐语言模型PALMs,通过结合心理与文化构造的理由进行偏好调优,在多维度评估中优于基准模型,且下游任务泛化能力强

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01106 2026-08-04 cs.CV cs.AI 新提交 81%

SG-Layout: Structured Scene Graph-Guided Layout Generation with LLMs

SG-Layout:基于结构化场景图引导的大语言模型布局生成方法

Junsheng Wang, Chao Chen, Mengying Xie, Mingyan Li, Fuqiang Gu

机构 * Chongqing University(重庆大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 SG-Layout通过两阶段训练将结构化空间知识融入LLMs,在三类任务中提升了空间推理与几何一致性,尤其适配关系密集的复杂场景。

Comments 16 pages, 5 figures. Accepted at WAICA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28647 2026-08-03 cs.HC cs.AI 新提交 81%

ConnectED: A Curriculum-Aligned AI System for Vietnamese Instructional Lesson Planning and Student Learning

ConnectED:面向越南教学课程规划与学生学习的课程对齐AI系统

Thang Doan Viet, Anh Nguyen Hoang, Tinh Luong Son, Anh Hoang Thi Ngoc, Huyen Giang Thi Thu, Tai Le Quy

专题命中 指令微调 :preference optimization(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出以人为本的AI系统ConnectED,基于VietEduQwen构建,支持越南教育完整教学生命周期,经评估其准确率优于基准模型,可缩短教师备课时间且获师生高满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27914 2026-07-31 cs.LG cs.SY eess.SY 新提交 81%

Exact Action Values Are Not Enough: Rollout-Verified Reinforcement Fine-Tuning of a Reasoning Model for Multi-Zone VAV Control

仅精确动作值不够:针对多区域VAV控制的推理模型的展开验证强化微调

Takumi Shioda, Kohei Terashima, Tatsuo Nagai

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京理科大学)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 该研究针对多区域VAV控制,测试前沿LLM的控制能力及TD3引导的RFT效果,发现RFT未产生持续改进,需先开展状态转移聚焦的监督微调。

Comments 34 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23420 2026-07-28 cs.CL 新提交 81%

LA-RL: Label-Aware Self-Reflection for Reinforcement Learning in Information Extraction

LA-RL:信息抽取中强化学习的标签感知自反思

Xiao You, Tianwei Yan, Zixu Shan, Longyu Du, Shan Zhao

机构 * Hefei University of Technology(合肥工业大学) Chongqing Jiaotong University(重庆交通大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对大语言模型信息抽取中现有反思校正方法不足,提出LA-RL框架,通过任务诊断标签指导自校正,经特定训练阶段提升抽取质量,在多项任务实验中取得良好效果,且发现反思结构对任务敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22639 2026-07-28 cs.AI 新提交 81%

TRACE: Business Rule-Grounded Reasoning Curriculum for Knowledge-Preserving Parametric Tool Retrieval in Enterprise LLMs

TRACE:用于企业语言模型中知识保留参数化工具检索的业务规则基础推理课程

Sai Shruthi Sistla, Ashutosh Hathidara, Christopher Toukmaji, Mayank Shrivastava, Karthikeyan Asokkumar

机构 * SAP Labs(思爱普实验室)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 研究针对企业语言模型中参数化工具检索问题,提出TRACE两阶段课程。第一阶段用多格式记忆SFT播种工具知识,第二阶段利用特定数据源训练模型生成思维痕迹,实现知识保留与单束贪婪解码,提升工具理解和检索召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14561 2026-07-28 cs.CL 版本更新 81%

MARS: Multi-hop Adaptive Retrieval and SPARQL Generation for KGQA

MARS:用于知识图谱问答的多跳自适应检索与SPARQL生成

Nikit Srivastava, Daniel Vollmers, René Speck, Nikolaos Karalis, Hamada M. Zahera, Axel-Cyrille Ngonga Ngomo

机构 * Heinz Nixdorf Institute, Paderborn University(海因茨·尼克斯多夫研究所,帕德博恩大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对大型语言模型在知识密集型任务中可靠性受限的问题,提出MARS方法,通过结构化检索过程链接问题实体与知识图谱,迭代获取信息并决定检索深度或生成SPARQL查询,在多个基准测试中性能有竞争力且高效可扩展。

Comments EKAW 2026 (accepted-posters-and-demos" target="_blank" rel="noopener">https://ekaw2026.di.unito.it/accepted-posters-and-demos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21133 2026-07-28 cs.CL 版本更新 81%

GRISP: Guided Recurrent IRI Selection over SPARQL Skeletons

GRISP:基于SPARQL骨架的引导式递归IRI选择

Sebastian Walter, Hannah Bast

机构 * University of Freiburg(弗赖堡大学)

专题命中 指令微调 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 GRISP通过微调小型语言模型生成SPARQL骨架并迭代替换占位符,提升知识图谱问答性能,在Wikidata和Freebase基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17532 2026-07-21 cs.SE cs.AI 新提交 81%

CommitLLM: A Fine-Tuned Pipeline for Git Commit Message Generation

CommitLLM:用于生成Git提交消息的微调管道

Md Rafid Haque, Poojan Narendrabhai Patel, Meetkumar Vijaybhai Raychura

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 针对开发人员编写的信息不足的Git提交消息问题,提出CommitLLM管道,通过微调小语言模型、约束解码和后处理,从代码差异生成合规消息,经评估效果良好,后处理对质量提升贡献更大。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13433 2026-07-16 cs.CL cs.CY 新提交 81%

When Rubrics Change: Cross-Rubric Generalization for Critical Thinking Essay Scoring

当评分标准改变时:批判性思维作文评分的跨评分标准泛化

Nischal Ashok Kumar, Payu Wittawatolarn, Sana Kang, Marisa C. Peczuh, Blair Lehman, Ryan Baker, Caitlin Mills, Sherry Lachman, Ruochen Sun, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Minnesota(明尼苏达大学) Brighter Research(更光明研究公司) Adelaide University(阿德莱德大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究跨评分标准泛化问题,采用含评分标准无关中间表示和目标作文监督的大语言模型微调框架,在增强数据集上实验,结果表明基于特征的中间结构和受控监督可提升对未见过评分标准的泛化能力。

Comments Published in AI for Education Day at SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30248 2026-07-16 cs.CV cs.LG 版本更新 81%

Your Data Manifold is Secretly a Reward Model: Shell-LCC for Text-to-Video Generation

你的数据流形实际上是一个奖励模型:Shell-LCC 用于文本到视频生成

Shihao Zhang, Yunzhi Li, Yuguang Yan, Junzhe Zhang, Wei Zhao, Bohan Wang, Hanwang Zhang

机构 * Huawei Central Research Institute(华为中央研究院) Guangdong University of Technology(广东技术大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.LG

AI总结 提出 Shell-LCC 方法,通过建模高质量 SFT 数据的流形结构,提供密集、可微且几乎零成本的奖励信号,以提升文本到视频生成质量,减少低层失真。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09492 2026-07-13 cs.AI 新提交 81%

Multimodal Reward Hacking in Reinforcement Learning

强化学习中的多模态奖励黑客攻击

Jiayu Yao, Yiwei Wang, Anmeng Zhang, Zhe Sun, Songsong Wang, Lingrui Mei, Yuyao Ge, Shenghua Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校) Southeast University(东南大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究强化学习中多模态奖励黑客攻击问题,通过引入新奖励失败率(NRFR)等方法,在多种设置下改变模型规模、算法等因素进行实验,发现仅结果奖励易导致黑客攻击,扩大规模可减少但不能消除,还得出不同算法和奖励方式对黑客攻击的影响及相关结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12886 2026-07-10 cs.CV cs.AI 新提交 81%

Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement

交错思维中的模态隔离桥接:通过逐步强化监督模态转换

Tingyu Li, Le Zhou, Siyuan Li, Yujun Wu, Xinglong Xu, Jingxuan Wei, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 提出MoTiF框架,通过反射式SFT和Flow-GRPO优化模态转换保真度,解决交错思维中图像与文本脱节的模态隔离问题,提升跨模态一致性和任务准确性。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03600 2026-07-07 cs.CV cs.AI 新提交 81%

A Step Towards Robust Unsupervised Domain Adaptation via Fine-Tuning and Reinforcement Learning

通过微调与强化学习迈向鲁棒无监督域适应的一步

Sushant Dagaji Desale, Rahul Mishra, Ashutosh Kumar Sinha

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 针对无监督域适应中对抗鲁棒性挑战,提出SFT+RL框架,结合监督微调与强化学习。在源域微调线性分类器,于目标域用置信引导伪标签策略,提升了清洁精度与对抗鲁棒性。

Comments Accepted and presented at the 28th European Conference on Artificial Intelligence (ECAI 2025), Bologna, Italy

Journal ref Frontiers in Artificial Intelligence and Applications, Volume 413, ECAI 2025, IOS Press, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29014 2026-07-07 cs.AI cs.DL 版本更新 81%

Customized Generative AI Agent for Transportation Engineering Practice: A Development and Continued Pre-training Guideline

面向交通工程实践的定制化生成式AI智能体:开发与持续预训练指南

Dianwei Chen, Yuan-Zheng Lei, Zifan Zhang, Yuchen Liu, Xianfeng Yang

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出基于LoRA框架对六种大语言模型进行持续预训练的方法,以提升其在交通工程领域的专业内容理解与推理能力,Qwen2.5-7B和LLaMA-3.1-8B表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏