arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11619 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11619 篇

2605.10172 2026-05-12 cs.CV cs.CL 81%

V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning

V-ABS:基于动作-观察者的动态视觉推理束搜索

Zhiwei Ning, Xuanang Gao, Jiaxi Cao, Gengming Zhang, Shengnan Ma, Wenwen Tong, Hanming Deng, Jie Yang, Wei Liu

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(上海交通大学图像处理与模式识别研究所) SenseTime Research(商汤科技研究院) Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出V-ABS框架,通过思考-行动-观察循环和熵适应加权算法,缓解IAO偏差,提升多模态模型在复杂视觉推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08984 2026-05-12 cs.CV cs.AI 81%

RAG-HAR: Retrieval Augmented Generation-based Human Activity Recognition

RAG-HAR:基于检索增强生成的人类活动识别

Nirhoshan Sivaroopan, Hansi Karunarathna, Chamara Madarasingha, Anura Jayasumana, Kanchana Thilakarathna

机构 * University of Sydney Australia(悉尼大学澳大利亚分校) University of Sri Jayewardenepura Sri Lanka(Sri Jayewardenepura大学 Sri Lanka) Curtin University Australia(Curtin大学澳大利亚分校) Colorado State University USA(科罗拉多州立大学美国分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RAG-HAR提出一种无需训练的检索增强框架,利用大语言模型实现人类活动识别,通过轻量统计描述符和语义相似样本检索提升识别准确性和实用性。

Comments Accepted to IEEE PerCom 2026 (Pervasive computing and communications)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01307 2026-05-12 cs.SE cs.AI 81%

Document Retrieval Augmented Fine-Tuning (DRAFT) for safety-critical software assessments

用于安全关键软件评估的文档检索增强微调(DRAFT)

Regan Bolton, Mohammadreza Sheikhfathollahi, Simon Parkinson, Vanessa Vulovic, Gary Bamford, Dan Basher, Howard Parkinson

机构 * Digital Transit Limited, 3M Buckley Innovation Centre, UK, HD1 3BD(数字交通有限公司,3M Buckley创新中心,英国,HD1 3BD) Department of Computer Science, University of Huddersfield, UK, HD1 3DH(计算机科学系,赫德瑟菲尔德大学,英国,HD1 3DH)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DRAFT方法,通过引入双检索架构和半自动化数据集生成,提升大型语言模型在安全关键合规评估中的准确性与证据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01237 2026-05-12 cs.LG 81%

The Differences Between Direct Alignment Algorithms are a Blur

直接对齐算法之间的差异变得模糊

Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii, Alexey Malakhov, Daniil Gavrilov

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.LG

AI总结 本文系统比较了直接对齐算法,发现排名目标是影响对齐质量的主要因素,而特定的标量分数次之。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05741 2026-05-08 cs.AI 81%

HyperLens: Quantifying Cognitive Effort in LLMs with Fine-grained Confidence Trajectory

HyperLens: 通过细粒度置信轨迹量化大语言模型中的认知努力

Chengda Lu, Xiaoyu Fan, Wei Xu

机构 * IIIS, Tsinghua University(清华大学信息学院) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HyperLens通过分析大语言模型推理过程中的置信轨迹,量化认知努力,揭示复杂任务对更高认知努力的需求,并诊断监督微调对领域任务性能的影响。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15711 2026-05-08 cs.CV cs.AI 81%

SSMamba: A Self-Supervised Hybrid State Space Model for Pathological Image Classification

SSMamba: 一种用于病理图像分类的自监督混合状态空间模型

Enhui Chai, Sicheng Chen, Tianyi Zhang, Xingyu Li, Tianxiang Cui

机构 * School of Computer Science, Northwest University(西北大学计算机科学学院) PuzzleLogic Pte Ltd, Singapore(新加坡PuzzleLogic公司) Department of Electrical & Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系) School of Computer Science, University of Nottingham Ningbo China(中国诺丁汉大学 Ningbo 分校计算机科学学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出SSMamba,一种混合自监督框架,通过MAMIM、DMS和LPR模块解决病理图像分析中的领域偏移、局部-全局关系建模和细粒度敏感性问题,优于现有方法。

Journal ref Medical Image Analysis, Volume 111, June 2026, 104080

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01591 2026-05-05 cs.IR cs.CL 81%

Led to Mislead: Adversarial Content Injection for Attacks on Neural Ranking Models

导致误导:针对神经排序模型的对抗性内容注入攻击

Amin Bigdeli, Amir Khosrojerdi, Radin Hamidi Rad, Morteza Zihayat, Charles L. A. Clarke, Ebrahim Bagheri

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) Mila – Quebec AI Institute(魁北克AI研究院) Toronto Metropolitan University(多伦多 Metropolitan 大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CRAFT框架,通过生成对抗性数据集、监督微调和偏好引导优化,提升对抗性攻击效果,验证了生成式AI在排序操纵中的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18232 2026-05-05 cs.LG cs.CR 81%

ACTG-ARL: Differentially Private Conditional Text Generation with RL-Boosted Control

ACTG-ARL: 差分隐私条件下通过RL增强的条件文本生成

Yuzheng Hu, Ryan McKenna, Da Yu, Shanshan Wu, Han Zhao, Zheng Xu, Peter Kairouz

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Research(谷歌研究院) Meta

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出ACTG-ARL框架,通过分层结构和Anchored RL方法,在差分隐私下提升生成文本质量与条件生成控制,实现MAUVE指标提升20%。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00072 2026-05-04 cs.CR cs.AI 81%

XekRung Technical Report

XekRung技术报告

Jiutian Zeng, Junjie Li, Chengwei Dai, Jie Liang, Zhaoyu Hu, Yiliang Zhang, Ziang Weng, Longtao Huang, Dongjie Zhang, Libin Dong, Yang Ge, Yuanda Wang, Kaiwen Lv Kacuila, Bingyu Zhu, Jing Wang, Jin Xu

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出XekRung,一种面向网络安全的前沿大语言模型,通过定制数据合成管道和多阶段训练流程,实现网络安全领域的高性能表现。

Comments 22 pages, 2 figures, 5 tables. Jiutian Zeng, Junjie Li, Chengwei Dai, Jie Liang, and Zhaoyu Hu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23557 2026-05-04 stat.ML cs.LG 81%

Minimizing Human Intervention in Online Classification

在在线分类中最小化人类干预

William Réveillard, Vasileios Saketos, Alexandre Proutiere, Richard Combes

机构 * KTH Royal Institute of Technology(皇家理工学院) Univ. Paris-Saclay, CNRS, CentraleSupélec(巴黎-萨克雷大学、国家科学研究中心、中央超导实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在主动学习框架下,如何通过保守包络分类器(CHC)和通用包络分类器(GHC)在不同条件下最小化人类干预,同时保证误差保障。

Comments 53 pages, 10 figures. AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26573 2026-04-30 cs.LG 81%

PAINT: Partial-Solution Adaptive Interpolated Training for Self-Distilled Reasoners

PAINT:部分解适应插值训练用于自蒸馏推理器

Zhiquan Tan, Yinrong Hong

机构 * Tsinghua University(清华大学) Beihang University(北航)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PAINT通过部分解适应插值训练,在自蒸馏推理器中提升大语言模型的推理能力,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01070 2026-04-29 cs.CL 81%

How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning

如何通过强化学习解锁几何交错推理中的顿悟时刻

Xiangxiang Zhang, Caijun Jia, Siyuan Li, Dingyu He, Xiya Xiong, Zheng Sun, Honghao He, Yuchen Wu, Bihui Yu, Linzhuang Sun, Cheng Tan, Jingxuan Wei

机构 * ByteDance(字节跳动) Shenyang Institute of Computing Technology, Chinese Academy of Sciences(沈阳计算技术研究所,中国科学院) Westlake University(西交大学) University of Chinese Academy of Science(中国科学院大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education(教育部计算能力网络与信息安全重点实验室) Shandong Computer Science Center (National Supercomputer Center in Jinan)(山东省计算机科学中心(济南国家超算中心)) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了在几何交错推理中,通过强化学习框架Faire克服传统监督微调的局限性,实现更深层次的因果对齐,从而提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22261 2026-04-27 cs.CL 81%

Bridging the Long-Tail Gap: Robust Retrieval-Augmented Relation Completion via Multi-Stage Paraphrase Infusion

弥合长尾差距:通过多阶段 paraphrase 注入实现鲁棒的检索增强关系完成

Fahmida Alam, Mihai Surdeanu, Ellen Riloff

机构 * Department of Computer Science University of Arizona, USA(计算机科学系亚利桑那大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RC-RAG框架,通过多阶段paraphrase注入提升稀有关系完成性能,无需微调即可在长尾场景下显著提升精确匹配指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09861 2026-04-22 cs.CV cs.AI 81%

A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends

基于MLLM的视觉丰富文档理解综述:方法、挑战与新兴趋势

Yihao Ding, Siwen Luo, Yue Dai, Yanbei Jiang, Zechuan Li, Qiang Sun, Geoffrey Martin, Wei Liu, Yifan Peng

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) Weill Cornell Medicine(韦尔·柯尔医学中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 本文综述了基于MLLM的视觉丰富文档理解最新进展,探讨了文本、视觉和布局特征的表示与整合技术,以及预训练、指令微调等训练方法,分析了数据稀缺、多页文档处理等挑战及新兴趋势。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19118 2026-04-22 cs.CR cs.AI 81%

DP-FlogTinyLLM: Differentially private federated log anomaly detection using Tiny LLMs

DP-FlogTinyLLM:基于Tiny LLMs的差分隐私联邦日志异常检测

Isaiah Thompson, Tanmay Sen, Ritwik Bhattacharya

机构 * Department of Mathematical Sciences(数学科学系) SQC & OR Unit(SQC及OR单位) University of Texas at El Paso(德克萨斯大学埃尔帕索分校) Indian Statistical Institute(印度统计研究所)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DP-FLogTinyLLM框架,利用参数高效LLMs实现隐私保护的联邦学习,通过差分隐私和LoRA技术在资源受限环境下实现日志异常检测,实验表明其在精度和F1分数上优于现有联邦基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20816 2026-04-22 cs.CL 81%

Rethinking Information Synthesis in Multimodal Question Answering A Multi-Agent Perspective

重新思考多模态问答中的信息合成:多智能体视角

Krishna Singh Rajput, Tejas Anvekar, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出多智能体框架MAMMQA,通过分解查询、跨模态推理和整合答案,提升多模态问答的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18106 2026-04-21 cs.CL 81%

Efficient Low-Resource Language Adaptation via Multi-Source Dynamic Logit Fusion

通过多源动态logit融合实现高效低资源语言适应

Chen Zhang, Jiuheng Lin, Zhiyuan Liao, Yansong Feng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 本文提出TriMix框架,通过融合小模型、任务指令微调和大模型的logit,有效提升低资源语言适应性能,无需标注数据和计算资源,实验显示优于单模型基线和Proxy Tuning。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17574 2026-04-21 cs.CL 81%

Beyond Fine-Tuning: In-Context Learning and Chain-of-Thought for Reasoned Distractor Generation

超越微调:基于上下文学习和推理链的干扰项生成

Elaf Alhazmi, Quan Z. Sheng, Wei Emma Zhang

机构 * School of Computing, Macquarie University, Australia(麦考瑞大学计算机学院,澳大利亚) School of Computer and Mathematical Sciences, Adelaide University, Australia(阿德莱德大学计算机与数学科学学院,澳大利亚) College of Engineering and Computing in Al-Lith, Umm Al-Qura University, Saudi Arabia(乌姆·阿尔·库拉大学阿尔·利思工程与计算学院,沙特阿拉伯)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于上下文学习和推理链的干扰项生成框架,通过无监督语义检索选择示例,提升生成合理干扰项的能力,实验表明在多个基准测试中性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27617 2026-04-20 cs.AI 81%

VeriMoA: A Mixture-of-Agents Framework for Spec-to-HDL Generation

VeriMoA:一种用于规格到HDL生成的代理混合框架

Heng Ping, Arijit Bhattacharjee, Peiyu Zhang, Shixuan Li, Wei Yang, Anzhe Cheng, Xiaole Zhang, Jesse Thomason, Ali Jannesari, Nesreen Ahmed, Paul Bogdan

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VeriMoA提出一种无需训练的代理混合框架,通过质量引导缓存机制和多路径生成策略,提升规格到HDL生成的准确性和多样性,实验表明在多个基准上性能提升15-30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13787 2026-04-16 cs.CL 81%

ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution

ToolOmni: 通过代理学习实现开放世界工具使用:基于主动检索和基础执行

Shouzheng Huang, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ToolOmni通过主动检索和基础执行实现开放世界工具使用,通过冷启动多轮交互数据集和Decoupled Multi-Objective GRPO算法提升工具检索和执行性能,实验表明其在检索和执行任务上均达到SOTA水平。

Comments 19 pages, 9 figures, 9 tables, accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04932 2026-04-14 cs.CL 81%

GenProve: Learning to Generate Text with Fine-Grained Provenance

GenProve:学习生成文本的细粒度溯源

Jingxuan Wei, Xingyue Wang, Yanghaoyu Liao, Jie Dong, Yuchen Liu, Caijun Jia, Bihui Yu, Junnan Zhu

机构 * Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(计算能力网络与信息安全教育部重点实验室,山东省计算中心(国家超级计算济南中心),齐鲁工业大学(山东省科学院)) Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出GenProve框架,通过结合监督微调与组相对策略优化,提升生成文本的准确性和细粒度溯源能力,优于14个强LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07523 2026-04-14 cs.CL 81%

Aligning What LLMs Do and Say: Towards Self-Consistent Explanations

对LLMs的行为与说法进行对齐:迈向自洽的解释

Sahar Admoni, Ofra Amir, Assaf Hallak, Yftah Ziser

机构 * Technion – Israel Institute of Technology(以色列理工学院) Nvidia Research(英伟达研究院) University of Groningen(格罗宁根大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究通过比较回答与解释的特征重要性分布,发现后验自一致性银行(PSCB)能更可靠地体现模型决策与解释的一致性,应用DPO优化提升对齐性而不影响任务精度。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06095 2026-04-08 cs.CR cs.AI 81%

LLM4CodeRE: Generative AI for Code Decompilation Analysis and Reverse Engineering

LLM4CodeRE: 生成式AI用于代码反编译分析与逆向工程

Hamed Jelodar, Samita Bai, Tochukwu Emmanuel Nwankwo, Parisa Hamedi, Mohammad Meymani, Roozbeh Razavi-Far, Ali A. Ghorbani

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出LLM4CodeRE框架,通过双向代码逆向工程实现反编译与源码翻译,采用多适配器和序列到序列统一方法提升任务适应性,实验显示其在反编译任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01787 2026-04-03 cs.CL 81%

DEFT: Distribution-guided Efficient Fine-Tuning for Human Alignment

DEFT:基于分布的高效微调以实现人类对齐

Liang Zhu, Feiteng Fang, Yuelin Bai, Longze Chen, Zhexiang Zhang, Minghuan Tan, Min Yang

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Science and Technology of China(中国科学技术大学) University of Copenhagen(哥本哈根大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

AI总结 本文提出DEFT框架,通过数据过滤和分布引导提升模型对齐效率与泛化能力,减少训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23479 2026-03-26 cs.CL 81%

FHIRPath-QA: Executable Question Answering over FHIR Electronic Health Records

FHIRPath-QA:基于FHIR电子健康记录的可执行问答

Michael Frew, Nishit Bheda, Bryan Tripp

机构 * University of British Columbia(不列颠哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出FHIRPath-QA,首个支持患者特定问题的开放数据集和基准,通过将推理转向FHIRPath查询合成,提升问答效率与准确性,验证了其在临床应用中的潜力。

Comments Accepted to LREC 2026 CL4Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04128 2026-03-05 cs.CV cs.AI cs.MM 81%

Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation

Crab$^{+}$: 一种可扩展且统一的音频视觉场景理解模型,具有显式合作

Dongnuan Cai, Henghui Du, Chang Zhou, Xi Chen, Dan Guo, Hongyuan Zhang, Xuelong Li, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院) AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG在线视频业务单元AI技术中心) Hefei University of Technology(合肥工业大学) The University of Hong Kong(香港大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 Crab$^{+}$通过显式合作解决音频视觉任务异质性问题,实现更广泛的任务覆盖和优于单任务模型的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22554 2026-02-27 cs.LG 81%

Multilingual Safety Alignment Via Sparse Weight Editing

多语言安全对齐 via 稀疏权重编辑

Jiaming Liang, Zhaoxin Wang, Handing Wang

机构 * School of Artificial Intelligence, Xidian University(人工智能学院,西安电子科技大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

AI总结 本文提出基于稀疏权重编辑的多语言安全对齐方法,通过稀疏神经元映射降低低资源语言攻击成功率,同时保持通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22452 2026-02-27 cs.AI cs.RO 81%

CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines

CWM: 用于具身智能体流水线中动作可行性学习的对比世界模型

Chayan Banerjee

机构 * School of Electrical Engineering and Robotics, Queensland University of Technology(电气工程与机器人学学院,昆士兰理工大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 CWM通过对比训练提升动作可行性评分,优于SFT方法,提升精度并增强安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17842 2026-02-24 cs.CL 81%

Shop-R1: Rewarding LLMs to Simulate Human Behavior in Online Shopping via Reinforcement Learning

Shop-R1: 通过强化学习奖励大语言模型模拟在线购物中的人类行为

Yimeng Zhang, Tian Wang, Jiri Gesi, Ziyi Wang, Yuxuan Lu, Jiacheng Lin, Sinong Zhan, Vianne Gao, Ruochen Jiao, Junze Liu, Kun Qian, Yuxin Tang, Ran Xue, Houyu Zhang, Qingjun Cui, Yufan Guo, Dakuo Wang

机构 * Michigan State University(密歇根州立大学) Amazon(亚马逊) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 Shop-R1通过强化学习框架提升大语言模型在在线购物场景中模拟人类行为的推理能力,实现65%以上的性能提升。

Comments Accepted by ICLR 2026. The project page is available at https://damon-demon.github.io/shop-r1.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04373 2026-02-24 cs.AI 81%

JEF-Hinter: Leveraging Offline Knowledge for Improving Web Agents Adaptation

利用离线知识提升网络代理适应性的JEF-Hinter

Hadi Nekoei, Aman Jaiswal, Patrice Bechard, Oleh Shliazhko, Orlando Marquez Ayala, Mathieu Reymond, Massimo Caccia, Alexandre Drouin, Sarath Chandar, Alexandre Lacoste

机构 * ServiceNow AI Research(ServiceNow AI研究机构) Chandar Research Lab(Chandar研究实验室) Mila -- Quebec AI Institute(魁北克人工智能研究院) Dalhousie University(达尔豪斯大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 JEF-Hinter通过提炼离线轨迹生成上下文感知提示,提升网络代理在陌生领域的适应能力,实验显示其优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏