arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-10 至 2026-02-10 共收录 455 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 21 篇

2602.07540 2026-02-10 cs.CV cs.LG 88%

LLM-Guided Diagnostic Evidence Alignment for Medical Vision-Language Pretraining under Limited Pairing

基于LLM的诊断证据对齐用于有限配对情况下的医学视觉-语言预训练

Huimin Yan, Liang Bai, Xian Yang, Long Chen

机构 * Institute of Intelligent Information Processing, Shanxi University(山西大学智能信息处理研究所) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学阿利安斯商学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文提出LLM引导的诊断证据对齐方法,旨在解决有限配对数据下医学视觉-语言预训练的诊断表示学习问题,通过提取关键诊断证据提升跨模态对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08211 2026-02-10 cs.CV 88%

Chain-of-Caption: Training-free improvement of multimodal large language model on referring expression comprehension

Chain-of-Caption: 无需训练提升多模态大语言模型的指称表达理解

Yik Lung Pang, Changjae Oh

机构 * Queen Mary University of London(伦敦女王学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出无需训练的Chain-of-Caption框架,通过结合多种上下文提升多模态大语言模型在指称表达理解任务中的性能。

Comments 4 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02136 2026-02-10 cs.CL 86%

Black Big Boxes: Tracing Adjective Order Preferences in Large Language Models

黑大盒子:在大型语言模型中追溯形容词顺序偏好

Jaap Jumelet, Lisa Bylinina, Willem Zuidema, Jakub Szymanik

机构 * CLCG(认知语言学研究中心) ILS(语言学研究所) ILLC(语言学研究所) CIMeC(计算机科学与工程学院) University of Groningen(格罗宁根大学) Utrecht University(乌得勒支大学) University of Amsterdam(阿姆斯特丹大学) University of Trento(特伦托大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 研究揭示大型语言模型中形容词顺序偏好主要由分布学习决定,但模型能稳健推广至未见组合,且上下文线索影响其输出顺序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00884 2026-02-10 cs.LG cs.CL 86%

Towards Active Synthetic Data Generation for Finetuning Language Models

面向微调语言模型的主动合成数据生成

Samuel Kessler, Menglin Xia, Daniel Madrigal Diaz, Dongge Han, Helia Heshemi, Saravan Rajmohan, Victor Ruehle, Jordan T. Ash

机构 * Microsoft(微软)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);small language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过主动学习方法生成合成数据以提升语言模型微调效果,验证了简单筛选标准在数学和逻辑推理任务中的有效性。

Comments 14 figures, 37 pages. Website and code: https://iterative-sd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08592 2026-02-10 cs.LG 85%

TFMLinker: Universal Link Predictor by Graph In-Context Learning with Tabular Foundation Models

TFMLinker:通过基于图的上下文学习进行通用链接预测的通用链接预测器

Tianyin Liao, Chunyu Hu, Yicheng Sui, Xingxuan Zhang, Peng Cui, Jianxin Li, Ziwei Zhang

机构 * Nankai University(南开大学) Tsinghua University(清华大学) Beihang University(北航)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TFMLinker通过表格基础模型的上下文学习能力,在不同图上进行通用链接预测,无需数据集特定微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08387 2026-02-10 cs.LG cs.DC 83%

Modalities, a PyTorch-native Framework For Large-scale LLM Training and Research

模态,一种用于大规模大语言模型训练和研究的PyTorch原生框架

Max Lübbering, Timm Ruland, Richard Rutmann, Felix Stollenwerk, David Fitzek, Michael Fromm, Alexander Weber, Rafet Sifa, Nicolas Flores-Herr, Joachim Köhler, Mehdi Ali

机构 * Fraunhofer IAIS(弗劳恩霍夫智能系统研究所) AI Sweden(人工智能瑞典) University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 Modalities是一个基于PyTorch的框架,旨在通过整合先进的并行策略和模块化设计,提升大规模大语言模型训练和研究的效率与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07790 2026-02-10 cs.LG 83%

MaD-Mix: Multi-Modal Data Mixtures via Latent Space Coupling for Vision-Language Model Training

MaD-Mix: 通过潜在空间耦合实现多模态数据混合用于视觉-语言模型训练

Wanyun Xie, Francesco Tonin, Volkan Cevher

机构 * LIONS, EPFL(EPFL 雷奥尼实验室)

专题命中 预训练与数据 :language model(title,abstract);instruction tuning(abstract);分类 cs.LG

AI总结 MaD-Mix通过潜在空间耦合实现多模态数据混合,提升视觉-语言模型训练效率,减少训练步骤并增强复杂场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06973 2026-02-10 cs.CL cs.AI cs.LG 82%

Does Visual Rendering Bypass Tokenization? Investigating Script-Tokenizer Misalignment in Pixel-Based Language Models

视觉渲染能否绕过分词?探究基于像素的语言模型中脚本-分词器不一致问题

Lucky Susanto, Musa Izzanardi Wijanarko, Khumaisa Nur'aini, Farid Adilazuarda, Alham Fikri Aji, Derry Tanti Wijaya

机构 * Monash University Indonesia(墨尔本大学印尼分校) MBZUAI Boston University(波士顿大学) University of Edinburgh(爱丁堡大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了基于像素的语言模型中视觉渲染是否能绕过分词约束,发现重新引入文本分词器加剧了分词不一致问题,自定义分词器在性能上表现更优。

Comments Submitted to ARR January

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07036 2026-02-10 cs.SD cs.AI cs.CL eess.AS 82%

MENASpeechBank: A Reference Voice Bank with Persona-Conditioned Multi-Turn Conversations for AudioLLMs

MENASpeechBank: 一个具有基于人设的多轮对话的参考语音库用于音频大语言模型

Zien Sheikh Ali, Hunzalah Hassan Bhatti, Rabindra Nath Nandi, Shammur Absar Chowdhury, Firoj Alam

机构 * Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 预训练与数据 :large language model(abstract,comments);language model(abstract,comments);LLM(abstract);分类 cs.CL、cs.AI

AI总结 MENASpeechBank通过合成数据管道生成多轮对话数据,支持音频大语言模型在多样化语音和方言场景中的训练与应用。

Comments Foundation Models, Large Language Models, Native, Speech Models, Arabic, AI-persona, Persona-conditioned-conversations

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18221 2026-02-10 cs.LG cs.AI stat.ML 81%

These Are Not All the Features You Are Looking For: A Fundamental Bottleneck in Supervised Pretraining

这些并非你所寻找的所有特征:监督预训练中的一个根本瓶颈

Xingyu Alice Yang, Jianyu Zhang, Léon Bottou

机构 * Fundamental AI Research (FAIR) at Meta(Meta 的基础人工智能研究(FAIR)) New York University(纽约大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过模型集成策略提升迁移学习性能,发现预训练模型存在特征不一致导致的迁移偏差问题,并在ResNet上验证了该方法的有效性。

Comments 10 pages, 6 figures, Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21391 2026-02-10 cs.IR cs.AI 77%

MIXRAG : Mixture-of-Experts Retrieval-Augmented Generation for Textual Graph Understanding and Question Answering

MIXRAG : 基于专家混合的检索增强生成用于文本图理解与问答

Lihui Liu, Jiayuan Ding, Subhabrata Mukherjee, Carl J. Yang

机构 * Wayne State University(韦恩州立大学) Emory University(埃默里大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 MIXRAG通过专家混合图-RAG框架,利用多个专门化图检索器和动态路由控制器,提升复杂查询处理和噪声过滤能力,实现文本图理解和问答任务的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03628 2026-02-10 stat.ML cs.LG 77%

Synthetic Oversampling: Theory and A Practical Approach Using LLMs to Address Data Imbalance

合成过采样:利用大语言模型理论和实践方法解决数据不平衡

Ryumei Nakada, Yichen Xu, Lexin Li, Linjun Zhang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文利用大语言模型理论和实践方法,提出解决数据不平衡问题的新理论框架,并通过实验验证合成过采样在提升模型性能方面的有效性。

Comments 92 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10364 2026-02-10 cs.LG cs.CL cs.CR 73%

Can We Infer Confidential Properties of Training Data from LLMs?

能否从LLMs中推断出训练数据的保密属性?

Pengrun Huang, Chhavi Yadav, Kamalika Chaudhuri, Ruihan Wu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PropInfer基准任务,通过两种微调范式评估LLMs属性推断攻击,揭示LLMs在隐私保护方面的潜在漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03219 2026-02-10 cs.AI 70%

Beyond Quantity: Trajectory Diversity Scaling for Code Agents

超越数量:代码代理的轨迹多样性扩展

Guhong Chen, Chenghao Sun, Cheng Fu, Qiyao Wang, Zhihong Huang, Chaopeng Wei, Guangxu Chen, Feiteng Fang, Ahmadreza Argha, Bing Zhao, Xander Xu, Qi Han, Hamid Alinejad-Rokny, Qiang Qu, Binhua Li, Shiwen Ni, Min Yang, Hu Wei, Yongbin Li

机构 * SIAT, CAS(中国科学院软件研究所) Alibaba Group(阿里巴巴集团) UNSW Sydney(新南威尔士大学悉尼分校) SUAT(上海大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TDScaling通过提升轨迹多样性而非单纯增加数据量,优化代码代理训练的性能-成本平衡,提升工具使用泛化和编码能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10840 2026-02-10 cs.CL 70%

Tracing Multilingual Representations in LLMs with Cross-Layer Transcoders

通过跨层转码器追踪LLM中的多语言表示

Abir Harrasse, Florent Draye, Punya Syon Pandey, Zhijing Jin, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所) Mohammed VI Polytechnic University, Morocco(穆莱·伊斯梅尔polytechnic大学) University of Toronto, Canada(多伦多大学) Vector Institute, Canada(向量研究所) ELLIS Institute, Tübingen, Germany(ELLIS研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过跨层转码器研究LLM中多语言表示的共享机制及语言解码过程。

Comments 42 pages, 43 figures, under review. Extensive supplementary materials. Code and models available at https://huggingface.co/collections/CausalNLP/multilingual-tinystories-6862b6562414eb84d183f82a and https://huggingface.co/collections/CausalNLP/multilingual-gpt2-models and https://huggingface.co/collections/CausalNLP/multilingual-clts and https://github.com/abirharrasse/MultilingualCLTs

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17321 2026-02-10 cs.RO cs.CL 70%

OpenGVL -- Benchmarking Visual Temporal Progress for Data Curation

OpenGVL -- 视觉时间进程数据整理的基准测试

Paweł Budzianowski, Emilia Wiśnios, Michał Tyrolski, Gracjan Góral, Igor Kulakov, Viktor Petrenko, Krzysztof Walas

机构 * Lute IDEAS Research Institute(IDEAS研究机构) Simple Automation Poznań University of Technology(波兹南技术大学) University of Warsaw(华沙大学)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 OpenGVL通过评估开源模型在时序任务预测中的表现,揭示其在机器人数据整理中的局限性,并提供自动化数据筛选的实用工具。

Comments Workshop on Making Sense of Data in Robotics: Composition, Curation, and Interpretability at Scale at CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21910 2026-02-10 cs.CL 70%

AutoMixer: Checkpoint Artifacts as Automatic Data Mixers

AutoMixer:检查点 artifacts 作为自动数据混合器

Ernie Chang, Yang Li, Patrick Huber, Vish Vogeti, David Kant, Yangyang Shi, Vikas Chandra

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 AutoMixer通过利用检查点模型的新兴能力,自动优化数据混合,提升预训练性能达1.93%。

Comments Accepted at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07590 2026-02-10 cs.CV cs.AI cs.LG 62%

Automated rock joint trace mapping using a supervised learning model trained on synthetic data generated by parametric modelling

基于参数建模生成合成数据的监督学习模型用于自动岩体节理迹映射

Jessica Ka Yi Chiu, Tom Frode Hansen, Eivind Magnus Paulsen, Ole Jakob Mengshoel

机构 * Norwegian Geotechnical Engineering(挪威地质工程)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于参数建模生成合成数据的监督学习方法,用于解决岩体节理迹映射中真实数据不足和类别不平衡的问题,通过混合训练和微调提升模型鲁棒性,实现更准确的地质映射。

Comments 35 pages, 12 figures, 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06849 2026-02-10 cs.LG 57%

Improved Sampling Schedules for Discrete Diffusion Models

改进的离散扩散模型采样方案

Alberto Foresti, Mustapha Bounoua, Giulio Franzese, Luca Ambrogioni, Pietro Michiardi

机构 * Department of Data Science, EURECOM(数据科学系,EURECOM) Donders Institute for Brain, Cognition and Behaviour(脑科学与行为研究所) Radboud University(拉德堡德大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本文提出基于熵产率和Wasserstein距离的两种改进采样方案,提升离散扩散模型在多个领域的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07173 2026-02-10 cs.LG cs.SY eess.SY 57%

Learning Nonlinear Systems In-Context: From Synthetic Data to Real-World Motor Control

在上下文中学习非线性系统:从合成数据到现实世界的运动控制

Tong Jian, Tianyu Dai, Tao Yu

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出基于变压器模型的上下文学习方法,用于现实世界中的运动控制,通过少量示例实现对非线性系统的高效泛化,优于传统控制方法。

Comments Accepted to be presented in IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21449 2026-02-10 cs.RO cs.DC 50%

Nimbus: A Unified Embodied Synthetic Data Generation Framework

Nimbus:一个统一的具身合成数据生成框架

Zeyu He, Yuchang Zhang, Yuanzhen Zhou, Miao Tao, Hengjie Li, Hui Wang, Yang Tian, Jia Zeng, Tai Wang, Wenzhe Cai, Yilun Chen, Ning Gao, Jiangmiao Pang

专题命中 预训练与数据 :foundation model(abstract)

AI总结 Nimbus通过统一的四层架构和解耦执行模型,提升合成数据生成的吞吐量和稳定性,支持大规模分布式环境下的持续高吞吐数据生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 22 篇

2602.07376 2026-02-10 cs.CL 89%

Do Large Language Models Reflect Demographic Pluralism in Safety?

大语言模型在安全领域是否反映了人口多样性?

Usman Naseem, Gautam Siddharth Kashyap, Sushant Kumar Ray, Rafiq Ali, Ebad Shabbir, Abdullah Mohammad

机构 * Macquarie University(麦考瑞大学) University of Delhi(德里大学) DSEU-Okhla

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 Demo-SafetyBench通过在提示级别建模人口多样性,实现了在安全评估中兼顾可扩展性和人口鲁棒性。

Comments Accepted at EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08239 2026-02-10 cs.LG cs.AI 89%

Linearization Explains Fine-Tuning in Large Language Models

线性化解释大语言模型中的微调

Zahra Rahimi Afzal, Tara Esmaeilbeig, Mojtaba Soltanalian, Mesrob I. Ohannessian

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过线性化视角揭示了大语言模型微调的机制,分析了正则化对NTK特征值谱的影响,并通过LoRA实验证明了微调优化的改进。

Journal ref Afzal, Z.R., Esmaeilbeig, T., Soltanalian, M. and Ohannessian, M.I., 2025. Linearization Explains Fine-Tuning in Large Language Models. In The Thirty-ninth Annual Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13313 2026-02-10 cs.AI cs.LG 88%

Revisiting Privacy, Utility, and Efficiency Trade-offs when Fine-Tuning Large Language Models

重新审视在微调大语言模型时隐私、效用和效率之间的权衡

Soumi Das, Camila Kolling, Mohammad Aflah Khan, Mahsa Amani, Bishwamittra Ghosh, Qinyuan Wu, Till Speicher, Krishna P. Gummadi

机构 * MPI-SWS Germany(德国马克斯·普朗克研究所-斯图加特)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在微调大语言模型时隐私、效用和效率之间的权衡,发现高效微调方法如LoRA在缓解隐私风险方面与差分隐私方法如DP效果相当,挑战了传统观点。

Comments This work has been accepted at IASEAI 2026 (Non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07798 2026-02-10 cs.LG cs.AI 88%

CausalTAD: Injecting Causal Knowledge into Large Language Models for Tabular Anomaly Detection

CausalTAD: 在表格异常检测中向大语言模型注入因果知识

Ruiqi Wang, Ruikang Liu, Runyu Chen, Haoxiang Suo, Zhiyi Peng, Zhuo Tang, Changjian Chen

机构 * College of Computer Science and Electronic Engineering, Hunan University, China(计算机科学与电子工程学院,湖南大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 CausalTAD通过注入因果知识提升表格异常检测性能,采用因果关系重构与加权策略,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07464 2026-02-10 cs.CL 88%

SED-SFT: Selectively Encouraging Diversity in Supervised Fine-Tuning

SED-SFT: 在监督微调中选择性鼓励多样性

Yijie Chen, Yijin Liu, Fandong Meng

机构 * Tencent Inc(腾讯公司)

专题命中 指令微调 :SFT(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SED-SFT通过引入选择性熵正则化和掩码机制,在监督微调中提升生成多样性,从而提高后续强化学习的性能。

Comments The code is publicly available at https://github.com/pppa2019/SED-SFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14238 2026-02-10 cs.CL cs.AI cs.LG 85%

ABBA-Adapters: Efficient and Expressive Fine-Tuning of Foundation Models

ABBA-Adapters: 高效且表达力强的基础模型微调

Raghav Singhal, Kaustubh Ponkshe, Rohit Vartak, Praneeth Vepakomma

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫德尔·本·扎耶德人工智能大学) Duke University(杜克大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 指令微调 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ABBA-Adapters通过引入低秩矩阵的Hadamard乘积,实现高效且表达力强的基础模型微调,显著提升适应新领域的性能。

Comments ICLR 2026. Raghav Singhal, Kaustubh Ponkshe, and Rohit Vartak contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08505 2026-02-10 cs.CV 78%

Are Vision Foundation Models Foundational for Electron Microscopy Image Segmentation?

视觉基础模型是否对电子显微镜图像分割具有基础性作用?

Caterina Fuster-Barceló, Virginie Uhlmann

机构 * Department of Molecular Life Sciences, Universität Zürich(分子生命科学系,苏黎世大学)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文研究了视觉基础模型在电子显微镜图像分割中的有效性,发现LoRA能提升单域性能,但多域训练导致性能下降,需额外领域对齐机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08099 2026-02-10 cs.CV cs.AI 77%

VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval

VidVec:解锁视频MLLM嵌入用于视频-文本检索

Issar Tzachor, Dvir Samuel, Rami Ben-Ari

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 VidVec通过利用预训练MLLM的中间层嵌入和校准头部,实现无需训练的视频-文本检索,超越现有方法,达到最佳性能。

Comments Project page: https://iyttor.github.io/VidVec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07381 2026-02-10 cs.CL 77%

When the Model Said 'No Comment', We Knew Helpfulness Was Dead, Honesty Was Alive, and Safety Was Terrified

当模型说'无话可说'时,我们得知有帮助性已死,诚实仍活着,安全性却感到害怕

Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University(计算学院,麦考瑞大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 AlignX通过两阶段框架解决LLM多目标对齐问题,提升有帮助性、无害性和诚实性,同时减少延迟和内存使用。

Comments Accepted at EACL Mains 2026

详情

展开后加载摘要…

URL PDF HTML 收藏