arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-19 至 2026-02-19 共收录 40 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 40 篇

2602.16467 2026-02-19 cs.CL cs.AI 91%

IndicEval: A Bilingual Indian Educational Evaluation Framework for Large Language Models

IndicEval:一种用于大型语言模型的双语印度教育评估框架

Saurabh Bharti, Gaurav Azad, Abhinaw Jagtap, Nachiket Tapas

机构 * Department of Computer Sciencce and Engineering(计算机科学与工程系) Swami Vivekanand Technical University Bhilai, India(斯瓦米·维韦kanand技术大学比哈尔,印度)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 IndicEval提出了一种双语印度教育评估框架,通过真实考试题目评估LLM的推理、领域知识和双语适应性,揭示了跨模型性能差异和多语言退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16191 2026-02-19 cs.AI cs.HC cs.LG 90%

Large Language Models for Water Distribution Systems Modeling and Decision-Making

大型语言模型在水分配系统建模与决策中的应用

Yinon Goldshtein, Gal Perelman, Assaf Schuster, Avi Ostfeld

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM-EPANET框架,利用大型语言模型实现与EPANET的自然语言交互,提升水分配系统建模与决策的效率和透明度。

Comments Accepted to EWRI Congress 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15850 2026-02-19 cs.CL 89%

Large Language Models for Assisting American College Applications

大型语言模型用于协助美国大学申请

Zhengliang Liu, Weihang You, Peng Shu, Junhao Chen, Yi Pan, Hanqi Jiang, Yiwei Li, Zhaojun Ding, Chao Cao, Xinliang Li, Yifan Zhou, Ruidong Zhang, Shaochen Xu, Wei Ruan, Huaqin Zhao, Dajiang Zhu, Tianming Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 EZCollegeApp 通过大型语言模型帮助高中生处理复杂大学申请流程,提供结构化表格、权威文件支持及人工控制,提升申请效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16201 2026-02-19 cs.CL cs.AI cs.CY 88%

Long-Tail Knowledge in Large Language Models: Taxonomy, Mechanisms, Interventions and Implications

大语言模型中的长尾知识:分类、机制、干预与影响

Sanket Badhe, Deep Shah, Nehal Kathrotia

机构 * Google(谷歌)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型中长尾知识的定义、机制、干预及影响,提出统一框架以理解其表现和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16639 2026-02-19 cs.CL 88%

AREG: Adversarial Resource Extraction Game for Evaluating Persuasion and Resistance in Large Language Models

AREG:对抗性资源提取游戏用于评估大型语言模型的说服力与抗性

Adib Sakhawat, Fardeen Sadab

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Islamic University of Technology(伊斯兰技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 AREG通过对抗性资源提取游戏评估大型语言模型的说服与抗性能力,发现两者弱相关且存在系统性防御优势。

Comments 15 pages, 5 figures, 11 tables. Includes appendix with detailed experimental results and prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16438 2026-02-19 cs.LG cs.AI 88%

Intra-Fairness Dynamics: The Bias Spillover Effect in Targeted LLM Alignment

内在公平动态:定向大语言模型对齐中的偏见溢出效应

Eva Paraschou, Line Harder Clemmensen, Sneha Das

机构 * Department of Applied Mathematics and Computer Science, Technical University of Denmark(应用数学与计算机科学系,丹麦技术大学) Department of Mathematical Sciences, University of Copenhagen(数学科学系,哥本哈根大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文研究了定向性别对齐对多敏感属性公平性的影响,发现改善某一属性公平性可能加剧其他属性的不平等,强调了多属性、情境感知公平性评估的重要性。

Comments Submitted to the BiAlign CHI Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16131 2026-02-19 stat.ML cs.LG 85%

Empirical Cumulative Distribution Function Clustering for LLM-based Agent System Analysis

基于经验累积分布函数的LLM代理系统分析聚类

Chihiro Watanabe, Jingyu Sun

机构 * NTT Computer and Data Science Laboratories(NTT计算机与数据科学实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于经验累积分布函数的LLM代理系统评估方法,通过聚类分析揭示不同配置下的响应质量分布差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16039 2026-02-19 cs.AI 85%

How Uncertain Is the Grade? A Benchmark of Uncertainty Metrics for LLM-Based Automatic Assessment

评分的不确定性有多大?基于大语言模型的自动评估中不确定性度量的基准测试

Hang Li, Kaiqi Yang, Xianxuan Long, Fedor Filippov, Yucheng Chu, Yasemin Copur-Gencturk, Peng He, Cory Miller, Namsoo Shin, Joseph Krajcik, Hui Liu, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) University of Southern California(南加州大学) Washington State University(华盛顿州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了基于大语言模型的自动评估中不确定性度量的基准测试,分析了不同方法的优劣及影响因素,旨在提升评分系统的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11348 2026-02-19 cs.AI 85%

AgentNoiseBench: Benchmarking Robustness of Tool-Using LLM Agents Under Noisy Condition

AgentNoiseBench: 在噪声条件下评估工具使用LLM代理的鲁棒性基准测试

Ruipeng Wang, Yuxin Chen, Yukai Wang, Chang Wu, Junfeng Fang, Xiaodong Cai, Qi Gu, Hui Su, An Zhang, Xiang Wang, Xunliang Cai, Tat-Seng Chua

机构 * University of Science(科学大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentNoiseBench通过在噪声环境中评估LLM代理的鲁棒性,揭示了现有模型对现实扰动的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15801 2026-02-19 cs.CL cs.AI 85%

VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models

VerifyBench: 大型语言模型参考式奖励系统的基准测试

Yuchen Yan, Jin Jiang, Zhenbang Ren, Yijun Li, Xudong Cai, Yang Liu, Xin Xu, Mengdi Zhang, Jian Shao, Yongliang Shen, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Meituan Group(美团集团) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 VerifyBench通过设计专门的基准测试评估基于参考的奖励系统,揭示现有验证器在复杂任务中的不足,推动推理模型训练的改进。

Comments ICLR 2026: https://openreview.net/forum?id=JfsjGmuFxz Project Page: https://zju-real.github.io/VerifyBench Dataset: https://huggingface.co/datasets/ZJU-REAL/VerifyBench Code: https://github.com/ZJU-REAL/VerifyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23350 2026-02-19 cs.SE 82%

Validating Formal Specifications with LLM-generated Test Cases

用LLM生成的测试用例验证形式规范

Alcino Cunha, Nuno Macedo

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文利用GPT-5等大语言模型自动生成测试用例,用于验证形式规范的正确性,有效检测人类编写错误的规范。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04536 2026-02-19 cs.CL cs.AI cs.LG 82%

Evaluating Language Model Agency through Negotiations

通过谈判评估语言模型的代理能力

Tim R. Davidson, Veniamin Veselovsky, Martin Josifoski, Maxime Peyrard, Antoine Bosselut, Michal Kosinski, Robert West

机构 * EPFL(瑞士联邦理工学院) UGA(普罗万大学) CNRS(法国国家科学研究中心) LIG(里莫恩-盖朗实验室) Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过谈判游戏评估语言模型的代理能力,发现封闭源模型更擅长完成任务,合作谈判游戏最具挑战性,且强模型可能输给弱对手。

Comments Accepted to ICLR 2024, code and link to project data are made available at https://github.com/epfl-dlab/LAMEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04072 2026-02-19 cs.CL cs.HC 81%

Toward Beginner-Friendly LLMs for Language Learning: Controlling Difficulty in Conversation

迈向语言学习的初学者友好型LLM:对话中的难度控制

Meiqing Jin, Liam Dugan, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出通过可控生成技术提升初学者与LLM对话的可理解性,实验表明该方法能显著提高输出清晰度,并引入新的评估指标支持语言学习研究。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16626 2026-02-19 cs.LG cs.AI q-bio.NC 81%

A Systematic Evaluation of Sample-Level Tokenization Strategies for MEG Foundation Models

对MEG基础模型的样本级分词策略系统评估

SungJun Cho, Chetan Gohil, Rukuang Huang, Oiwi Parker Jones, Mark W. Woolrich

机构 * Oxford Centre for Human Brain Activity(牛津人类大脑活动中心) University of Oxford(牛津大学) Nuffield Department of Clinical Neurosciences(努尔菲尔德临床神经科学系) Department of Psychiatry(精神病学系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文系统评估了MEG数据中样本级分词策略对神经基础模型的影响,提出了一种基于自编码器的可学习分词方法,实验表明简单固定分词策略在重建准确性和下游任务性能上表现良好。

Comments 15 pages, 10 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15373 2026-02-19 cs.CL cs.AI 81%

Far Out: Evaluating Language Models on Slang in Australian and Indian English

远在天边:评估语言模型在澳大利亚英语和印度英语俚语上的表现

Deniz Kaya Dilsiz, Dipankar Srirag, Aditya Joshi

机构 * University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究评估了语言模型在澳大利亚英语和印度英语俚语上的表现,发现印度英语在目标词选择任务中表现更优,揭示了生成与判别能力在俚语理解上的不对称性。

Comments Accepted as a paper at 13th VarDial workshop at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05023 2026-02-19 cs.CR cs.AI 79%

Do Vision-Language Models Respect Contextual Integrity in Location Disclosure?

视觉-语言模型在位置披露中是否尊重上下文完整性?

Ruixin Yang, Ethan Mendes, Arthur Wang, James Hays, Sauvik Das, Wei Xu, Alan Ritter

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉-语言模型在位置披露中的隐私问题,指出现有模型在隐私保护方面存在不足,提出VLM-GEOPRIVACY基准以评估模型对上下文完整性的尊重程度。

Comments Accepted by ICLR 2026. Code and data can be downloaded via https://github.com/99starman/VLM-GeoPrivacyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06028 2026-02-19 cs.HC cs.LG 79%

Leveraging Foundation Models for Calibration-Free c-VEP BCIs

利用基础模型实现无需校准的c-VEP脑机接口

Mohammadreza Behboodi, Eli Kinney-Lang, Ali Etemad, Adam Kirton, Hatem Abou-Zeid

机构 * Department of Biomedical Engineering, University of Calgary(生物医学工程系,卡尔加里大学) Department of Electrical and Computer Engineering, Queen’s University(电气与计算机工程系,皇后大学) Department of Pediatric and Clinical Neuroscience, University of Calgary(儿科与临床神经科学系,卡尔加里大学) Department of Electrical and Software Engineering, University of Calgary(电气与软件工程系,卡尔加里大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出基于基础模型的无需校准c-VEP脑机接口方法,通过训练分类头实现即插即用,无需受试者特定数据,实验显示在两个数据集上均取得较高准确率。

Comments 8 Pages, 2 figures, Accepted and Presented at the IEEE SMC Conference 2025

Journal ref 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Vienna, Austria, 2025, pp. 4564-4571

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15848 2026-02-19 cs.CL cs.AI 79%

Can LLMs Assess Personality? Validating Conversational AI for Trait Profiling

LLMs能评估人格吗?验证对话式AI用于特质分析

Andrius Matšenas, Anet Lello, Tõnis Lees, Hans Peep, Kim Lilii Tamm

机构 * University of Tartu(塔尔图大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究验证了LLM在对话中评估人格特质的可行性,发现其在部分人格维度上与传统问卷结果相当,但需进行特定特质校准。

Comments 13 pages, 7 figures, 4 tables, 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16038 2026-02-19 cs.NE cs.LG 77%

Heuristic Search as Language-Guided Program Optimization

启发式搜索作为语言引导的程序优化

Mingxin Yu, Ruixiao Yang, Chuchu Fan

机构 * Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种结构化框架,通过分解启发式发现过程为模块化阶段,提升LLM驱动的自动启发式设计在组合优化中的性能。

Comments 8 pages, 3 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15485 2026-02-19 cs.CR cs.AI cs.SE 77%

SecCodeBench-V2 Technical Report

SecCodeBench-V2 技术报告

Longfei Chen, Ji Zhao, Lanxiao Cui, Tong Su, Xingbo Pan, Ziyang Li, Yongxing Wu, Qijiang Cao, Qiyao Cai, Jing Zhang, Yuandong Ni, Junyao He, Zeyu Zhang, Chao Ge, Xuhuai Lu, Zeyu Gao, Yuxin Cui, Weisen Chen, Yuxuan Peng, Shengping Wang, Qi Li, Yukai Huang, Yukun Liu, Tuo Zhou, Terry Yue Zhuo, Junyang Lin, Chao Zhang

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SecCodeBench-V2 通过动态执行和LLM-as-a-judge oracle评估AI编程助手的安全能力,提供可复现的基准测试框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17544 2026-02-19 cs.AI 77%

A Multimodal Conversational Assistant for the Characterization of Agricultural Plots from Geospatial Open Data

一种多模态对话助手,用于从遥感开放数据中表征农业地块

Juan Cañada, Raúl Alonso, Julio Molleda, Fidel Díez

机构 * Dept. AI \& Data Analytics CTIC Technology Center Gijón, Spain Dept. IT CTIC Technology Center Gijón, Spain Eng. University of Oviedo Gijón, Spain Dept. R \& D CTIC Technology Center Gijón, Spain

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出一种多模态对话助手,通过自然语言交互整合遥感和农业数据,降低专业信息访问门槛,实现农业地块表征。

Comments Accepted at 2025 4th International Conference on Geographic Information and Remote Sensing Technology

Journal ref Proc. Int. Conf. GIRST 2025 (2025) 127-132

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16008 2026-02-19 cs.SD cs.AI cs.CL cs.LG 75%

MAEB: Massive Audio Embedding Benchmark

MAEB:大规模音频嵌入基准

Adnan El Assadi, Isaac Chung, Chenghao Xiao, Roman Solomatin, Animesh Jha, Rahul Chand, Silky Singh, Kaitlyn Wang, Ali Sartaz Khan, Marc Moussa Nasser, Sufen Fong, Pengfei He, Alan Xiao, Ayush Sunil Munot, Aditya Shrivastava, Artem Gazizov, Niklas Muennighoff, Kenneth Enevoldsen

机构 * Carleton University(卡尔顿大学) Durham University(杜伦大学) Stanford University(斯坦福大学) Aarhus University(奥胡斯大学) Indian Institute of Technology, Kharagpur(印度理工学院,卡里格普) Harvard University(哈佛大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAEB是一个涵盖多语言音频任务的基准,揭示了不同模型在音频与语言任务上的性能差异,展示了音频编码器在跨模态任务中的表现关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20814 2026-02-19 cs.SE cs.CR 75%

Secure Coding with AI -- From Detection to Repair

安全编码与AI——从检测到修复

Vladislav Belozerov, Peter J Barclay, Ashkan Sami

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了GPT生成代码的安全性,评估了LLMs在检测和修复漏洞方面的能力,发现LLMs在真实世界中能显著提高漏洞检测和修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15873 2026-02-19 cs.RO cs.AI 74%

Test-Time Adaptation for Tactile-Vision-Language Models

测试时适应用于触觉-视觉-语言模型

Chuyang Ye, Haoxian Jing, Qinting Jiang, Yixi Lin, Qiang Li, Xing Tang, Jingyan Jiang

机构 * Shenzhen Technology University(深圳技术大学) New York University(纽约大学) Shenzhen University(深圳大学) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(title);分类 cs.AI

AI总结 本文提出了一种可靠性感知框架,用于提升触觉-视觉-语言模型在测试时的适应能力,通过估计各模态可靠性来过滤不可靠样本并优化融合过程,有效提升了在模态损坏情况下的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13194 2026-02-19 cs.CL cond-mat.dis-nn cond-mat.stat-mech cs.AI 73%

Semantic Chunking and the Entropy of Natural Language

语义分块与自然语言的熵

Weishun Zhong, Doron Sivan, Tankut Can, Mikhail Katkov, Misha Tsodyks

机构 * School of Natural Sciences, Institute for Advanced Study, Princeton, NJ, 08540, USA(自然科学学院,普林斯顿高级研究院) Department of Brain Sciences, Weizmann Institute of Science, Rehovot, 76100, Israel(脑科学系,魏茨曼科学研究所) Department of Physics, Emory University, Atlanta, GA 30322, USA(物理系,埃默里大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出了一种统计模型,通过自相似分割文本为语义连贯的块,揭示自然语言熵率随语义复杂度增加而上升的特性。

Comments 29 pages, 9 figures; typos fixed

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22237 2026-02-19 cs.CL cs.AI cs.SE 73%

FeatBench: Towards More Realistic Evaluation of Feature-level Code Generation

FeatBench: 向更真实的特征级代码生成评估迈进

Haorui Chen, Chengze Li, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) University of Electronic Science and Technology of China(电子科技大学) Nanjing University(南京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 FeatBench提出了一种新的特征级代码生成评估基准,通过真实任务输入和动态数据构建,解决现有基准的局限性,并揭示了代理在实现中的激进行为问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15958 2026-02-19 cs.CL cs.AI cs.CV 73%

DocSplit: A Comprehensive Benchmark Dataset and Evaluation Approach for Document Packet Recognition and Splitting

DocSplit: 一个全面的基准数据集和评估方法用于文档包识别与分割

Md Mofijul Islam, Md Sirajus Salekin, Nivedha Balakrishnan, Vincil C. Bishop, Niharika Jain, Spencer Romo, Bob Strahan, Boyi Xie, Diego A. Socolinsky

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DocSplit提出首个全面的文档包识别与分割基准数据集及评估方法,涵盖多类型文档和复杂场景,揭示当前模型在处理复杂文档分割任务中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15842 2026-02-19 cs.LG cs.CL 73%

Memes-as-Replies: Can Models Select Humorous Manga Panel Responses?

基于漫画面板的回复:模型能否选择幽默的漫画面板回应?

Ryosuke Kohita, Seiichiro Yoshioka

机构 * Ryosuke Kohita Seiichiro Yoshioka

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MaMe-Re基准,探讨模型在动态语境中选择幽默漫画回复的挑战,揭示LLMs在捕捉社交线索和区分微妙幽默方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03310 2026-02-19 cs.CL cs.CR cs.LG 73%

Randomized Masked Finetuning: An Efficient Way to Mitigate Memorization of PIIs in LLMs

随机掩码微调:一种缓解LLM中PII记忆的有效方法

Kunj Joshi, David A. Smith

机构 * Khoury College of Computer Sciences, Northeastern University, Boston, MA, USA(东北大学科里学院计算机科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出随机掩码微调方法,有效减少LLM中PII记忆,同时保持模型性能,通过实验验证其在隐私保护和效用之间的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16607 2026-02-19 cs.CL 70%

CitiLink-Summ: Summarization of Discussion Subjects in European Portuguese Municipal Meeting Minutes

CitiLink-Summ:欧洲葡萄牙语市政会议记录中讨论主题的摘要

Miguel Marques, Ana Luísa Fernandes, Ana Filipa Pacheco, Rute Rebouças, Inês Cantante, José Isidro, Luís Filipe Cunha, Alípio Jorge, Nuno Guimarães, Sérgio Nunes, António Leal, Purificação Silvano, Ricardo Campos

机构 * University of Beira Interior(贝拉内华大学) University of Macau(澳门大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CitiLink-Summ数据集,包含欧洲葡萄牙语市政会议记录及人工摘要,用于研究该领域自动摘要技术。

详情

展开后加载摘要…

URL PDF HTML 收藏