arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-20 至 2026-02-20 共收录 157 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 46 篇

2503.23339 2026-02-20 cs.AI cs.CL cs.HC 86%

A Scalable Framework for Evaluating Health Language Models

可扩展的健康语言模型评估框架

Neil Mallinar, A. Ali Heydari, Xin Liu, Anthony Z. Faranesh, Brent Winslow, Nova Hammerquist, Benjamin Graef, Cathy Speed, Mark Malhotra, Shwetak Patel, Javier L. Prieto, Daniel McDuff, Ahmed A. Metwally

机构 * Google Research(谷歌研究)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出自适应精确布尔评估框架,用于高效评估健康领域语言模型,提升评估效率和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16777 2026-02-20 cs.CL 85%

DistillNote: Toward a Functional Evaluation Framework of LLM-Generated Clinical Note Summaries

DistillNote:一种评估大语言模型生成临床笔记摘要功能性的框架

Heloisa Oss Boll, Antonio Oss Boll, Leticia Puttlitz Boll, Ameen Abu Hanna, Iacer Calixto

机构 * Department of Medical Informatics, Amsterdam UMC, University of Amsterdam(医学信息学系,阿姆斯特丹大学) Amsterdam Public Health, Methodology(阿姆斯特丹公共健康与方法学) Institute of Mathematics and Statistics, University of São Paulo(数学与统计学研究所,圣保罗大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DistillNote提出了一种评估大语言模型生成临床摘要功能性的新方法,通过下游任务验证摘要的诊断信号保留,揭示压缩与性能的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16943 2026-02-20 cs.AI cs.SE 85%

Mind the GAP: Text Safety Does Not Transfer to Tool-Call Safety in LLM Agents

注意GAP:在LLM代理中,文本安全不转移到工具调用安全

Arnold Cartagena, Ariane Teixeira

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究发现LLM代理中文本安全不等同于工具调用安全,引入GAP基准测试揭示两者差异,强调需专门评估工具调用安全。

Comments 23 pages, 5 figures, 4 tables, code and data at https://github.com/acartag7/gap-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16752 2026-02-20 cs.CR 85%

The Vulnerability of LLM Rankers to Prompt Injection Attacks

大语言模型排序器对提示注入攻击的脆弱性

Yu Yin, Shuai Wang, Bevan Koopman, Guido Zuccon

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了大语言模型排序器对提示注入攻击的脆弱性,通过实验证明不同架构和设置下的攻击效果,并揭示了编码器-解码器架构的抗性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07287 2026-02-20 cs.CR cs.SE 85%

Patch-to-PoC: A Systematic Study of Agentic LLM Systems for Linux Kernel N-Day Reproduction

Patch-to-PoC: 对Linux内核N-day漏洞自动复现的系统研究

Juefei Pu, Xingyu Li, Zhengchuan Liang, Jonathan Cox, Yifan Wu, Kareem Shehada, Arrdya Srivastav, Zhiyun Qian

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出K-Repro系统,利用LLM自动复现Linux内核N-day漏洞,实现超过50%的漏洞复现率,为自主安全代理的构建和N-day风险评估提供指导。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24368 2026-02-20 cs.LG cs.AI cs.CR 84%

Watermarking Diffusion Language Models

扩散语言模型水印

Thibaud Gloaguen, Robin Staab, Nikola Jovanović, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个针对扩散语言模型的水印技术,通过在期望上下文中应用水印并促进增强水印强度的token,实现高真阳性率和低质量影响的可靠水印。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17623 2026-02-20 cs.CL 79%

Unmasking the Factual-Conceptual Gap in Persian Language Models

揭示波斯语言模型中的事实-概念鸿沟

Alireza Sakhaeirad, Ali Ma'manpoosh, Arshia Hemmat

机构 * EPFL(瑞士联邦理工学院) University of Isfahan(伊斯法罕大学) University of Oxford(牛津大学)

专题命中 评测与基准 :language model(title);pretraining(abstract);分类 cs.CL

AI总结 本文通过DivanBench揭示波斯语言模型在文化常识推理上的不足,发现模型在处理迷信和习俗问题时存在严重偏差,且预训练并未提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17413 2026-02-20 cs.CR cs.CL 79%

DAVE: A Policy-Enforcing LLM Spokesperson for Secure Multi-Document Data Sharing

DAVE:一种强制使用策略的LLM发言人,用于安全的多文档数据共享

René Brinkhege, Prahlad Menon

机构 * Fraunhofer ISST(弗劳恩霍夫研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 DAVE是一种强制使用策略的LLM发言人,通过自然语言接口在不泄露敏感信息的情况下实现安全的多文档数据共享。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17066 2026-02-20 cs.AI 79%

Predictive Batch Scheduling: Accelerating Language Model Training Through Loss-Aware Sample Prioritization

预测批量调度:通过损失感知的样本优先级加速语言模型训练

Sumedh Rasal

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 预测批量调度通过损失感知的样本优先级加速语言模型训练,利用轻量级预测器提升收敛速度,实现高效课程学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16942 2026-02-20 cs.AI 77%

SourceBench: Can AI Answers Reference Quality Web Sources?

SourceBench: 人工智能答案能否引用高质量的网络来源?

Hexi Jin, Stephen Liu, Yuheng Li, Simran Malik, Yiying Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校) GenseeAI Inc.(GenseeAI公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SourceBench通过评估AI引用的网络来源质量,揭示了生成式AI在信息检索中的关键挑战与改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21493 2026-02-20 cs.CE 75%

Sci2Pol: Evaluating and Fine-tuning LLMs on Scientific-to-Policy Brief Generation

Sci2Pol:评估和微调用于科学论文到政策简报生成的LLM

Weimin Wu, Alexander C. Furnas, Eddie Yang, Gefei Liu, Akhil Pandey Akella, Xuefeng Song, Dashun Wang, Han Liu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Sci2Pol通过构建首个政策简报生成评估基准和训练数据集,评估并微调了多个LLM,提升了科学与政策之间的转化效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17264 2026-02-20 cs.IR 75%

On the Reliability of User-Centric Evaluation of Conversational Recommender Systems

对话推荐系统用户导向评估的可靠性研究

Michael Müller, Amir Reza Mohammadi, Andreas Peintner, Beatriz Barroso Gstrein, Günther Specht, Eva Zangerle

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了对话推荐系统用户导向评估的可靠性,发现部分维度在聚合下具有中等可靠性,而社会构念如人性和融洽度则不可靠,揭示了第三方判断中的晕轮效应。

Comments 5 pages, 2 figures. Submitted to UMAP 2026. Code available at https://github.com/michael-mue/reliable-crs-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04220 2026-02-20 cs.CL cs.AI 73%

BEADs: Bias Evaluation Across Domains

BEADs: 跨领域偏差评估

Shaina Raza, Mizanur Rahman, Michael R. Zhang

机构 * Vector Institute(向量研究所) Royal Bank of Canada(皇家银行) University of Toronto(多伦多大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 BEADs数据集通过跨领域偏差评估,提供广泛NLP任务的偏差检测与模型评估方案,揭示现有模型在人口群体上的系统性偏差问题。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16979 2026-02-20 cs.CV cs.CL cs.LG 73%

Characterizing the Predictive Impact of Modalities with Supervised Latent-Variable Modeling

基于监督潜在变量建模的模态预测影响分析

Divyam Madaan, Sumit Chopra, Kyunghyun Cho

机构 * New York University(纽约大学) Grossman School of Medicine(格罗斯曼医学院) Genentech(基因泰克) CIFAR(加拿大弗雷德里克·班克特研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 PRIMO是一种监督潜在变量插补模型,用于量化多模态学习中缺失模态的预测影响,通过方差度量评估模态对预测的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16832 2026-02-20 cs.AI cs.CL 73%

IndicJR: A Judge-Free Benchmark of Jailbreak Robustness in South Asian Languages

IndicJR:一种无裁判的南亚语言对抗鲁棒性基准

Priyaranjan Pattnayak, Sanchari Chowdhuri

机构 * Oracle America Inc.(Oracle美国公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 IndicJR是一种无裁判的南亚语言对抗鲁棒性基准,揭示了多语言对抗攻击的模式和风险,尤其关注南亚用户的语言转换和罗马化问题。

Comments Accepted in EACL Industry Track Oral, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16805 2026-02-20 cs.AI cs.LG 73%

Simple Baselines are Competitive with Code Evolution

简单基线在代码进化中具有竞争力

Yonatan Gideoni, Sebastian Risi, Yarin Gal

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现简单基线在代码进化任务中表现优异,指出搜索空间设计和评估方法改进是未来研究重点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17425 2026-02-20 cs.CL 70%

Evaluating Extremely Low-Resource Machine Translation: A Comparative Study of ChrF++ and BLEU Metrics

评估极低资源机器翻译:ChrF++和BLEU指标的比较研究

Sanjeev Kumar, Preethi Jyothi, Pushpak Bhattacharyya

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了BLEU和ChrF++在极低资源语言机器翻译评估中的表现,发现BLEU在提供词汇精确度见解方面具有补充作用。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17111 2026-02-20 cs.AI 70%

Instructor-Aligned Knowledge Graphs for Personalized Learning

面向个性化学习的教师对齐知识图谱

Abdulrahman AlRabah, Priyanka Kargupta, Jiawei Han, Abdussalam Alawini

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 InstructKG通过自动构建教师对齐的知识图谱,捕捉课程预期的学习进程,以支持个性化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17106 2026-02-20 cs.AI 70%

Toward Trustworthy Evaluation of Sustainability Rating Methodologies: A Human-AI Collaborative Framework for Benchmark Dataset Construction

迈向可信的可持续性评级方法论评估:一种人机协作框架用于基准数据集构建

Xiaoran Cai, Wang Yang, Xiyu Ren, Chekun Law, Rohit Sharma, Peng Qi

机构 * Columbia University, USA(哥伦比亚大学) Case Western Reserve University, USA(凯斯西储大学) Hong Kong University of Science(香港科学大学) NVIDIA, USA(NVIDIA公司) Informatica Inc., USA(Informatica公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种人机协作框架,用于构建可信的可持续性评级方法论基准数据集,以提高评分的可比性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17084 2026-02-20 cs.AI cs.SE 70%

How AI Coding Agents Communicate: A Study of Pull Request Description Characteristics and Human Review Responses

AI 编程代理如何交流:对拉取请求描述特征和人类审查响应的研究

Kan Watanabe, Rikuto Tsuchida, Takahiro Monno, Bin Huang, Kazuma Yamasaki, Youmei Fan, Kazumasa Shimari, Kenichi Matsumoto

机构 * Nara Institute of Science and Technology(奈良科学技術研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究分析了AI编程代理在拉取请求描述风格上的差异及其对人类审查员响应的影响,揭示了人机协作开发中的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17558 2026-02-20 cs.CV 67%

RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward

RetouchIQ: 基于指令的图像修复MLLM代理与通用奖励模型

Qiucheng Wu, Jing Shi, Simon Jenni, Kushal Kafle, Tianyu Wang, Shiyu Chang, Handong Zhao

机构 * Adobe Research(Adobe研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 RetouchIQ通过通用奖励模型提升指令基于图像编辑的语义一致性和感知质量,展现灵活可解释的编辑能力。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17157 2026-02-20 eess.AS 67%

CC-G2PnP: Streaming Grapheme-to-Phoneme and prosody with Conformer-CTC for unsegmented languages

CC-G2PnP:基于Conformer-CTC的流式图形到语音及语调连接模型

Yuma Shirahata, Ryuichi Yamamoto

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CC-G2PnP通过Conformer-CTC架构实现流式图形到语音及语调预测,适用于无分隔语言,实验显示其在PnP标签预测准确率上优于基线模型。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16756 2026-02-20 cs.CR cs.SE 67%

NESSiE: The Necessary Safety Benchmark -- Identifying Errors that should not Exist

NESSiE: 必要安全基准 -- 识别不应存在的错误

Johannes Bertram, Jonas Geiping

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 NESSiE提出了一种轻量级安全基准,用于检测大型语言模型中不应存在的安全故障,揭示模型在帮助与安全之间的偏差。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17445 2026-02-20 cs.CL cs.LG 62%

ABCD: All Biases Come Disguised

ABCD: 所有偏差都伪装成

Mateusz Nowak, Xavier Cadet, Peter Chin

机构 * Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 ABCD提出了一种减少LLM评估偏差的协议,通过替换标签和使用完整答案,提高模型在不同答案排列下的鲁棒性,减少性能方差。

Comments 29 pages, 20 figures, pre-print, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16747 2026-02-20 cs.LG cs.AI 62%

LiveClin: A Live Clinical Benchmark without Leakage

LiveClin: 一种无泄漏的实时临床基准

Xidong Wang, Shuqi Guo, Yue Shen, Junying Chen, Jian Wang, Jinjie Gu, Ping Zhang, Lei Liu, Benyou Wang

机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) Ant Healthcare, Ant Group(蚂蚁集团) Zhejiang University(浙江大学) The Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 LiveClin通过实时更新的临床病例基准,评估医学大语言模型在真实临床场景中的表现,揭示其在复杂医疗任务中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12026 2026-02-20 cs.AI cs.CV cs.LG 62%

Bongard-RWR+: Real-World Representations of Fine-Grained Concepts in Bongard Problems

Bongard-RWR+: Bongard问题中细粒度概念的现实世界表示

Szymon Pawlonka, Mikołaj Małkiński, Jacek Mańdziuk

机构 * Warsaw University of Technology(华沙技术大学) AGH University of Krakow(克拉科夫AGH大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Bongard-RWR+数据集,通过视觉语言模型生成现实世界图像,评估VLMs在细粒度概念识别中的局限性。

Comments Accepted to The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17625 2026-02-20 cs.LG cs.DC 57%

Catastrophic Forgetting Resilient One-Shot Incremental Federated Learning

抗灾难性遗忘的一次式联邦学习

Obaidullah Zaland, Zulfiqar Ahmad Khan, Monowar Bhuyan

机构 * Linköping University(利厄普大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 OSI-FL通过一次通信轮次生成类别特定嵌入并结合选择性样本保留技术,有效解决增量联邦学习中的通信开销和灾难性遗忘问题。

Comments Accepted for publication in the IEEE International Conference on Big Data (IEEE BigData) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17594 2026-02-20 cs.AI 57%

AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games

AI 游戏商店:通过人类游戏评估机器通用智能的可扩展性和开放性

Lance Ying, Ryan Truong, Prafull Sharma, Kaiya Ivy Zhao, Nathan Cloos, Kelsey R. Allen, Thomas L. Griffiths, Katherine M. Collins, José Hernández-Orallo, Phillip Isola, Samuel J. Gershman, Joshua B. Tenenbaum

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 通过AI GameStore评估机器通用智能,利用人类游戏测试AI在游戏中的表现,发现其在复杂游戏任务中表现不佳。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15531 2026-02-20 cs.AI cs.DB 57%

EduEVAL-DB: A Role-Based Dataset for Pedagogical Risk Evaluation in Educational Explanations

EduEVAL-DB:基于角色的用于教育解释中教学风险评估的数据集

Javier Irigoyen, Roberto Daza, Aythami Morales, Julian Fierrez, Francisco Jurado, Alvaro Ortigosa, Ruben Tolosana

机构 * Department of Mathematics, Universidad de Las Palmas de Gran Canaria(数学系,拉斯帕尔马斯德格拉纳达大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 EduEVAL-DB是一个基于教师角色的教育解释教学风险评估数据集,通过人类和LLM生成的解释及风险评估量表,评估教学风险检测模型的性能。

Comments 10 pages, 3 figures. Published in Intl. Conf. on Learning Analytics & Knowledge Workshops (LAK Workshops 2026, GenAI-LA 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16938 2026-02-20 cs.CL 57%

ConvApparel: A Benchmark Dataset and Validation Framework for User Simulators in Conversational Recommenders

ConvApparel:一种用于对话推荐系统中用户模拟器的基准数据集和验证框架

Ofer Meshi, Krisztian Balog, Sally Goldman, Avi Caciularu, Guy Tennenholtz, Jihwan Jeong, Amir Globerson, Craig Boutilier

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 ConvApparel通过双代理数据收集和反事实验证框架,评估对话推荐系统中用户模拟器的现实差距和泛化能力。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏