arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-09 至 2026-01-09 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 48 篇

2510.17652 2026-01-09 cs.CL 91%

Qomhra: A Bilingual Irish and English Large Language Model

Qomhra: 一种双语爱尔兰语和英语大语言模型

Joseph McInerney, Khanh-Tung Tran, Liam Lonergan, Ailbhe Ní Chasaide, Neasa Ní Chiaráin, Barry Devereux

机构 * Trinity College Dublin(三一学院) University College Cork(科克大学) Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 Qomhra是一种双语爱尔兰语和英语大语言模型,通过低资源约束下的方法生成人类偏好数据,显著提升了爱尔兰语和英语的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04202 2026-01-09 cs.CL cs.AI cs.LG 90%

TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation

TeleTables: 电信表格解释中的大语言模型基准

Anas Ezzakri, Nicola Piovesan, Mohamed Sana, Antonio De Domenico, Fadhel Ayed, Haozhe Zhang

机构 * Paris Research Center, Huawei Technologies(巴黎研究中心,华为技术)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);pretraining(abstract)

AI总结 TeleTables 是一个用于评估大语言模型在电信表格解释能力的基准,揭示了在电信标准上进行领域微调的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04534 2026-01-09 cs.CL cs.AI 90%

BanglaLorica: Design and Evaluation of a Robust Watermarking Algorithm for Large Language Models in Bangla Text Generation

BanglaLorica: 大型语言模型在孟加拉语文本生成中的鲁棒水印算法设计与评估

Amit Bin Tariqul, A N M Zahid Hossain Milkan, Sahab-Al-Chowdhury, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

机构 * Systems and Software Lab (SSL) Department of Computer Science and Engineering(系统与软件实验室(SSL)计算机科学与工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出分层水印策略,提升孟加拉语LLM在RTT攻击下的检测精度,实现3-4倍的相对提升。

Comments Under review, 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04895 2026-01-09 cs.AI 89%

DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation

DVD:一种检测大规模语言模型评估中变体污染的稳健方法

Renzhao Liang, Jingru Chen, Bo Jia, Bo Deng, Chenggang Xie, Yidong Wang, Ke Jin, Xin Wang, Linfeng Zhang, Cunxiang Wang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16036 2026-01-09 cs.CL 89%

OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models

OpenEthics: 对开源生成大语言模型的全面伦理评估

Yıldırım Özen, Burak Erinç Çetin, Kaan Engür, Elif Naz Demiryılmaz, Cagri Toraman

机构 * Middle East Technical University(中东技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究对29个开源生成大语言模型进行全面伦理评估,评估鲁棒性、可靠性、安全性和公平性,发现较大模型在伦理表现上更优,禁言模板对多数模型无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16070 2026-01-09 cs.SE 89%

LLM4Perf: Large Language Models Are Effective Samplers for Multi-Objective Performance Modeling

LLM4Perf: 大语言模型在多目标性能建模中的有效性

Xin Wang, Zhenhao Li, Zishuo Ding

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 LLM4Perf通过大语言模型实现多目标性能建模,展现了其在配置空间修剪和反馈优化方面的有效性,提升了性能建模的准确性。

Comments ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04540 2026-01-09 cs.SE cs.AI 88%

AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation

AdaptEval: 一个用于评估大型语言模型在代码片段适应上的基准

Tanghaoran Zhang, Xinjun Mao, Shangwen Wang, Yuxin Zhao, Yao Lu, Jin Zhang, Zhang Zhang, Kang Yang, Yue Yu

机构 * College of Computer Science and Technology(计算机科学与技术学院) National University of Defense and Technology(国防科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 AdaptEval是一个用于评估大型语言模型在代码片段适应能力的基准,通过多粒度标注和细粒度测试框架,首次实证研究了六种LLMs在代码适应任务上的表现。

Comments 13 pages, 7 figures, Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06346 2026-01-09 cs.AI cs.CL 86%

LPFQA: A Long-Tail Professional Forum-based Benchmark for LLM Evaluation

LPFQA: 一个基于长尾专业论坛的LLM评估基准

Liya Zhu, Peizhuang Cong, Jingzhe Ding, Aowei Ji, Wenya Wu, Jiani Hou, Chunjie Wu, Xiang Gao, Jingkai Liu, Zhou Huan, Xuelei Sun, Yang Yang, Jianpeng Jiao, Liang Hu, Xinjie Chen, Jiashuo Liu, Tong Yang, Zaiyuan Wang, Ge Zhang, Wenhao Huang

机构 * ByteDance Seed Peking University(字节跳动种子北京大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LPFQA是一个基于真实专业论坛的长尾知识基准,用于评估LLM在专业领域推理和领域术语理解方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05022 2026-01-09 cs.CR 85%

Knowledge-to-Data: LLM-Driven Synthesis of Structured Network Traffic for Testbed-Free IDS Evaluation

知识到数据:基于大语言模型的结构化网络流量合成用于无测试床IDS评估

Konstantinos E. Kampourakis, Vyron Kampourakis, Efstratios Chatzoglou, Georgios Kambourakis, Stefanos Gritzalis

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用大语言模型生成结构化网络流量数据集,以实现无测试床的IDS评估,通过显式约束提升数据真实性,使分类器在真实样本上的F1分数达到0.956。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24307 2026-01-09 cs.HC 85%

Exploring Similarity between Neural and LLM Trajectories in Language Processing

探索神经与大语言模型在语言处理中的相似性

Xin Xiao, Kaiwen Wei, Jiang Zhong, Xuekai Wei, Mingliang Zhou

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过比较LLMs与人类大脑在语言处理中的轨迹相似性,揭示了语义整合机制和实时处理动态的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13655 2026-01-09 cs.CL cs.SE 83%

Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation

大语言模型擦除方法的比较分析:跨架构评估

Richard J. Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究比较了四种擦除工具在不同模型架构上的效果,发现数学推理能力对擦除干预最敏感,且单次通过方法在保持能力方面表现更优。

Comments 25 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17542 2026-01-09 cs.SE 82%

AssertFlip: Reproducing Bugs via Inversion of LLM-Generated Passing Tests

AssertFlip: 通过翻转LLM生成的通过测试来复现错误

Lara Khatib, Noble Saji Mathews, Meiyappan Nagappan

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 AssertFlip通过翻转LLM生成的通过测试来复现错误,有效提升错误复现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04455 2026-01-09 cs.IR cs.AI cs.CL cs.LG 80%

Re-Rankers as Relevance Judges

重排序器作为相关性判断者

Chuan Meng, Jiqun Liu, Mohammad Aliannejadi, Fengran Mo, Jeff Dalton, Maarten de Rijke

机构 * The University of Edinburgh(爱丁堡大学) University of Oklahoma(俄克拉荷马大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出将重排序器作为相关性判断者的方法,通过两种适应策略在重排序任务中实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05114 2026-01-09 cs.AI 79%

Evaluative Fingerprints: Stable and Systematic Differences in LLM Evaluator Behavior

评估指纹:大语言模型评估器行为的稳定性和系统性差异

Wajid Nasser

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 大语言模型评估器行为存在稳定且系统性的差异,其分歧模式可作为指纹,揭示不同模型对质量的隐含理论。

Comments 23 pages, 6 figures, code and artifacts at : https://github.com/wajid-nasser/evaluative-fingerprints

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05059 2026-01-09 cs.CV cs.LG 79%

From Understanding to Engagement: Personalized pharmacy Video Clips via Vision Language Models (VLMs)

从理解到参与:通过视觉语言模型(VLMs)生成个性化药学视频片段

Suyash Mishra, Qiang Li, Srikanth Patil, Anubhav Girdhar

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文提出基于视觉语言模型和音频语言模型的个性化药学视频片段生成方法,通过剪切合并算法和个性化机制提升生成效率与质量,实现制药行业内容处理的高效自动化。

Comments Contributed original research to top tier conference in VLM; currently undergoing peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04252 2026-01-09 cs.SE cs.CL 79%

Sphinx: Benchmarking and Modeling for LLM-Driven Pull Request Review

Sphinx:基于LLM的拉取请求审查的基准测试与建模

Daoan Zhang, Shuo Zhang, Zijian Jin, Jiebo Luo, Shengyu Fu, Elsie Nallipogu

机构 * University of Rochester(罗切斯特大学) Microsoft(微软公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 Sphinx通过结构化数据生成、检查表评估基准和CRPO训练范式,提升LLM在拉取请求审查中的性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01513 2026-01-09 cs.CL 79%

Evaluation and Facilitation of Online Discussions in the LLM Era: A Survey

在大语言模型时代评估和促进在线讨论:一篇综述

Katerina Korre, Dimitris Tsirmpas, Nikos Gkoumas, Emma Cabalé, Danai Myrtzani, Theodoros Evgeniou, Ion Androutsopoulos, John Pavlopoulos

机构 * Archimedes, Athena Research Center(阿希米德研究中心) Athens University of Economics and Business(雅典经济与商业大学) École Normale Supérieure Paris-Saclay(巴黎萨克雷高等师范学校) INSEAD

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文综述了大语言模型时代在线讨论评估与促进方法,提出新的评估分类、干预策略及未来研究方向。

Comments To appear in EMNLP 2025

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05111 2026-01-09 cs.CL cs.AI 79%

Agent-as-a-Judge

代理作为裁判

Runyang You, Hongru Cai, Caiqi Zhang, Qiancheng Xu, Meng Liu, Tiezheng Yu, Yongqi Li, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Cambridge(剑桥大学) Shandong Jianzhu University(山东建筑大学) Huawei Technologies(华为技术)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于代理的评估框架,通过规划、工具验证和多代理协作提升评估的鲁棒性和可验证性,并提供了该领域的发展分类和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04897 2026-01-09 cs.CL cs.CV cs.LG cs.MM 79%

V-FAT: Benchmarking Visual Fidelity Against Text-bias

V-FAT:基于文本偏见的视觉真实性基准测试

Ziteng Wang, Yujie He, Guanliang Li, Siqi Yang, Jiaqi Xiong, Songxiang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Meituan(美团) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04632 2026-01-09 cs.CL cs.AI 79%

From National Curricula to Cultural Awareness: Constructing Open-Ended Culture-Specific Question Answering Dataset

从国家课程到文化意识:构建开放性文化特定问答数据集

Haneul Yoo, Won Ik Cho, Geunhye Kim, Jiyoon Han

机构 * KAIST AI Center(韩国国立科学技术院人工智能中心) Samsung Electronics(三星电子) Hankuk University of Foreign Studies(韩国外语大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CuCu框架,利用国家课程构建文化特定的开放性问答数据集KCaQA,以提升语言模型在文化对齐方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04201 2026-01-09 cs.CL cs.AI cs.CY cs.HC 79%

Collective Narrative Grounding: Community-Coordinated Data Contributions to Improve Local AI Systems

集体叙事 grounding:社区协调的数据贡献以改进本地 AI 系统

Zihan Gao, Mohsin Y. K. Yousufi, Jacob Thebault-Spieker

机构 * Information Science University of Wisconsin-Madison(信息科学大学威斯康星大学麦迪逊分校) Digital Media Georgia Tech(数字媒体佐治亚理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出集体叙事 grounding 协议,通过社区协调的数据贡献,改进本地 AI 系统,解决社区特定查询的问答问题。

Comments 9 pages, 2 figures, Presented at the NeurIPS 2025 ACA Workshop accepted-papers.html" target="_blank" rel="noopener">https://acaworkshop.github.io/accepted-papers.html,

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09487 2026-01-09 cs.CE 78%

Benchmarking Time Series Foundation Models for Short-Term Household Electricity Load Forecasting

对短期家庭用电负荷预测的时间序列基础模型进行基准测试

Marcel Meyer, David Zapata, Sascha Kaltenpoth, Oliver Müller

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文比较了时序基础模型与从头开始训练的Transformer方法在短期家庭用电负荷预测中的性能,发现某些基础模型在输入增加时表现更优,且训练成本更低。

Comments This article has been accepted for publication in IEEE Access

Journal ref IEEE Access, vol. 13, pp. 218141-218153, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11399 2026-01-09 cs.CL cs.CV 77%

Minimal Clips, Maximum Salience: Long Video Summarization via Key Moment Extraction

最短片段,最大显著性:通过关键时刻提取实现长视频摘要

Galann Pennec, Zhengyuan Liu, Nicholas Asher, Philippe Muller, Nancy F. Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种通过关键时刻提取实现长视频多模态摘要的方法,利用轻量级模型和大型语言模型实现高效摘要生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07505 2026-01-09 cs.LG 77%

PEAR: Planner-Executor Agent Robustness Benchmark

PEAR:规划-执行代理鲁棒性基准

Shen Dong, Mingxuan Zhang, Pengfei He, Li Ma, Bhavani Thuraisingham, Hui Liu, Yue Xing

机构 * Michigan State University(密歇根州立大学) Purdue University(普渡大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PEAR基准通过评估规划-执行多智能体系统的鲁棒性,揭示了规划器弱点对任务性能的影响及鲁棒性与性能的权衡。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10991 2026-01-09 cs.CR cs.AI 77%

MCP-Guard: A Multi-Stage Defense-in-Depth Framework for Securing Model Context Protocol in Agentic AI

MCP-Guard: 一种多阶段纵深防御框架,用于保障代理AI中的模型上下文协议安全

Wenpeng Xing, Zhonghao Qi, Yupeng Qin, Yilin Li, Caini Chang, Jiahui Yu, Changting Lin, Zhenzhen Xie, Meng Han

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院) The Chinese University of Hong Kong(香港中文大学) Shandong University(山东大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MCP-Guard通过多阶段防御框架提升LLM与工具交互的安全性,利用E5模型和仲裁器实现高准确率的对抗性提示检测,并通过MCP-ATTACKBENCH验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26699 2026-01-09 cs.SE 75%

Using Copilot Agent Mode to Automate Library Migration: A Quantitative Assessment

使用 Copilot Agent 模式自动化库迁移:一项定量评估

Aylton Almeida, Laerte Xavier, Marco Tulio Valente

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过 Copilot Agent 模式评估了 SQLAlchemy 库迁移的自动化效果,发现其在功能迁移上表现良好但应用功能维护不足。

Comments Accepted at 1st International Workshop on Agentic Engineering (AGENT 2026, colocated with ICSE), pages 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04554 2026-01-09 cs.IR 75%

Exploring Recommender System Evaluation: A Multi-Modal User Agent Framework for A/B Testing

探索推荐系统评估:一种用于A/B测试的多模态用户代理框架

Wenlin Zhang, Xiangyang Li, Qiyuan Ge, Kuicai Dong, Pengyue Jia, Xiaopeng Li, Zijian Zhang, Maolin Wang, Yichao Wang, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种多模态用户代理框架,用于替代传统A/B测试,通过模拟真实用户行为提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06842 2026-01-09 cs.CL cs.AI 73%

PCoT: Persuasion-Augmented Chain of Thought for Detecting Fake News and Social Media Disinformation

PCoT:增强说服力的推理链用于检测虚假新闻和社会媒体谣言

Arkadiusz Modzelewski, Witold Sosnowski, Tiziano Labruna, Adam Wierzbicki, Giovanni Da San Martino

机构 * University of Padua(帕多瓦大学) Polish-Japanese Academy of Information Technology(波兰-日本信息科技学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PCoT通过整合说服知识提升零样本虚假信息检测性能,实验表明其在五个LLM和五个数据集上平均提升15%。

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04790 2026-01-09 cs.CL cs.AI 73%

Belief in Authority: Impact of Authority in Multi-Agent Evaluation Framework

权威信念:权威在多智能体评估框架中的影响

Junhyuk Choi, Jeongyoun Kwon, Heeju Kim, Haeun Cho, Hayeong Jung, Sehee Min, Bugeun Kim

机构 * Chung-Ang University(Chung-Ang 大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了权威角色在多智能体评估中的影响,发现专家和参照角色比合法角色更具影响力,并揭示了权威偏见的产生机制。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04469 2026-01-09 cs.CL cs.IR cs.LG 73%

SampoNLP: A Self-Referential Toolkit for Morphological Analysis of Subword Tokenizers

SampoNLP:一种用于子词分词形态分析的自指工具包

Iaroslav Chelombitko, Ekaterina Chelombitko, Aleksey Komissarov

机构 * DataSpike Neapolis University(内apolis大学) aglabx

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 SampoNLP通过自指原子性评分创建形态词典,评估BPE分词器在不同词汇量下的性能,提出IPS指标并提供最优词汇量推荐。

Comments Accepted to the 10th International Workshop on Computational Linguistics for Uralic Languages (IWCLUL 2025), pp. 57-67

详情

展开后加载摘要…

URL PDF HTML 收藏