arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2507.09580 2026-05-28 cs.CR 91%

AICrypto: Evaluating Cryptography Capabilities of Large Language Models

AICrypto:评估大型语言模型的密码学能力

Yu Wang, Yijian Liu, Liheng Ji, Han Luo, Wenjie Li, Xiaofei Zhou, Chiyun Feng, Puji Wang, Yuhan Cao, Geyuan Zhang, Xiaojian Li, Rongwu Xu, Yilei Chen, Tianxing He

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 构建AICrypto基准测试,通过多项选择题、夺旗挑战和证明题评估LLM在密码学知识记忆、漏洞利用和形式推理方面的能力,发现最先进模型在常规任务上匹配或超越人类专家,但在抽象概念理解和多步推理上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04975 2026-05-28 cs.CY 91%

Evaluating Chinese Large Language Models: The Influence of Persona Assignment on Stereotypes and Safeguards

评估中文大语言模型:角色分配对刻板印象和安全机制的影响

Geng Liu, Li Feng, Carlo Alberto Bono, Songbo Yang, Mengxiao Zhu, Francesco Pierri

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究通过大规模跨模型分析,量化了角色分配对四个中文大语言模型在拒绝行为和毒性输出放大方面的影响,并探索了基于外部评估器的迭代缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09620 2026-05-21 cs.CL cs.AI cs.LG 91%

AI-Augmented Surveys: Leveraging Large Language Models and Surveys for Opinion Prediction

AI增强的调查:利用大型语言模型和调查进行意见预测

Junsol Kim, Byungkyu Lee

机构 * Department of Sociology(社会学系) University of Chicago(芝加哥大学) New York University(纽约大学) Chicago, IL(伊利诺伊州芝加哥市) New York, NY(纽约州纽约市)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于大型语言模型的框架,通过结合问题、受访者和调查时期的嵌入表示,预测重复横断面调查中缺失的响应,从而弥补传统调查在捕捉历史变化方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05739 2026-05-19 cs.LG cs.AI cs.CL q-fin.CP 91%

Multi-Dimensional Behavioral Evaluation of Agentic Stock Prediction Systems Using Large Language Model Judges with Closed-Loop Reinforcement Learning Feedback

基于大语言模型判官的多维行为评估:用于代理股票预测系统的闭环强化学习反馈

Mohammad Al Ridhawi, Mahtab Haj Ali, Hussein Al Osman

机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多维行为评估方法,通过大语言模型判官评估代理系统决策过程,利用闭环强化学习反馈提升预测性能,验证了方法在股票预测中的有效性。

Comments 17 pages, 5 figures, 14 tables. Manuscript submitted to Applied Artificial Intelligence (Taylor and Francis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05424 2026-05-08 cs.CR 91%

Evaluating the Reliability of Multiple Large Language Models in Risk Assessment: A CIS Controls Based Approach

评估多个大型语言模型在风险评估中的可靠性:基于CIS控制的方法

Gustavo Roberto Pinto, Arthur do Prado Labaki, Rodrigo Sanches Miani

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文通过问卷分析50名专家与五种大语言模型在评估网络安全风险场景中的表现,发现大语言模型低估风险,强调需人类监督,建议将LLM作为补充工具。

Comments Manuscript under review - International Journal of Data Science and Analytics

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22240 2026-04-23 cs.SE 91%

Are Decoder-Only Large Language Models the Silver Bullet for Code Search?

解码器-only大语言模型是否是代码搜索的银弹?

Yuxuan Chen, Mingwei Liu, Guangsheng Ou, Anji Li, Dekun Dai, Yanlin Wang, Zibin Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文评估了11种解码器-only LLM在代码搜索任务中的性能,发现经过微调的模型在零样本和微调设置下均优于编码器-only模型,且模型大小和训练数据组成对性能有显著影响。

Comments Published in IEEE Transactions on Software Engineering (2026). 19 pages

Journal ref IEEE Transactions on Software Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07458 2026-04-21 cs.CL cs.AI cs.LG cs.SE 91%

REFLEX: Reference-Free Evaluation of Log Summarization via Large Language Model Judgment

REFLEX:基于大语言模型判断的无参考日志摘要评估

Priyanka Mudgal

机构 * Portland State University(波特兰州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 REFLEX通过大语言模型评估日志摘要质量,无需参考摘要或人工标注,提供稳定且细粒度的评估结果,优于传统指标。

Comments Accepted at IEEE-ICETISI 2025 Code is available at: https://github.com/prmudgal/Reflex

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05995 2026-04-08 cs.CL cs.AI cs.LG 91%

The Model Agreed, But Didn't Learn: Diagnosing Surface Compliance in Large Language Models

模型已达成一致,但未学习:诊断大语言模型中的表面合规性

Xiaojie Gu, Ziying Huang, Weicong Hong, Jian Xie, Renze Lou, Kai Zhang

机构 * Independent Researcher(独立研究员) Cornell Tech(康奈尔科技校区) The Ohio State University(俄亥俄州立大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究通过引入诊断框架,揭示大语言模型在记忆修改中存在表面合规现象,指出编辑方法可能仅模仿输出而非改变内部信念,导致认知不稳定和记忆不可逆。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18583 2026-02-24 cs.CL cs.AI cs.LG 91%

Luna-2: Scalable Single-Token Evaluation with Small Language Models

Luna-2:基于小语言模型的可扩展单令牌评估

Vatsal Goel, Rishon Dsouza, Nikhil Ega, Amey Ramesh Rambatla, Rob Friel, Shuai Shao, Yash Sheth

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);SLM(abstract)

AI总结 Luna-2利用小语言模型实现高效、准确的单令牌评估,大幅降低计算成本和延迟,提升内容安全与幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16926 2026-02-20 cs.CE 91%

BEMEval-Doc2Schema: Benchmarking Large Language Models for Structured Data Extraction in Building Energy Modeling

BEMEval-Doc2Schema:用于建筑能耗建模的结构化数据提取的大型语言模型基准测试

Yiyuan Jia, Xiaoqin Fu, Liang Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 BEMEval-Doc2Schema提出了一种用于评估大型语言模型在建筑能耗建模中结构化数据提取性能的基准测试框架,通过引入KVOR指标和跨模型比较,为未来研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11798 2026-02-20 cs.CL cs.AI cs.LG 91%

Persona-driven Simulation of Voting Behavior in the European Parliament with Large Language Models

基于人物特征的欧洲议会投票行为模拟研究:利用大语言模型

Maximilian Kreutner, Marlene Lutz, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibnitz Institute for the Social Sciences(莱比锡社会科学研究所) CSH Vienna(维也纳CSH)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究利用大语言模型和人物提示技术,模拟欧洲议会成员的投票行为,实现约 0.793 的加权 F1 分数。

Comments Accepted at EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00232 2026-02-17 cs.CL cs.AI cs.CY cs.LG 91%

BiasFreeBench: a Benchmark for Mitigating Bias in Large Language Model Responses

BiasFreeBench: 一个用于减轻大型语言模型响应偏见的基准测试

Xin Xu, Xunzhi He, Churan Zhi, Ruizhe Chen, Julian McAuley, Zexue He

机构 * UC San Diego(加州大学圣地亚哥分校) Columbia University(哥伦比亚大学) Zhejiang University(浙江大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 BiasFreeBench通过统一测试平台评估八种主流偏见缓解方法,提供响应层面的偏见自由分数,旨在提升大型语言模型的公平性和安全性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06193 2026-01-13 cs.LG cs.AI cs.CL 91%

MLB: A Scenario-Driven Benchmark for Evaluating Large Language Models in Clinical Applications

MLB:面向临床应用的大型语言模型评估场景驱动基准

Qing He, Dongsheng Bi, Jianrong Lu, Minghui Yang, Zixiao Chen, Jiacheng Lu, Jing Chen, Nannan Du, Xiao Cu, Sijing Wu, Peng Xiang, Yinyin Hu, Yi Guo, Chunpu Li, Shaoyang Li, Zhuo Dong, Ming Jiang, Shuai Guo, Liyun Feng, Jin Peng, Jian Wang, Jinjie Gu, Junwei Liu

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Health Information Center of Zhejiang Province(浙江省健康信息中心) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

AI总结 MLB基准通过场景驱动的评估方法,评估大型语言模型在临床应用中的表现,揭示模型在结构化任务与患者交互场景间的性能差异。

Comments 11 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02861 2025-12-03 cs.NI 91%

Network Self-Configuration based on Fine-Tuned Small Language Models

基于微调小语言模型的网络自配置

Oscar G. Lira, Oscar M. Caicedo, Nelson L. S. Da Fonseca

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出SLM_netconfig,一种基于微调小语言模型的网络自配置框架,通过参数高效适应技术实现高效、准确且隐私保护的本地化配置生成。

Comments 16 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09710 2025-10-22 cs.CL cs.AI cs.LG 91%

Generating Individual Travel Diaries Using Large Language Models Informed by Census and Land-Use Data

Sepehr Golrokh Amin, Devin Rhoads, Fatemeh Fakhrmoosavi, Nicholas E. Lownes, John N. Ivan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19195 2025-10-10 cs.CL cs.AI cs.LG 91%

Can Small-Scale Data Poisoning Exacerbate Dialect-Linked Biases in Large Language Models?

Chaymaa Abbas, Mariette Awad, Razane Tajeddine

机构 * Department of Electrical and Computer Engineering, Maroun Semaan Faculty of Engineering and Architecture(电气与计算机工程系,马鲁恩·塞马安工程与建筑学院) American University of Beirut(贝鲁特美国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04974 2025-09-25 cs.CV cs.AI cs.CL cs.LG 91%

Towards Visual Text Grounding of Multimodal Large Language Model

Ming Li, Ruiyi Zhang, Jian Chen, Chenguang Wang, Jiuxiang Gu, Yufan Zhou, Franck Dernoncourt, Wanrong Zhu, Tianyi Zhou, Tong Sun

机构 * Adobe Research(Adobe研究院) University of Maryland(马里兰大学) University at Buffalo(布法罗大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12774 2025-07-18 cs.LG cs.AI cs.CL 91%

A Comprehensive Survey of Electronic Health Record Modeling: From Deep Learning Approaches to Large Language Models

Weijieying Ren, Jingxi Zhu, Zehao Liu, Tianxiang Zhao, Vasant Honavar

机构 * Information Sciences and Technology, The Pennsylvania State University(信息科学与技术系,宾夕法尼亚州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10581 2025-06-19 q-bio.QM cs.AI cs.CL cs.LG eess.SP 91%

Large Language Model-informed ECG Dual Attention Network for Heart Failure Risk Prediction

Chen Chen, Lei Li, Marcel Beetz, Abhirup Banerjee, Ramneek Gupta, Vicente Grau

机构 * Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(生物医学工程研究所,工程科学系,牛津大学) Imperial College London(伦敦帝国学院) University of Sheffield(谢菲尔德大学) Novo Nordisk Research Centre Oxford (NNRCO)(牛津诺和硕研究中心(NNRCO)) Royal Society(皇家学会)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Under journal revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09315 2025-06-12 cs.CL cs.AI cs.LG 91%

Alzheimer's Dementia Detection Using Perplexity from Paired Large Language Models

Yao Xiao, Heidi Christensen, Stefan Goetze

机构 * School of Computer Science(计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments To be published in the proceedings of Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08313 2025-05-28 cs.LG cs.AI cs.CL cs.CV 91%

Can Large Language Models Understand Symbolic Graphics Programs?

Zeju Qiu, Weiyang Liu, Haiwen Feng, Zhen Liu, Tim Z. Xiao, Katherine M. Collins, Joshua B. Tenenbaum, Adrian Weller, Michael J. Black, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Cambridge(剑桥大学) MIT(麻省理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments ICLR 2025 Spotlight (v4: 47 pages, 26 figures, project page: https://sgp-bench.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05720 2025-04-24 cs.CL cs.AI cs.LG 91%

A dataset and benchmark for hospital course summarization with adapted large language models

Asad Aali, Dave Van Veen, Yamin Ishraq Arefeen, Jason Hom, Christian Bluethgen, Eduardo Pontes Reis, Sergios Gatidis, Namuun Clifford, Joseph Daws, Arash S. Tehrani, Jangwon Kim, Akshay S. Chaudhari

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Journal ref JAMIA, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01248 2025-04-03 cs.CL cs.AI cs.LG cs.SE 91%

Automated Factual Benchmarking for In-Car Conversational Systems using Large Language Models

Rafael Giebisch, Ken E. Friedl, Lev Sorokin, Andrea Stocco

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted in IEEE Intelligent Vehicles Symposium Conference (IV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10054 2024-10-10 cs.CL cs.AI cs.CY cs.HC cs.LG 91%

When "A Helpful Assistant" Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Models

Mingqian Zheng, Jiaxin Pei, Lajanugen Logeswaran, Moontae Lee, David Jurgens

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted by Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17012 2024-09-26 cs.CL cs.AI cs.LG 91%

Benchmarking Cognitive Biases in Large Language Models as Evaluators

Ryan Koo, Minhwa Lee, Vipul Raheja, Jong Inn Park, Zae Myung Kim, Dongyeop Kang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Publishsed at ACL 2024. 29 pages, 9 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16282 2024-06-18 cs.CL cs.AI cs.LG 91%

Confidence Under the Hood: An Investigation into the Confidence-Probability Alignment in Large Language Models

Abhishek Kumar, Robert Morabito, Sanzhar Umbet, Jad Kabbara, Ali Emami

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 9 pages (excluding references), accepted to ACL 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12516 2024-06-04 cs.CL cs.AI cs.LG 91%

ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks

Xiaodong Yu, Hao Cheng, Xiaodong Liu, Dan Roth, Jianfeng Gao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments NAACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04685 2024-05-09 cs.CL cs.AI cs.LG 91%

Bridging the Bosphorus: Advancing Turkish Large Language Models through Strategies for Low-Resource Language Adaptation and Benchmarking

Emre Can Acikgoz, Mete Erdogan, Deniz Yuret

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00566 2024-02-20 cs.LG cs.AI cs.CL cs.CY 91%

Empowering Many, Biasing a Few: Generalist Credit Scoring through Large Language Models

Duanyu Feng, Yongfu Dai, Jimin Huang, Yifang Zhang, Qianqian Xie, Weiguang Han, Zhengyu Chen, Alejandro Lopez-Lira, Hao Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16789 2023-10-04 cs.AI cs.CL cs.LG 91%

ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs

Yujia Qin, Shihao Liang, Yining Ye, Kunlun Zhu, Lan Yan, Yaxi Lu, Yankai Lin, Xin Cong, Xiangru Tang, Bill Qian, Sihan Zhao, Lauren Hong, Runchu Tian, Ruobing Xie, Jie Zhou, Mark Gerstein, Dahai Li, Zhiyuan Liu, Maosong Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏