arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2505.08265 2025-06-12 cs.LG cs.AI 86%

LLM Enhancers for GNNs: An Analysis from the Perspective of Causal Mechanism Identification

Hang Gao, Wenxuan Huang, Fengge Wu, Junsuo Zhao, Changwen Zheng, Huaping Liu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National Key Laboratory of Space Integrated Information System(空间信息集成系统国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08231 2025-06-11 cs.LG cs.AI cs.PF 86%

Ensuring Reliability of Curated EHR-Derived Data: The Validation of Accuracy for LLM/ML-Extracted Information and Data (VALID) Framework

Melissa Estevez, Nisha Singh, Lauren Dyson, Blythe Adamson, Qianyu Yuan, Megan W. Hildner, Erin Fidyk, Olive Mbah, Farhad Khan, Kathi Seidl-Rathkopf, Aaron B. Cohen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07795 2025-06-10 cs.CL cs.CR cs.LG 86%

LLM Unlearning Should Be Form-Independent

Xiaotian Ye, Mengqi Zhang, Shu Wu

机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学学院) Shandong University(山东大学) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06069 2025-06-09 cs.CL cs.LG 86%

Zero-Shot Detection of LLM-Generated Code via Approximated Task Conditioning

Maor Ashkenazi, Ofir Brenner, Tal Furman Shohet, Eran Treister

机构 * Department of Computer Science, Ben-Gurion University of the Negev(本·古里安大学纳粹夫学院计算机科学系) Data Science Research Center, Ben-Gurion University of the Negev(本·古里安大学纳粹夫数据科学研究中心) Tel-Aviv University(特拉维夫大学) Deep Instinct

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments To appear in the Proceedings of ECML-PKDD 2025, Springer Lecture Notes in Computer Science (LNCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05451 2025-06-09 cs.SE cs.AI cs.CL 86%

Interpretation Meets Safety: A Survey on Interpretation Methods and Tools for Improving LLM Safety

Seongmin Lee, Aeree Cho, Grace C. Kim, ShengYun Peng, Mansi Phute, Duen Horng Chau

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 31 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13865 2025-06-05 cs.HC cs.AI cs.CL cs.CV 86%

A Survey on (M)LLM-Based GUI Agents

Fei Tang, Haolei Xu, Hang Zhang, Siqi Chen, Xingyu Wu, Yongliang Shen, Wenqi Zhang, Guiyang Hou, Zeqi Tan, Yuchen Yan, Kaitao Song, Jian Shao, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02589 2025-06-04 cs.CL cs.AI cs.IR 86%

Evaluating Named Entity Recognition Models for Russian Cultural News Texts: From BERT to LLM

Maria Levchenko

机构 * University of Bologna(博洛尼亚大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01992 2025-06-04 cs.CL cs.AI cs.IR 86%

No Free Lunch in Active Learning: LLM Embedding Quality Dictates Query Strategy Success

Lukas Rauch, Moritz Wirth, Denis Huseljic, Marek Herde, Bernhard Sick, Matthias Aßenmacher

机构 * University of Kassel(卡塞尔大学) LMU Munich(慕尼黑大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments under review @NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10927 2025-06-04 cs.CL cs.AI 86%

OASST-ETC Dataset: Alignment Signals from Eye-tracking Analysis of LLM Responses

Angela Lopez-Cardona, Sebastian Idesis, Miguel Barreda-Ángeles, Sergi Abadal, Ioannis Arapakis

机构 * Telefónica Scientific Research(Telefónica科学研究中心) Universitat Politècnica de Catalunya(巴塞罗那理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments This paper has been accepted to ACM ETRA 2025 and published on PACMHCI

Journal ref Proceedings of the ACM on Human-Computer Interaction. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00723 2025-06-03 cs.LG cs.AI cs.IR 86%

Pitfalls in Evaluating Language Model Forecasters

Daniel Paleka, Shashwat Goel, Jonas Geiping, Florian Tramèr

机构 * ETH Zurich(苏黎世联邦理工学院) ELLIS Institute Tübingen(图宾根ELLIS研究所) MPI Tübingen(图宾根马克斯·普朗克研究所)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13098 2025-06-03 cs.AI cs.CL cs.DB 86%

LLM-KG-Bench 3.0: A Compass for SemanticTechnology Capabilities in the Ocean of LLMs

Lars-Peter Meyer, Johannes Frey, Desiree Heim, Felix Brei, Claus Stadler, Kurt Junghanns, Michael Martin

机构 * InfAI Chemnitz University of Technology(化学工业大学) Leipzig University(莱比锡大学) DFKI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Peer reviewed publication at ESWC 2025 Resources Track

Journal ref Lecture Notes in Computer Science, Vol 15719(2025), ESWC25 Proceedings Part II, pp 280-296

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22877 2025-06-03 cs.CL cs.AI cs.IR 86%

Understanding Inequality of LLM Fact-Checking over Geographic Regions with Agent and Retrieval models

Bruno Coelho, Shujaat Mirza, Yuyuan Cui, Christina Pöpper, Damon McCoy

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18792 2025-06-03 cs.HC cs.AI cs.CL cs.CY 86%

REALM: A Dataset of Real-World LLM Use Cases

Jingwen Cheng, Kshitish Ghate, Wenyue Hua, William Yang Wang, Hong Shen, Fei Fang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California(加州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14301 2025-06-03 cs.CL cs.AI 86%

SEA-HELM: Southeast Asian Holistic Evaluation of Language Models

Yosephine Susanto, Adithya Venkatadri Hulagadri, Jann Railey Montalan, Jian Gang Ngui, Xian Bin Yong, Weiqi Leong, Hamsawardhini Rengarajan, Peerat Limkonchotiwat, Yifan Mai, William Chandra Tjhi

机构 * AI Singapore(AI新加坡) National University of Singapore(国立新加坡大学) Center for Research on Foundation Models (CRFM)(基础模型研究中心) Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11767 2025-06-03 cs.LG cs.CL 86%

From Selection to Generation: A Survey of LLM-based Active Learning

Yu Xia, Subhojyoti Mukherjee, Zhouhang Xie, Junda Wu, Xintong Li, Ryan Aponte, Hanjia Lyu, Joe Barrow, Hongjie Chen, Franck Dernoncourt, Branislav Kveton, Tong Yu, Ruiyi Zhang, Jiuxiang Gu, Nesreen K. Ahmed, Yu Wang, Xiang Chen, Hanieh Deilamsalehy, Sungchul Kim, Zhengmian Hu, Yue Zhao, Nedim Lipka, Seunghyun Yoon, Ting-Hao Kenneth Huang, Zichao Wang, Puneet Mathur, Soumyabrata Pal, Koyel Mukherjee, Zhehao Zhang, Namyong Park, Thien Huu Nguyen, Jiebo Luo, Ryan A. Rossi, Julian McAuley

机构 * University of California San Diego(加州大学圣地亚哥分校) University of Wisconsin Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) University of Rochester(罗切斯特大学) Adobe Research(Adobe研究) Dolby Labs(杜比实验室) Cisco AI Research(思科人工智能研究) University of Oregon(俄勒冈大学) University of Southern California(南加州大学) Pennsylvania State University(宾夕法尼亚州立大学) Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10424 2025-06-03 cs.CL cs.AI 86%

LLM-as-an-Interviewer: Beyond Static Testing Through Dynamic LLM Evaluation

Eunsu Kim, Juyoung Suk, Seungone Kim, Niklas Muennighoff, Dongkwan Kim, Alice Oh

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03219 2025-06-03 cs.CY cs.AI cs.ET cs.HC cs.LG 86%

Content Moderation by LLM: From Accuracy to Legitimacy

Tao Huang

机构 * City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24553 2025-06-02 cs.CL cs.AI 86%

CREFT: Sequential Multi-Agent LLM for Character Relation Extraction

Ye Eun Chun, Taeyoon Hwang, Seung-won Hwang, Byung-Hak Kim

机构 * CJ Corporation(CJ公司) Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24324 2025-06-02 cs.LG cs.CL cs.PL cs.SE 86%

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation

Ivan Petrukha, Yana Kurliak, Nataliia Stulova

机构 * MacPaw

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted to FORGE'25 Benchmarking on 15.01.2025, to be published by IEEE under the CC BY-NC-ND 4.0 license. This is the accepted version of the article (5 pages, 2 figures, 1 table). DOI will be added upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18407 2025-06-02 stat.ML cs.AI cs.LG 86%

A Statistical Framework for Ranking LLM-Based Chatbots

Siavash Ameli, Siyuan Zhuang, Ion Stoica, Michael W. Mahoney

机构 * ICSI and Department of Statistics, University of California, Berkeley(ICSI和统计学系,加州大学伯克利分校) Department of Computer Science, University of California, Berkeley(计算机科学系,加州大学伯克利分校) ICSI, LBNL, and Department of Statistics, University of California, Berkeley(ICSI、劳伦斯伯克利国家实验室和统计学系,加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Journal ref The Thirteenth International Conference on Learning Representations (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23058 2025-05-30 cs.AI cs.CE cs.CL 86%

Be.FM: Open Foundation Models for Human Behavior

Yutong Xie, Zhuoheng Li, Xiyuan Wang, Yijun Pan, Qijia Liu, Xingzhi Cui, Kuang-Yu Lo, Ruoyi Gao, Xingjian Zhang, Jin Huang, Walter Yuan, Matthew O. Jackson, Qiaozhu Mei

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14279 2025-05-30 cs.CL cs.AI 86%

YESciEval: Robust LLM-as-a-Judge for Scientific Question Answering

Jennifer D'Souza, Hamed Babaei Giglou, Quentin Münch

机构 * TIB Leibniz Information Centre for Science and Technology(蒂宾根科学与技术信息中心) Leibniz Universität Hannover(汉诺威莱布尼茨大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 4 figures, Accepted as a Long Paper at the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01747 2025-05-29 cs.AI cs.LG stat.ML 86%

Position: Don't Use the CLT in LLM Evals With Fewer Than a Few Hundred Datapoints

Sam Bowyer, Laurence Aitchison, Desi R. Ivanova

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 42 pages, 39 figures. ICML 2025 Spotlight Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21362 2025-05-28 cs.CL cs.AI cs.HC 86%

Evaluating LLM Adaptation to Sociodemographic Factors: User Profile vs. Dialogue History

Qishuai Zhong, Zongmin Li, Siqi Fan, Aixin Sun

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) University of Electronic Science and Technology of China, Chengdu, China(电子科技大学,中国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21191 2025-05-28 cs.CL cs.LG 86%

Unveiling Instruction-Specific Neurons & Experts: An Analytical Framework for LLM's Instruction-Following Capabilities

Junyan Zhang, Yubo Gao, Yibo Yan, Jungang Li, Zhaorui Hou, Sicheng Tao, Shuliang Liu, Song Dai, Yonghua Hei, Junzhuo Li, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11211 2025-05-27 cs.CL cs.AI cs.CV 86%

A Survey of LLM-based Agents in Medicine: How far are we from Baymax?

Wenxuan Wang, Zizhan Ma, Zheng Wang, Chenghan Wu, Jiaming Ji, Wenting Chen, Xiang Li, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) City University of Hong Kong(香港城市大学) Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15253 2025-05-23 cs.CL cs.LG 86%

Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators

Yilun Zhou, Austin Xu, Peifeng Wang, Caiming Xiong, Shafiq Joty

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments ICML 2025. The first two authors contributed equally. The codebase is at https://github.com/SalesforceAIResearch/jetts-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14818 2025-05-22 cs.CL cs.AI 86%

WebNovelBench: Placing LLM Novelists on the Web Novel Distribution

Leon Lin, Jun Zheng, Haidong Wang

机构 * Nanyang Technological University(南洋理工大学) Sun Yat-Sen University(中山大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07482 2025-05-21 cs.CL cs.AI 86%

TiEBe: Tracking Language Model Recall of Notable Worldwide Events Through Time

Thales Sales Almeida, Giovana Kerche Bonás, João Guilherme Alves Santos, Hugo Abonizio, Rodrigo Nogueira

机构 * Institute of Computing (IC) State University of Campinas(计算研究所(IC)坎皮纳斯州立大学) Maritaca AI(马里塔卡人工智能) State University of Campinas(坎皮纳斯州立大学) Campinas, SP, Brazil(巴西坎皮纳斯州)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13554 2025-05-21 cs.CL cs.AI 86%

Combining the Best of Both Worlds: A Method for Hybrid NMT and LLM Translation

Zhanglin Wu, Daimeng Wei, Xiaoyu Chen, Hengchao Shang, Jiaxin Guo, Zongyao Li, Yuanchang Luo, Jinlong Yang, Zhiqiang Rao, Hao Yang

机构 * Huawei Translation Service Center(华为翻译服务中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 9 pages, 2 figures, 9 tables, ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏