arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2508.05294 2025-11-14 cs.RO cs.AI cs.LG 86%

Towards Embodied Agentic AI: Review and Classification of LLM- and VLM-Driven Robot Autonomy and Interaction

Sahar Salimpour, Lei Fu, Kajetan Rachwał, Pascal Bertrand, Kevin O'Sullivan, Robert Jakob, Farhad Keramat, Leonardo Militano, Giovanni Toffetti, Harry Edelman, Jorge Peña Queralta

机构 * Department of Computing, University of Turku(图尔库大学计算机系) Institute of Computer Science, Zurich University of Applied Sciences(应用科学大学计算机科学研究所) Centre for Artificial Ingelligence, Zurich University of Applied Sciences(应用科学大学人工智能中心) Agentic Systems Lab, Department of Management, Technology and Economics, ETH Zürich(苏黎世联邦理工学院管理、科技与经济系代理系统实验室) Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙技术大学数学与信息科学学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09776 2025-11-12 cs.CL cs.AI 86%

Can LLM-Generated Textual Explanations Enhance Model Classification Performance? An Empirical Study

Mahdi Dhaini, Juraj Vladika, Ege Erdogan, Zineb Attaoui, Gjergji Kasneci

机构 * Technical University of Munich, School of Computation, Information and Technology, Department of Computer Science, Munich, Germany(慕尼黑技术大学,计算、信息与技术学院,计算机科学系,德国慕尼黑)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to the 34th International Conference on Artificial Neural Networks (ICANN 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13624 2025-11-11 cs.CL cs.LG 86%

Latent Traits and Cross-Task Transfer: Deconstructing Dataset Interactions in LLM Fine-tuning

Shambhavi Krishna, Atharva Naik, Chaitali Agarwal, Sudharshan Govindan, Taesung Lee, Haw-Shiuan Chang

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Anthropic

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Proceedings of the 14th Joint Conference on Lexical and Computational Semantics (*SEM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01599 2025-11-11 cs.CL cs.CR cs.CV cs.LG 86%

JailbreakZoo: Survey, Landscapes, and Horizons in Jailbreaking Large Language and Vision-Language Models

Haibo Jin, Leyang Hu, Xinnuo Li, Peiyan Zhang, Chonghan Chen, Jun Zhuang, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Brown University(布朗大学) University of Michigan Ann Arbor(密歇根大学安娜堡分校) Hong Kong University of Science and Technology(香港科学与技术大学) Carnegie Mellon University(卡内基梅隆大学) Boise State University(博伊西州立大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25441 2025-11-10 cs.CL cs.AI 86%

Grounded in Reality: Learning and Deploying Proactive LLM from Offline Logs

Fei Wei, Daoyuan Chen, Ce Wang, Yilun Huang, Yushuo Chen, Xuchen Pan, Yaliang Li, Bolin Ding

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 27 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04847 2025-11-07 cs.CL cs.AI 86%

Benchmarking LLM Faithfulness in RAG with Evolving Leaderboards

Manveer Singh Tamber, Forrest Sheng Bao, Chenyu Xu, Ge Luo, Suleman Kazi, Minseok Bae, Miaoran Li, Ofer Mendelevitch, Renyi Qu, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学) Vectara(Vectara公司) Iowa State University(爱荷华州立大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP Industry Track 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24450 2025-11-05 cs.CL cs.AI 86%

Charting the European LLM Benchmarking Landscape: A New Taxonomy and a Set of Best Practices

Špela Vintar, Taja Kuzman Pungeršek, Mojca Brglez, Nikola Ljubešić

机构 * Jožef Stefan Institute(乔塞夫·斯塔芬研究所) University of Ljubljana(卢布尔雅那大学) Faculty of Arts, University of Ljubljana(艺术学院,卢布尔雅那大学) Faculty of Computer and Information Science, University of Ljubljana(计算机与信息科学学院,卢布尔雅那大学) Institute of Contemporary History(现代史研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 17 pages, 1 figure, 4 tables. Submitted to the LREC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23040 2025-10-28 cs.LG cond-mat.mtrl-sci cs.AI 86%

LLM Meets Diffusion: A Hybrid Framework for Crystal Material Generation

Subhojyoti Khastagir, Kishalay Das, Pawan Goyal, Seung-Cheol Lee, Satadeep Bhattacharjee, Niloy Ganguly

机构 * Indian Institute of Technology, Kharagpur, India(印度理工学院,克哈格普尔分校) Indo Korea Science and Technology Center, Bangalore, India(印韩科学技术中心,班加罗尔)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14668 2025-10-28 cs.AI cs.CL cs.HC 86%

ContextAgent: Context-Aware Proactive LLM Agents with Open-World Sensory Perceptions

Bufang Yang, Lilin Xu, Liekang Zeng, Kaiwei Liu, Siyang Jiang, Wenrui Lu, Hongkai Chen, Xiaofan Jiang, Guoliang Xing, Zhenyu Yan

机构 * The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20782 2025-10-24 cs.CL cs.AI 86%

A Use-Case Specific Dataset for Measuring Dimensions of Responsible Performance in LLM-generated Text

Alicia Sagae, Chia-Jung Lee, Sandeep Avula, Brandon Dang, Vanessa Murdock

机构 * AWS Responsible AI(AWS负责任人工智能)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 24 pages with 3 figures, to appear in Proceedings of the 34th ACM International Conference on Information and Knowledge Management (CIKM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02945 2025-10-24 cs.CL cs.LG 86%

Quantitative LLM Judges

Aishwarya Sahoo, Jeevana Kruthi Karnuthala, Tushar Parmanand Budhwani, Pranchal Agarwal, Sankaran Vaidyanathan, Alexa Siu, Franck Dernoncourt, Jennifer Healey, Nedim Lipka, Ryan Rossi, Uttaran Bhattacharya, Branislav Kveton

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18931 2025-10-23 cs.CY cs.AI cs.LG 86%

A Justice Lens on Fairness and Ethics Courses in Computing Education: LLM-Assisted Multi-Perspective and Thematic Evaluation

Kenya S. Andrews, Deborah Dormah Kanubala, Kehinde Aruleba, Francisco Enrique Vicente Castro, Renata A Revelo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 14 pages, 8 figures, In Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18162 2025-10-22 cs.CL cs.AI 86%

Automatic Prompt Generation via Adaptive Selection of Prompting Techniques

Yohei Ikenoue, Hitomi Tashiro, Shigeru Kuroyanagi

机构 * Spike Studio Inc.(Spike Studio公司)

专题命中 评测与基准 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 35 pages, 29 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13499 2025-10-21 cs.CL cs.AI 86%

ConsintBench: Evaluating Language Models on Real-World Consumer Intent Understanding

Xiaozhe Li, TianYi Lyu, Siyi Yang, Yuxi Gong, Yizhao Yang, Jinxuan Huang, Ligao Zhang, Zhuoyi Huang, Qingwen Liu

机构 * Tongji University(同济大学) Stanford University(斯坦福大学) Currents AI

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13202 2025-10-16 cs.CL cs.AI 86%

LLM-Guided Synthetic Augmentation (LGSA) for Mitigating Bias in AI Systems

Sai Suhruth Reddy Karri, Yashwanth Sai Nallapuneni, Laxmi Narasimha Reddy Mallireddy, Gopichand G

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 4 figures, 1 Table, submitted to an international conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12925 2025-10-16 cs.CL cs.LG 86%

Who's Asking? Evaluating LLM Robustness to Inquiry Personas in Factual Question Answering

Nil-Jana Akpinar, Chia-Jung Lee, Vanessa Murdock, Pietro Perona

机构 * Microsoft(微软) Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16843 2025-10-16 cs.LG cs.AI cs.GT 86%

Do LLM Agents Have Regret? A Case Study in Online Learning and Games

Chanwoo Park, Xiangyu Liu, Asuman Ozdaglar, Kaiqing Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Maryland, College Park(马里兰大学College Park分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Camera ready version of ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11905 2025-10-15 cs.CL cs.LG 86%

LLM Knowledge is Brittle: Truthfulness Representations Rely on Superficial Resemblance

Patrick Haller, Mark Ibrahim, Polina Kirichenko, Levent Sagun, Samuel J. Bell

机构 * FAIR at Meta(Meta 的 FAIR 研究所) University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05423 2025-10-14 cs.CL cs.AI 86%

LiTransProQA: an LLM-based Literary Translation evaluation metric with Professional Question Answering

Ran Zhang, Wei Zhao, Lieve Macken, Steffen Eger

机构 * Natural Language Learning Group (NLLG) School of Business Informatics and Mathematics University of Mannheim(曼海姆大学商业信息学与数学学院自然语言学习组) University of Aberdeen, Department of Computing Science(阿伯丁大学计算机科学系) University of Gent, Department of Translation, Interpreting and Communication(根特大学翻译、口译与传播系) University of Technology Nuremberg (UTN), Department Engineering(纽伦堡技术大学工程系) Natural Language Learning and Generation (NLLG) Lab(自然语言学习与生成(NLLG)实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted as a main paper at EMNLP 2025. CR version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09738 2025-10-14 cs.CL cs.AI 86%

Judge's Verdict: A Comprehensive Analysis of LLM Judge Capability Through Human Agreement

Steve Han, Gilberto Titericz Junior, Tom Balough, Wenfei Zhou

机构 * NVIDIA Corporation(NVIDIA公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 1 figure, 4 tables, under review as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09732 2025-10-14 cs.LG cs.AI 86%

Evaluating LLM-Based Process Explanations under Progressive Behavioral-Input Reduction

P. van Oerle, R. H. Bemthuis, F. A. Bukhsh

机构 * University of Twente(特文特大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 2 figures, 3 tables; to appear in Enterprise Design, Operations, and Computing. EDOC 2025 Workshops, Lecture Notes in Business Information Processing (LNBIP), Springer, 2025. Part of 29th International Conference on Enterprise Design, Operations, and Computing (EDOC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20854 2025-10-13 cs.SE cs.AI cs.CL 86%

An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks

Xin Zhou, Kisub Kim, Ting Zhang, Martin Weyssow, Luis F. Gomes, Guang Yang, Kui Liu, Xin Xia, David Lo

机构 * Singapore Management University(新加坡国立管理学院) DGIST(韩国高等智能科学研究院) Monash University(墨尔本大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Huawei Software Engineering Application Technology Lab(华为软件工程应用技术实验室) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07912 2025-10-10 cs.CL cs.AI 86%

Towards Human-Like Grading: A Unified LLM-Enhanced Framework for Subjective Question Evaluation

Fanwei Zhua, Jiaxuan He, Xiaoxiao Chen, Zulong Chen, Quan Lu, Chenrui Mei

机构 * Hangzhou City University(杭州市大学) Alibaba Group(阿里巴巴集团) Zhejiang Hospital(浙江省医院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07626 2025-10-10 cs.LG cs.CL 86%

LLM Unlearning Under the Microscope: A Full-Stack View on Methods and Metrics

Chongyu Fan, Changsheng Wang, Yancheng Huang, Soumyadeep Pal, Sijia Liu

机构 * Michigan State University(密歇根州立大学) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07557 2025-10-10 cs.LG cs.AI cs.CY cs.HC 86%

Investigating Thematic Patterns and User Preferences in LLM Interactions using BERTopic

Abhay Bhandarkar, Gaurav Mishra, Khushi Juchani, Harsh Singhal

机构 * Ramaiah Institute of Technology(拉马亚院技术学院) Ecofy Finance Private Limited(Ecofy金融私人有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17694 2025-10-10 cs.CL cs.AI 86%

Evaluating LLM-Generated Versus Human-Authored Responses in Role-Play Dialogues

Dongxu Lu, Johan Jeuring, Albert Gatt

机构 * Utrecht University(乌得勒支大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication at the 18th International Natural Language Generation Conference (INLG 2025). Revised version: improved image quality and minor corrections. No change to conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05220 2025-10-10 cs.IR cs.AI cs.CL 86%

Utility-Focused LLM Annotation for Retrieval and Retrieval-Augmented Generation

Hengran Zhang, Minghao Tang, Keping Bi, Jiafeng Guo, Shihao Liu, Daiting Shi, Dawei Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by the EMNLP25 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05957 2025-10-10 cs.AI cs.CL 86%

AutoAgent: A Fully-Automated and Zero-Code Framework for LLM Agents

Jiabin Tang, Tianyu Fan, Chao Huang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Code: https://github.com/HKUDS/AutoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07243 2025-10-09 cs.CL cs.AI 86%

LeMAJ (Legal LLM-as-a-Judge): Bridging Legal Reasoning and LLM Evaluation

Joseph Enguehard, Morgane Van Ermengem, Kate Atkinson, Sujeong Cha, Arijit Ghosh Chowdhury, Prashanth Kallur Ramaswamy, Jeremy Roghair, Hannah R Marlowe, Carina Suzana Negreanu, Kitty Boxall, Diana Mincu

机构 * Robin AI Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Published in Natural Legal Language Processing - EMNLP Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07173 2025-10-09 cs.CL cs.LG 86%

NurseLLM: The First Specialized Language Model for Nursing

Md Tawkat Islam Khondaker, Julia Harrington, Shady Shehata

机构 * Yourika Labs(Yourika实验室) The University of British Columbia(不列颠哥伦比亚大学) Western University(西方大学) University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏