arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2507.17787 2025-07-25 cs.LG cs.AI 86%

Hyperbolic Deep Learning for Foundation Models: A Survey

Neil He, Hiren Madhu, Ngoc Bui, Menglin Yang, Rex Ying

机构 * Yale University(耶鲁大学) Hong Kong University of Science(香港科学大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 11 Pages, SIGKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14459 2025-07-24 cs.CL cs.AI 86%

Multi-Level Explanations for Generative Language Models

Lucas Monteiro Paes, Dennis Wei, Hyo Jin Do, Hendrik Strobelt, Ronny Luss, Amit Dhurandhar, Manish Nagireddy, Karthikeyan Natesan Ramamurthy, Prasanna Sattigeri, Werner Geyer, Soumya Ghosh

机构 * Harvard University(哈佛大学) IBM Research(IBM研究院) Merck Research Labs(默克研究实验室)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Accepted as an oral presentation at ACL 2025. Code available at https://github.com/IBM/ICX360

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17015 2025-07-24 cs.CL cs.AI 86%

Can External Validation Tools Improve Annotation Quality for LLM-as-a-Judge?

Arduin Findeis, Floris Weers, Guoli Yin, Ke Ye, Ruoming Pang, Tom Gunter

机构 * University of Cambridge(剑桥大学) Apple(苹果公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13023 2025-07-22 cs.AI cs.LG 86%

A Practical Guide for Evaluating LLMs and LLM-Reliant Systems

Ethan M. Rudd, Christopher Andrews, Philip Tully

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16789 2025-07-22 cs.CL cs.AI 86%

A Survey of the Evolution of Language Model-Based Dialogue Systems: Data, Task and Models

Hongru Wang, Lingzhi Wang, Yiming Du, Liang Chen, Jingyan Zhou, Yufei Wang, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Noah Ark Lab(华为诺亚实验室) MoE Key Laboratory of High Confidence Software Technologies, The Chinese University of Hong Kong(高可信软件技术重点实验室,香港中文大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13369 2025-07-21 cs.AR cs.AI cs.LG 86%

VerilogDB: The Largest, Highest-Quality Dataset with a Preprocessing Framework for LLM-based RTL Generation

Paul E. Calzada, Zahin Ibnat, Tanvir Rahman, Kamal Kandula, Danyu Lu, Sujan Kumar Saha, Farimah Farahmandi, Mark Tehranipoor

机构 * University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13497 2025-07-17 cs.CL cs.AI 86%

Towards Geo-Culturally Grounded LLM Generations

Piyawat Lertvittayakumjorn, David Kinney, Vinodkumar Prabhakaran, Donald Martin, Sunipa Dev

机构 * Google(谷歌) Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23377 2025-07-15 cs.CL cs.AI 86%

Perspective Dial: Measuring Perspective of Text and Guiding LLM Outputs

Taejin Kim, Siun-Chuon Mau, Konrad Vesey

机构 * CACI International Inc.(CACI国际公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 7 pages, 5 main pages of text, 5 figures, 2 tables. Research work performed at CACI INTL INC

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15740 2025-07-10 cs.AI cs.CR cs.LG 86%

SHADE-Arena: Evaluating Sabotage and Monitoring in LLM Agents

Jonathan Kutasov, Yuqi Sun, Paul Colognese, Teun van der Weij, Linda Petrini, Chen Bo Calvin Zhang, John Hughes, Xiang Deng, Henry Sleight, Tyler Tracy, Buck Shlegeris, Joe Benton

机构 * Anthropic Reduct Video Scale AI Constellation Redwood Research

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04544 2025-07-10 cs.AR cs.AI cs.LG cs.PL 86%

hdl2v: A Code Translation Dataset for Enhanced LLM Verilog Generation

Charles Hong, Brendan Roberts, Huijae An, Alex Um, Advay Ratan, Yakun Sophia Shao

机构 * UC Berkeley(伯克利大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Published at ACM/IEEE International Symposium on Machine Learning for CAD (MLCAD) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00406 2025-07-09 cs.AI cs.CL 86%

Agents Are All You Need for LLM Unlearning

Debdeep Sanyal, Murari Mandal

机构 * RespAI Lab, School of Computer Engineering, KIIT Bhubaneswar(RespAI实验室,计算机工程学院,KIIT大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21585 2025-07-08 cs.CL cs.IR cs.LG 86%

Evaluation of LLM-based Strategies for the Extraction of Food Product Information from Online Shops

Christoph Brosch, Sian Brumm, Rolf Krieger, Jonas Scheffler

机构 * Institute for Software Systems, University of Applied Sciences Trier(软件系统研究所,应用科学大学特里尔)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Preprint for paper presented at DATA 2025 in Bilbao, Spain. Corrected -2.27 to -1.61 in abstract and +2.27 to +1.61 in discussion. Reference to journal and publication will follow

Journal ref In Proceedings of the 14th International Conference on Data Science, Technology and Applications, 2025, ISBN 978-989-758-758-0, ISSN 2184-285X, pages 709-715

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01631 2025-07-04 cs.LG cs.AI cs.SE 86%

Gradient-Based Model Fingerprinting for LLM Similarity Detection and Family Classification

Zehao Wu, Yanjie Zhao, Haoyu Wang

机构 * Huazhong University of Science(华中科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15380 2025-07-02 cs.CL cs.AI 86%

Kalahi: A handcrafted, grassroots cultural LLM evaluation suite for Filipino

Jann Railey Montalan, Jian Gang Ngui, Wei Qi Leong, Yosephine Susanto, Hamsawardhini Rengarajan, Alham Fikri Aji, William Chandra Tjhi

机构 * AI Singapore(AI新加坡) National University of Singapore(国立新加坡大学) MBZUAI Monash Indonesia(墨尔本印尼分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted for presentation at Paclic 38, 2024

Journal ref https://aclanthology.org/2024.paclic-1.49/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07186 2025-07-01 cs.SD cs.AI cs.LG eess.AS 86%

NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics

David Robinson, Marius Miron, Masato Hagiwara, Benno Weck, Sara Keen, Milad Alizadeh, Gagan Narula, Matthieu Geist, Olivier Pietquin

机构 * Earth Species Project(地球物种项目)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Demo page: https://earthspecies.github.io/naturelm-audio-demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00753 2025-06-27 cs.CL cs.LG 86%

LLM-Based Human-Agent Collaboration and Interaction Systems: A Survey

Henry Peng Zou, Wei-Chieh Huang, Yaozu Wu, Yankai Chen, Chunyu Miao, Hoang Nguyen, Yue Zhou, Weizhi Zhang, Liancheng Fang, Langzhou He, Yangning Li, Dongyuan Li, Renhe Jiang, Xue Liu, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Tokyo(东京大学) Tsinghua University(清华大学) MBZUAI McGill University(麦吉尔大学) University of California Irvine(加州大学 Irvine 分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Paper lists and resources are available at https://github.com/HenryPengZou/Awesome-Human-Agent-Collaboration-Interaction-Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20451 2025-06-26 cs.LG cs.AI 86%

Automatic Demonstration Selection for LLM-based Tabular Data Classification

Shuchu Han, Wolfgang Bruckner

机构 * Capital One

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17700 2025-06-24 cs.CL cs.AI 86%

The Evolution of Natural Language Processing: How Prompt Optimization and Language Models are Shaping the Future

Summra Saleem, Muhammad Nabeel Asim, Shaista Zulfiqar, Andreas Dengel

机构 * RPTU Rheinland-Pfälzische Technische Universität Kaiserslautern-Landau(莱茵-普法尔茨理工大学) German Research Centre for Artificial Intelligence(德国人工智能研究中心)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16399 2025-06-23 cs.CL cs.AI 86%

NepaliGPT: A Generative Language Model for the Nepali Language

Shushanta Pudasaini, Aman Shakya, Siddhartha Shrestha, Sahil Bhatta, Sunil Thapa, Sushmita Palikhe

机构 * Technological University Dublin(都柏林技术大学) Institute of Engineering(工程学院) Kathmandu Engineering College(加德满都工程学院) Fanshawe College(Fanshawe学院) Lambton College(Lambton学院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15699 2025-06-23 cs.LG cs.AI 86%

BLUR: A Benchmark for LLM Unlearning Robust to Forget-Retain Overlap

Shengyuan Hu, Neil Kale, Pratiksha Thaker, Yiwei Fu, Steven Wu, Virginia Smith

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15513 2025-06-19 cs.LG cs.AI 86%

RePCS: Diagnosing Data Memorization in LLM-Powered Retrieval-Augmented Generation

Le Vu Anh, Nguyen Viet Anh, Mehmet Dik, Luong Van Nghia

机构 * 1 Institute of Information Technology, Vietnam Academy of Science 2 Institute of Information Technology, Vietnam Academy of Science 3 Department of Mathematics, Computer Science \& Physics, Rockford University, Illinois, United States Email 4 Department of Information Technology, Dong A University, Da Nang, Vietnam Email

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 11 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14997 2025-06-19 cs.CY cs.CL cs.LG 86%

Hypothesis Testing for Quantifying LLM-Human Misalignment in Multiple Choice Settings

Harbin Hong, Sebastian Caldas, Liu Leqi

机构 * Princeton University(普林斯顿大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01903 2025-06-19 cs.CL cs.AI cs.HC 86%

PsychBench: A comprehensive and professional benchmark for evaluating the performance of LLM-assisted psychiatric clinical practice

Shuyu Liu, Ruoxi Wang, Ling Zhang, Xuequan Zhu, Rui Yang, Xinzhu Zhou, Fei Wu, Zhi Yang, Cheng Jin, Gang Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12376 2025-06-18 cs.AI cs.CL 86%

ConsistencyChecker: Tree-based Evaluation of LLM Generalization Capabilities

Zhaochen Hong, Haofei Yu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11250 2025-06-16 cs.LG cs.AI cs.SY eess.SY 86%

Can Time-Series Foundation Models Perform Building Energy Management Tasks?

Ozan Baris Mulayim, Pengrui Quan, Liying Han, Xiaomin Ouyang, Dezhi Hong, Mario Bergés, Mani Srivastava

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加州大学洛杉矶分校) Hong Kong University of Science and Technology(香港科学与技术大学) Amazon(亚马逊公司)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 30 pages, 5 tables, 8 figures. Under review for Data-Centric Engineering journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11102 2025-06-16 cs.CL cs.AI 86%

Evolutionary Perspectives on the Evaluation of LLM-Based AI Agents: A Comprehensive Survey

Jiachen Zhu, Menghui Zhu, Renting Rui, Rong Shan, Congmin Zheng, Bo Chen, Yunjia Xi, Jianghao Lin, Weiwen Liu, Ruiming Tang, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11057 2025-06-16 cs.LG cs.AI 86%

STRCMP: Integrating Graph Structural Priors with Language Models for Combinatorial Optimization

Xijun Li, Jiexiang Yang, Jinghao Wang, Bo Peng, Jianguo Yao, Haibing Guan

机构 * Shanghai Key Laboratory of Scalable Computing and Systems(上海可扩展计算与系统重点实验室) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10764 2025-06-13 cs.AI cs.LG 86%

OPT-BENCH: Evaluating LLM Agent on Large-Scale Search Spaces Optimization Problems

Xiaozhe Li, Jixuan Chen, Xinyu Fang, Shengyuan Ding, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Nanjing University(南京大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10403 2025-06-13 cs.LG cs.AI 86%

Time To Impeach LLM-as-a-Judge: Programs are the Future of Evaluation

Tzu-Heng Huang, Harit Vishwakarma, Frederic Sala

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14156 2025-06-12 cs.CV cs.AI cs.IR cs.LG 86%

Unify Graph Learning with Text: Unleashing LLM Potentials for Session Search

Songhao Wu, Quan Tu, Hong Liu, Jia Xu, Zhongyi Liu, Guannan Zhang, Ran Wang, Xiuying Chen, Rui Yan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏