arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2508.12472 2025-08-19 cs.AI 86%

GALA: Can Graph-Augmented Large Language Model Agentic Workflows Elevate Root Cause Analysis?

Yifang Tian, Yaming Liu, Zichun Chong, Zihang Huang, Hans-Arno Jacobsen

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08262 2025-08-13 cs.CL 86%

Argument Quality Annotation and Gender Bias Detection in Financial Communication through Large Language Models

Alaa Alhamzeh, Mays Al Rebdawi

机构 * First Author Affiliation(第一作者机构) Second Author Affiliation(第二作者机构)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments 8 pages, 4 figures, Passau uni, Master thesis in NLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10342 2025-08-05 cs.CV cs.AI 86%

UrbanSense:A Framework for Quantitative Analysis of Urban Streetscapes leveraging Vision Large Language Models

Jun Yin, Jing Zhong, Peilin Li, Ruolin Pan, Pengyu Zeng, Miao Zhang, Shuai Lu

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07739 2025-08-05 cs.CV cs.AI 86%

ArchiLense: A Framework for Quantitative Analysis of Architectural Styles Based on Vision Large Language Models

Jing Zhong, Jun Yin, Peilin Li, Pengyu Zeng, Miao Zang, Ran Luo, Shuai Lu

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00422 2025-08-04 cs.PL cs.LG 86%

Automated Type Annotation in Python Using Large Language Models

Varun Bharti, Shashwat Jha, Dhruv Kumar, Pankaj Jalote

机构 * IIIT Delhi(印度德里理工学院) BITS Pilani(比尔兹-帕利尼理工学院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16873 2025-07-24 cs.CV cs.AI 86%

HIPPO-Video: Simulating Watch Histories with Large Language Models for Personalized Video Highlighting

Jeongeun Lee, Youngjae Yu, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

Comments Accepted to COLM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08958 2025-07-21 astro-ph.IM astro-ph.CO cs.AI cs.MA 86%

Bridging Literature and the Universe Via A Multi-Agent Large Language Model System

Xiaowen Zhang, Zhenyu Bi, Patrick Lachance, Xuan Wang, Tiziana Di Matteo, Rupert A. C. Croft

机构 * Department of Physics, Carnegie Mellon University(卡内基梅隆大学物理系) Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11853 2025-07-04 cs.LG 86%

StructTransform: A Scalable Attack Surface for Safety-Aligned Large Language Models

Shehel Yoosuf, Temoor Ali, Ahmed Lekssays, Mashael AlSabah, Issa Khalil

机构 * Qatar Computing Research Institute(卡塔尔计算研究所)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18105 2025-06-24 cs.CL 86%

Chengyu-Bench: Benchmarking Large Language Models for Chinese Idiom Understanding and Use

Yicheng Fu, Zhemin Huang, Liuxin Yang, Yumeng Lu, Zhongdongming Dai

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14074 2025-06-18 cs.LG cs.AR 86%

Comprehensive Verilog Design Problems: A Next-Generation Benchmark Dataset for Evaluating Large Language Models and Agents on RTL Design and Verification

Nathaniel Pinckney, Chenhui Deng, Chia-Tung Ho, Yun-Da Tsai, Mingjie Liu, Wenfei Zhou, Brucek Khailany, Haoxing Ren

机构 * NVIDIA

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.LG

Comments 16 pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17125 2025-05-26 cs.DB cs.AI cs.IR 86%

NEXT-EVAL: Next Evaluation of Traditional and LLM Web Data Record Extraction

Soyeon Kim, Namhee Kim, Yeonwoo Jeong

机构 * Wordbricks

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

Comments Web Data Record Extraction, Zero-Shot Extraction, Large Language Models (LLMs) Evaluation Framework, Comparative Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06655 2025-05-13 cs.AI 86%

Unbiased Evaluation of Large Language Models from a Causal Perspective

Meilin Chen, Jian Tian, Liang Ma, Di Xie, Weijie Chen, Jiang Zhu

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00748 2025-04-02 cs.CL 86%

IHC-LLMiner: Automated extraction of tumour immunohistochemical profiles from PubMed abstracts using large language models

Yunsoo Kim, Michal W. S. Ong, Daniel W. Rogalsky, Manuel Rodriguez-Justo, Honghan Wu, Adam P. Levine

机构 * Institute of Health Informatics, University College London(伦敦大学学院健康信息学研究所) Research Department of Pathology, University College London(伦敦大学学院病理学研究部) Department of Pathology, Hadassah-Hebrew University Medical Center(哈达萨-希伯来大学医学中心病理学系) Department of Cellular Pathology, University College London Hospitals NHS Foundation Trust(伦敦大学学院医院NHS信托基金会细胞病理学系) School of Health & Wellbeing, University of Glasgow(格拉斯哥大学健康与福祉学院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16655 2025-03-28 cs.CL 86%

Accelerating Antibiotic Discovery with Large Language Models and Knowledge Graphs

Maxime Delmas, Magdalena Wysocka, Danilo Gusicuma, André Freitas

机构 * Idiap Research Institute(伊迪亚普研究所) National Biomarker Centre (NBC), CRUK Manchester Institute(英国癌症研究曼彻斯特研究所国家生物标志物中心) Univ. of Manchester(曼彻斯特大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments 11 pages, 9 figures, 3 tables fix: table, typos and error analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13012 2025-03-28 cs.HC cs.CL 86%

Towards a Design Guideline for RPA Evaluation: A Survey of Large Language Model-Based Role-Playing Agents

Chaoran Chen, Bingsheng Yao, Ruishi Zou, Wenyue Hua, Weimin Lyu, Yanfang Ye, Toby Jia-Jun Li, Dakuo Wang

机构 * University of Notre Dame(圣母大学) Northeastern University(东北大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) Stony Brook University(石溪大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05551 2025-03-10 cs.LG 86%

Revitalizing Saturated Benchmarks: A Weighted Metric Approach for Differentiating Large Language Model Performance

Bryan Etzine, Masoud Hashemi, Nishanth Madhusudhan, Sagar Davasam, Roshnee Sharma, Sathwik Tejaswi Madhusudhan, Vikas Yadav

机构 * University of Florida(佛罗里达大学) ServiceNow Research(ServiceNow研究院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.LG

Comments conference NAACL, TrustNLP Workshop

Journal ref TrustNLP workshop NAACL, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04730 2025-03-10 cs.CL cs.HC 86%

WinClick: GUI Grounding with Multimodal Large Language Models

Zheng Hui, Yinheng Li, Dan zhao, Tianyi Chen, Colby Banbury, Kazuhito Koishida

机构 * Microsoft(微软公司) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11856 2025-03-06 cs.AR cs.AI cs.PL 86%

Automatically Improving LLM-based Verilog Generation using EDA Tool Feedback

Jason Blocklove, Shailja Thakur, Benjamin Tan, Hammond Pearce, Siddharth Garg, Ramesh Karri

机构 * NYU Tandon School of Engineering(纽约大学坦登工程学院) University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :LLM(title);large language model(abstract,comments);language model(abstract,comments);prompting(abstract)

Comments Accepted for publication in TODAES Special Issue on Large Language Models for Electronic System Design Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13548 2025-02-20 cs.CL 86%

Detecting Linguistic Bias in Government Documents Using Large language Models

Milena de Swart, Floris den Hengst, Jieying Chen

机构 * Ministerie van OCW(荷兰教育、文化与科学部) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

Comments to appear in Proceedings of the ACM Web Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10995 2025-02-18 cs.CL 86%

Evaluating Large language models on Understanding Korean indirect Speech acts

Youngeun Koo, Jiwoo Lee, Dojun Park, Seohyun Park, Sungeun Lee

机构 * Artificial Intelligence Institute of Seoul National University(首尔国立大学人工智能研究院) Brain Humanities Lab, Seoul National University(首尔国立大学脑人文实验室)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments under review (15 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06496 2025-01-14 cs.CL cs.IR 86%

Analyzing the Role of Context in Forecasting with Large Language Models

Gerrit Mutschlechner, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01837 2025-01-06 cs.CL 86%

Prompting Disentangled Embeddings for Knowledge Graph Completion with Pre-trained Language Model

Yuxia Geng, Jiaoyan Chen, Yuhang Zeng, Zhuo Chen, Wen Zhang, Jeff Z. Pan, Yuxiang Wang, Xiaoliang Xu

专题命中 评测与基准 :language model(title,abstract);prompting(title);分类 cs.CL

Comments published in Expert Systems With Applications, 2025

Journal ref Expert Systems With Applications 268 (2025) 126175

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12274 2024-12-17 cs.CL 86%

SafeInfer: Context Adaptive Decoding Time Safety Alignment for Large Language Models

Somnath Banerjee, Sayan Layek, Soham Tripathy, Shanu Kumar, Animesh Mukherjee, Rima Hazra

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

Comments Accepted at AAAI 2025 (AI Alignment Track). Also selected for Microsoft Academic Partnership Grant (MAPG) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09640 2024-12-11 cs.CL 86%

Acquiring Bidirectionality via Large and Small Language Models

Takumi Goto, Hiroyoshi Nagao, Yuta Koreeda

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.CL

Comments Accepted by COLING2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17123 2024-11-27 cs.CV cs.AI 86%

Advancing Content Moderation: Evaluating Large Language Models for Detecting Sensitive Content Across Text, Images, and Videos

Nouar AlDahoul, Myles Joshua Toledo Tan, Harishwar Reddy Kasireddy, Yasir Zaki

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

Comments 55 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09147 2024-11-13 cs.AI 86%

Into the Unknown: Self-Learning Large Language Models

Teddy Ferdinan, Jan Kocoń, Przemysław Kazienko

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

Comments Accepted to SENTIRE 2024 (ICDM Workshops): https://sentic.net/sentire2024ferdinan.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04368 2024-11-08 cs.CL 86%

Measuring short-form factuality in large language models

Jason Wei, Nguyen Karina, Hyung Won Chung, Yunxin Joy Jiao, Spencer Papay, Amelia Glaese, John Schulman, William Fedus

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

Comments Blog post: https://openai.com/index/introducing-simpleqa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20796 2024-10-29 cs.CL 86%

Rephrasing natural text data with different languages and quality levels for Large Language Model pre-training

Michael Pieler, Marco Bellagente, Hannah Teufel, Duy Phung, Nathan Cooper, Jonathan Tow, Paulo Rocha, Reshinth Adithyan, Zaid Alyafeai, Nikhil Pinnaparaju, Maksym Zhuravinskyi, Carlos Riquelme

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments 21 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18505 2024-10-28 cs.CL 86%

CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models

Liangdong Wang, Bo-Wen Zhang, Chengwei Wu, Hanyu Zhao, Xiaofeng Shi, Shuhao Gu, Jijie Li, Quanyue Ma, TengFei Pan, Guang Liu

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14552 2024-10-10 cs.CV cs.AI 86%

Griffon: Spelling out All Object Locations at Any Granularity with Large Language Models

Yufei Zhan, Yousong Zhu, Zhiyang Chen, Fan Yang, Ming Tang, Jinqiao Wang

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.AI

Comments ECCV2024, Github: https://github.com/jefferyZhan/Griffon

详情

展开后加载摘要…

URL PDF HTML 收藏