arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2507.05528 2025-09-08 cs.AI cs.CL 86%

Conversational Education at Scale: A Multi-LLM Agent Workflow for Procedural Learning and Pedagogic Quality Assessment

Jiahuan Pei, Fanghua Ye, Xin Sun, Wentao Deng, Koen Hindriks, Junxiao Wang

机构 * Vrije University of Amsterdam(阿姆斯特丹自由大学) University College London(伦敦大学学院) University of Amsterdam(阿姆斯特丹大学) National Institute of Informatics(日本信息处理学会) Shandong University(山东大学) Guangzhou University(广州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 14 pages, accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04469 2025-09-08 cs.CL cs.AI 86%

Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing

David Berghaus, Armin Berger, Lars Hillebrand, Kostadin Cvejoski, Rafet Sifa

机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) Lamarr Institute(拉马尔研究所)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11452 2025-09-03 cs.AI cs.CL cs.HC 86%

Inclusion Arena: An Open Platform for Evaluating Large Foundation Models with Real-World Apps

Kangyu Wang, Hongliang He, Lin Liu, Ruiqi Liang, Zhenzhong Lan, Jianguo Li

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Our platform is publicly accessible at https://www.tbox.cn/about/model-ranking

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24671 2025-09-03 cs.CL cs.AI 86%

Multiple LLM Agents Debate for Equitable Cultural Alignment

Dayeon Ki, Rachel Rudinger, Tianyi Zhou, Marine Carpuat

机构 * University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07407 2025-09-03 cs.AI cs.CL cs.MA 86%

A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems

Jinyuan Fang, Yanwen Peng, Xi Zhang, Yingxu Wang, Xinhao Yi, Guibin Zhang, Yi Xu, Bin Wu, Siwei Liu, Zihao Li, Zhaochun Ren, Nikos Aletras, Xi Wang, Han Zhou, Zaiqiao Meng

机构 * University of Glasgow(格拉斯哥大学) University of Sheffield(谢菲尔德大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) National University of Singapore(新加坡国家大学) University of Cambridge(剑桥大学) University College London(伦敦大学学院) University of Aberdeen(阿伯丁大学) Leiden University(莱顿大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Github Repo: https://github.com/EvoAgentX/Awesome-Self-Evolving-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20583 2025-08-29 cs.CL cs.AI 86%

A Graph Talks, But Who's Listening? Rethinking Evaluations for Graph-Language Models

Soham Petkar, Hari Aakash K, Anirudh Vempati, Akshit Sinha, Ponnurangam Kumarauguru, Chirag Agarwal

机构 * plaksha.edu.in(普拉克斯哈大学) research.iiit.ac.in(IIIT研究机构)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15165 2025-08-29 cs.CL cs.AI cs.SE 86%

SoAy: A Solution-based LLM API-using Methodology for Academic Information Seeking

Yuanchun Wang, Jifan Yu, Zijun Yao, Jing Zhang, Yuyang Xie, Shangqing Tu, Yiyang Fu, Youhe Feng, Jinkai Zhang, Jingyao Zhang, Bowen Huang, Yuanyao Li, Huihui Yuan, Lei Hou, Juanzi Li, Jie Tang

机构 * Renmin University of China(中国人民大学) Key Laboratory of Data Engineering and Knowledge Engineering, MOE(数据工程与知识工程重点实验室) Tsinghua University(清华大学) Institute of Education(教育学院) Department of Computer Science and Technology(计算机科学与技术系) Engineering Research Center of Database and Business Intelligence, MOE(数据库与商务智能工程研究中心) School of Information(信息学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments KDD 2025; 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06029 2025-08-27 cs.CL cs.LG 86%

SmartBench: Is Your LLM Truly a Good Chinese Smartphone Assistant?

Xudong Lu, Haohao Gao, Renshou Wu, Shuai Ren, Xiaoxin Chen, Hongsheng Li, Fangyuan Li

机构 * vivo AI Lab(vivo人工智能实验室) CUHK MMLab(香港大学MMLab)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17692 2025-08-26 cs.AI cs.CL 86%

LLM-based Agentic Reasoning Frameworks: A Survey from Methods to Scenarios

Bingxi Zhao, Lin Geng Foo, Ping Hu, Christian Theobalt, Hossein Rahmani, Jun Liu

机构 * Beijing Jiaotong University(北京交通大学) Lancaster University(兰卡斯特大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克研究所(信息学)萨尔兰州信息学校区) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 51 pages,10 figures,8 tables. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15822 2025-08-25 cs.CL cs.AI cs.ET cs.IR 86%

An Auditable Pipeline for Fuzzy Full-Text Screening in Systematic Reviews: Integrating Contrastive Semantic Highlighting and LLM Judgment

Pouria Mortezaagha, Arya Rahgozar

机构 * Ottawa Hospital Research Institute(渥太华医院研究机构) University of Ottawa(渥太华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02039 2025-08-22 cs.CL cs.AI 86%

An Investigation into Value Misalignment in LLM-Generated Texts for Cultural Heritage

Fan Bu, Zheng Wang, Siyi Wang, Ziyao Liu

机构 * Department of Archeology and Museology, Shanghai University(考古与博物馆学系,上海大学) National Collaborative Research Center for Revolutionary Cultural Heritage at Memorial of the First CPC National Congress & Shanghai University(革命文化遗产国家联合研究中心,中共一大会址纪念馆与上海大学) School of Management, Shanghai University(管理学院,上海大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14087 2025-08-21 cs.LG cs.AI hep-ex 86%

FM4NPP: A Scaling Foundation Model for Nuclear and Particle Physics

David Park, Shuhang Li, Yi Huang, Xihaier Luo, Haiwang Yu, Yeonju Go, Christopher Pinkenburg, Yuewei Lin, Shinjae Yoo, Joseph Osborn, Jin Huang, Yihui Ren

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05668 2025-08-20 cs.IR cs.AI cs.CL 86%

A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges

Yunjia Xi, Jianghao Lin, Yongzhao Xiao, Zheli Zhou, Rong Shan, Te Gao, Jiachen Zhu, Weiwen Liu, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13196 2025-08-20 cs.LG cs.AI cs.IR 86%

Contextual Attention-Based Multimodal Fusion of LLM and CNN for Sentiment Analysis

Meriem Zerkouk, Miloud Mihoubi, Belkacem Chikhaoui

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments The 38th Canadian Conference on Artificial Intelligence ( 2025 )

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01077 2025-08-19 cs.CL cs.LG 86%

Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection

Zhipeng Wei, Yuqi Liu, N. Benjamin Erichson

机构 * International Computer Science Institute, CA, USA(国际计算机科学研究所) Lawrence Berkeley National Laboratory, CA, USA(伯克利国家实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18013 2025-08-18 cs.CL cs.AI 86%

A Survey on Recent Advances in LLM-Based Multi-turn Dialogue Systems

Zihao Yi, Jiarui Ouyang, Zhe Xu, Yuwen Liu, Tianhao Liao, Haohao Luo, Ying Shen

机构 * Sun Yat-Sen University(中山大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 35 pages, 10 figures, ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08761 2025-08-13 cs.CL cs.AI 86%

DevNous: An LLM-Based Multi-Agent System for Grounding IT Project Management in Unstructured Conversation

Stavros Doropoulos, Stavros Vologiannidis, Ioannis Magnisalis

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08287 2025-08-13 cs.CL cs.AI cs.CY 86%

Sacred or Synthetic? Evaluating LLM Reliability and Abstention for Religious Questions

Farah Atif, Nursultan Askarbekuly, Kareem Darwish, Monojit Choudhury

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 8th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08096 2025-08-12 cs.CL cs.LG 86%

Assessing LLM Text Detection in Educational Contexts: Does Human Contribution Affect Detection?

Lukas Gehring, Benjamin Paaßen

机构 * Faculty of Technology, Bielefeld University(技术学院,比勒菲尔德大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Preprint as provided by the authors (19 pages, 12 figures, 9 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07668 2025-08-12 cs.LG cs.AI 86%

AIS-LLM: A Unified Framework for Maritime Trajectory Prediction, Anomaly Detection, and Collision Risk Assessment with Explainable Forecasting

Hyobin Park, Jinwook Jung, Minseok Seo, Hyunsoo Choi, Deukjae Cho, Sekil Park, Dong-Geol Choi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06709 2025-08-12 cs.CL cs.AI 86%

Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge

Evangelia Spiliopoulou, Riccardo Fogliato, Hanna Burnsky, Tamer Soliman, Jie Ma, Graham Horwood, Miguel Ballesteros

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19997 2025-08-12 cs.LG cs.CL cs.CY 86%

Embracing Imperfection: Simulating Students with Diverse Cognitive Levels Using LLM-based Agents

Tao Wu, Jingyuan Chen, Wang Lin, Mengze Li, Yumeng Zhu, Ang Li, Kun Kuang, Fei Wu

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05616 2025-08-08 cs.LG cs.AI cs.NE cs.RO 86%

TrajEvo: Trajectory Prediction Heuristics Design via LLM-driven Evolution

Zhikai Zhao, Chuanbo Hua, Federico Berto, Kanghoon Lee, Zihan Ma, Jiachen Li, Jinkyoo Park

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments arXiv admin note: substantial text overlap with arXiv:2505.04480

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03426 2025-08-06 cs.CV cs.AI cs.LG 86%

R2GenKG: Hierarchical Multi-modal Knowledge Graph for LLM-based Radiology Report Generation

Futian Wang, Yuhan Qiao, Xiao Wang, Fuling Wang, Yuxiang Zhang, Dengdi Sun

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03262 2025-08-06 cs.CL cs.AI 86%

Pay What LLM Wants: Can LLM Simulate Economics Experiment with 522 Real-human Persona?

Junhyuk Choi, Hyeonchu Park, Haemin Lee, Hyebeen Shin, Hyun Joung Jin, Bugeun Kim

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03092 2025-08-06 cs.AI cs.CL 86%

Toward Verifiable Misinformation Detection: A Multi-Tool LLM Agent Framework

Zikun Cui, Tianyi Huang, Chia-En Chiang, Cuiqianhe Du

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22937 2025-08-01 cs.CL cs.AI 86%

CoE-Ops: Collaboration of LLM-based Experts for AIOps Question-Answering

Jinkun Zhao, Yuanshuai Wang, Xingjian Zhang, Ruibo Chen, Xingchuang Liao, Junle Wang, Lei Huang, Kui Zhang, Wenjun Wu

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University(SKLCCSE,人工智能学院,北航) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北航)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21132 2025-07-30 cs.AI cs.CY cs.LG 86%

Can You Trust an LLM with Your Life-Changing Decision? An Investigation into AI High-Stakes Responses

Joshua Adrian Cahyono, Saran Subramanian

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21125 2025-07-30 cs.IR cs.AI cs.LG cs.SY eess.SY 86%

RATE: An LLM-Powered Retrieval Augmented Generation Technology-Extraction Pipeline

Karan Mirhosseini, Arya Aftab, Alireza Sheikh

机构 * Dept. of Management, Science and Technology(管理、科学与技术系) Amirkabir University of Technology(阿姆尔卡比尔科技大学) Dept. of Electrical Engineering(电气工程系) Sharif University of Technology(沙里夫科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13666 2025-07-28 cs.CL cs.AI cs.CY 86%

Evaluation of LLM Vulnerabilities to Being Misused for Personalized Disinformation Generation

Aneta Zugecova, Dominik Macko, Ivan Srba, Robert Moro, Jakub Kopal, Katarina Marcincinova, Matus Mesarcik

机构 * Kempelen Institute of Intelligent Technologies(凯普勒智能技术研究所) University of Copenhagen(哥本哈根大学) Comenius University in Bratislava(布拉迪斯拉瓦科เมนius大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 main

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025 Volume 1: Long Papers)

详情

展开后加载摘要…

URL PDF HTML 收藏