arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-23 至 2025-10-23 共收录 52 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 52 篇

2505.15695 2025-10-23 cs.CL 89%

Can Large Language Models be Effective Online Opinion Miners?

Ryang Heo, Yongsik Seo, Junseong Lee, Dongha Lee

机构 * Department of Artificial Intelligence, Yonsei University - DLI Lab(人工智能系,延世大学 - DLI实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18888 2025-10-23 cs.CL cs.AI 88%

Contextual Augmentation for Entity Linking using Large Language Models

Daniel Vollmers, Hamada M. Zahera, Diego Moussallem, Axel-Cyrille Ngonga Ngomo

机构 * Data Science Group, Paderborn University(数据科学组,帕德博恩大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19616 2025-10-23 cs.CL 88%

PBBQ: A Persian Bias Benchmark Dataset Curated with Human-AI Collaboration for Large Language Models

Farhan Farsi, Shayan Bali, Fatemeh Valeh, Parsa Ghofrani, Alireza Pakniat, Kian Kashfipour, Amir H. Payberah

机构 * Amirkabir University of Technology(阿米尔卡比尔技术大学) King’s College London(伦敦国王学院) Politecnico di Milano(米兰理工学院) KTH Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18582 2025-10-23 cs.CV 88%

The Photographer Eye: Teaching Multimodal Large Language Models to Understand Image Aesthetics like Photographers

Daiqing Qi, Handong Zhao, Jing Shi, Simon Jenni, Yifei Fan, Franck Dernoncourt, Scott Cohen, Sheng Li

机构 * University of Virginia(弗吉尼亚大学) Adobe(Adobe公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11000 2025-10-23 cs.SE 88%

Ever-Improving Test Suite by Leveraging Large Language Models

Ketai Qiu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted by 33rd ACM International Conference on the Foundations of Software Engineering (FSE Companion '25), June 23--28, 2025, Trondheim, Norway

Journal ref Proceedings of the 33rd ACM International Conference on the Foundations of Software Engineering, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24379 2025-10-23 cs.LG cs.AI cs.CL cs.CR 87%

Unlearned but Not Forgotten: Data Extraction after Exact Unlearning in LLM

Xiaoyu Wu, Yifei Pang, Terrance Liu, Zhiwei Steven Wu

机构 * Rice University(里士大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18931 2025-10-23 cs.CY cs.AI cs.LG 86%

A Justice Lens on Fairness and Ethics Courses in Computing Education: LLM-Assisted Multi-Perspective and Thematic Evaluation

Kenya S. Andrews, Deborah Dormah Kanubala, Kehinde Aruleba, Francisco Enrique Vicente Castro, Renata A Revelo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 14 pages, 8 figures, In Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19032 2025-10-23 cs.CL cs.CY cs.HC 85%

When Can We Trust LLMs in Mental Health? Large-Scale Benchmarks for Reliable LLM Evaluation

Abeer Badawi, Elahe Rahimi, Md Tahmid Rahman Laskar, Sheri Grach, Lindsay Bertrand, Lames Danok, Jimmy Huang, Frank Rudzicz, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Dalhousie University(达尔豪斯大学) IWK Health Hospital(IWK健康医院) King’s College London(伦敦国王学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19025 2025-10-23 cs.DB cs.AI 85%

FlexiDataGen: An Adaptive LLM Framework for Dynamic Semantic Dataset Generation in Sensitive Domains

Hamed Jelodar, Samita Bai, Roozbeh Razavi-Far, Ali A. Ghorbani

机构 * Canadian Institute for Cybersecurity(加拿大网络安全研究所) Faculty of Computer Science(计算机科学学院) University of New Brunswick(新不伦瑞克大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11791 2025-10-23 cs.LG cs.CR 85%

SEC-bench: Automated Benchmarking of LLM Agents on Real-World Software Security Tasks

Hwiwon Lee, Ziqi Zhang, Hanxiao Lu, Lingming Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19116 2025-10-23 cs.CL cs.AI cs.LG 85%

That's Deprecated! Understanding, Detecting, and Steering Knowledge Conflicts in Language Models for Code Generation

Jaesung Bae, Cameron Churchwell, Mitchell Hermon, Tsun-An Hsieh, Jocelyn Xu, Yekaterina Yegorova, Mark Hasegawa-Johnson, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19419 2025-10-23 cs.CL 84%

BLiSS 1.0: Evaluating Bilingual Learner Competence in Second Language Small Language Models

Yuan Gao, Suchir Salhan, Andrew Caines, Paula Buttery, Weiwei Sun

机构 * ALTA Institute(ALTA研究院) Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学)

专题命中 评测与基准 :language model(title);small language model(title);分类 cs.CL

Comments Accepted Paper at the BabyLM Workshop 2025 @ EMNLP (Presentation in Suzhou, China)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12499 2025-10-23 cs.HC cs.AI 83%

PTFA: An LLM-based Agent that Facilitates Online Consensus Building through Parallel Thinking

Wen Gu, Zhaoxing Li, Jan Buermann, Jim Dilkes, Dimitris Michailidis, Shinobu Hasegawa, Vahid Yazdanpanah, Sebastian Stein

机构 * Nagoya Institute of Technology(名古屋技术大学) University of Southampton(南安普顿大学) University of Amsterdam(阿姆斯特丹大学) Japan Advanced Institute of Science and Technology(日本先进科学研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19676 2025-10-23 cs.CR 82%

CircuitGuard: Mitigating LLM Memorization in RTL Code Generation Against IP Leakage

Nowfel Mashnoor, Mohammad Akyash, Hadi Kamali, Kimia Azar

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03502 2025-10-23 cs.CL cs.AI cs.LG 82%

ALHD: A Large-Scale and Multigenre Benchmark Dataset for Arabic LLM-Generated Text Detection

Ali Khairallah, Arkaitz Zubiaga

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 47 pages, 15 figures. Dataset available at Zenodo: https://doi.org/10.5281/zenodo.17249602 Codebase available at GitHub: https://github.com/alikhairallah/ALHD-Benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17501 2025-10-23 cs.CV cs.AI 81%

Context-Aware Pseudo-Label Scoring for Zero-Shot Video Summarization

Yuanli Wu, Long Zhang, Yue Du, Bin Li

机构 * Nanyang Technological University(南洋理工大学) Guilin University of Electronic Technology(桂林电子科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19345 2025-10-23 cs.LG cs.AI 81%

Foundation Model Forecasts: Form and Function

Alvaro Perez-Diaz, James C. Loach, Danielle E. Toutoungi, Lee Middleton

机构 * Senseye, Siemens Digital Industries(Senseye,西门子数字工业)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19181 2025-10-23 cs.CL cs.AI cs.LG 80%

Interpretable Question Answering with Knowledge Graphs

Kartikeya Aneja, Manasvi Srivastava, Subhayan Das, Nagender Aneja

机构 * Department of Electrical and Computer Engineering, University of Wisconsin-Madison, Madison, USA(威斯康星大学麦迪逊分校电子与计算机工程系) Department of Computer Science, Banasthali Vidyapeeth, Rajasthan, India(班纳斯塔利大学计算机科学系) Ansyst Consulting, Gurgaon, India(安西斯特咨询公司) Huawei Ireland Research Center, Dublin, Ireland(华为爱尔兰研究中心) Bradley Department of Electrical and Computer Engineering, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院布拉德利电子与计算机工程系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref International Semantic Intelligence Conference (ISIC), Germany, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19559 2025-10-23 cs.CV cs.AI cs.IR cs.MM 79%

A Matter of Time: Revealing the Structure of Time in Vision-Language Models

Nidham Tekaya, Manuela Waldner, Matthias Zeppelzauer

机构 * St. Pölten University of Applied Sciences(施普伦特应用科学大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19236 2025-10-23 cs.LG 79%

Understanding the Implicit Biases of Design Choices for Time Series Foundation Models

Annan Yu, Danielle C. Maddix, Boran Han, Xiyuan Zhang, Abdul Fatir Ansari, Oleksandr Shchur, Christos Faloutsos, Andrew Gordon Wilson, Michael W. Mahoney, Yuyang Wang

机构 * Center for Applied Mathematics(应用数学中心) Cornell University(康奈尔大学) Amazon Web Services(亚马逊网络服务) Amazon Selling Partner Services(亚马逊销售合作伙伴服务) Amazon Supply Chain Optimization Technologies(亚马逊供应链优化技术)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18893 2025-10-23 cs.DC cs.AI cs.SE 79%

CodeCRDT: Observation-Driven Coordination for Multi-Agent LLM Code Generation

Sergey Pugachev

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19799 2025-10-23 cs.CY cs.AI cs.HC cs.LG cs.SE econ.GN q-fin.EC 79%

Integrating Transparent Models, LLMs, and Practitioner-in-the-Loop: A Case of Nonprofit Program Evaluation

Ji Ma, Albert Casella

机构 * LBJ School of Public Affairs, The University of Texas at Austin(德克萨斯大学奥斯汀分校劳伦斯·伯克曼公共事务学院) Gradel Institute of Charity, University of Oxford(牛津大学格拉德利慈善研究所) Michael & Susan Dell Foundation(迈克尔与苏珊·德尔基金会)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16062 2025-10-23 cs.CL cs.AI 79%

Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs

Guiyao Tie, Zenghui Yuan, Zeli Zhao, Chaoran Hu, Tianhe Gu, Ruihang Zhang, Sizhe Zhang, Junran Wu, Xiaoyue Tu, Ming Jin, Qingsong Wen, Lixing Chen, Pan Zhou, Lichao Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Griffith University(格里菲斯大学) Squirrel Ai Learning(squirrel ai 学习) Shanghai Jiaotong University(上海交通大学) Lehigh University(莱斯大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 47 pages, 25 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08800 2025-10-23 cs.AI cs.CL 79%

Measuring Data Science Automation: A Survey of Evaluation Tools for AI Assistants and Agents

Irene Testini, José Hernández-Orallo, Lorenzo Pacchiardi

机构 * Leverhulme Centre for the Future of Intelligence, University of Cambridge, UK(未来智能研究中心、剑桥大学) Valencian Research Institute for Artificial Intelligence (VRAIN), Universitat Politècnica de València, Spain(瓦伦西亚人工智能研究 institutes (VRAIN)、瓦伦西亚理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Published in Transactions of Machine Learning Research (TMLR), 10/2025 https://openreview.net/forum?id=MB0TCLfLn1

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05735 2025-10-23 cs.CL cs.LG 79%

Do LLMs Really Forget? Evaluating Unlearning with Knowledge Correlation and Confidence Awareness

Rongzhe Wei, Peizhi Niu, Hans Hao-Hsun Hsu, Ruihan Wu, Haoteng Yin, Mohsen Ghassemi, Yifan Li, Vamsi K. Potluru, Eli Chien, Kamalika Chaudhuri, Olgica Milenkovic, Pan Li

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments NeurIPS Camera-Ready Version. Code available at: https://github.com/Graph-COM/Knowledge_Unlearning

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18129 2025-10-23 cs.CL cs.AI 79%

GeoBenchX: Benchmarking LLMs in Agent Solving Multistep Geospatial Tasks

Varvara Krechetova, Denis Kochedykov

机构 * World Bank(世界银行) JP Morgan Chase & Co(摩根大通公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Github with code and benchmark set: https://github.com/Solirinai/GeoBenchX

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18892 2025-10-23 cs.CL cs.LG 79%

When Models Can't Follow: Testing Instruction Adherence Across 256 LLMs

Richard J. Young, Brandon Gillins, Alice M. Matthews

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 21 pages, 3 figures, 5 tables. Comprehensive evaluation of 256 LLMs on instruction-following tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14000 2025-10-23 cs.SE 78%

Type-aware LLM-based Regression Test Generation for Python Programs

Runlin Liu, Zhe Zhang, Yunge Hu, Yuhang Lin, Xiang Gao, Hailong Sun

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19346 2025-10-23 cs.CL 77%

Local Obfuscation by GLINER for Impartial Context Aware Lineage: Development and evaluation of PII Removal system

Prakrithi Shivaprakash, Lekhansh Shukla, Animesh Mukherjee, Prabhat Chand, Pratima Murthy

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

Comments 30 pages, 15 main text and 15 supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21625 2025-10-23 cs.CL 77%

Meeseeks: A Feedback-Driven, Iterative Self-Correction Benchmark evaluating LLMs' Instruction Following Capability

Jiaming wang, Yunke Zhao, Peng Ding, Jun Kuang, Yibin Shen, Zhe Tang, Yilin Jin, ZongYu Wang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏