arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-23 至 2025-10-23 共收录 208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 52 篇

2510.19116 2025-10-23 cs.CL cs.AI cs.LG 85%

That's Deprecated! Understanding, Detecting, and Steering Knowledge Conflicts in Language Models for Code Generation

Jaesung Bae, Cameron Churchwell, Mitchell Hermon, Tsun-An Hsieh, Jocelyn Xu, Yekaterina Yegorova, Mark Hasegawa-Johnson, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19419 2025-10-23 cs.CL 84%

BLiSS 1.0: Evaluating Bilingual Learner Competence in Second Language Small Language Models

Yuan Gao, Suchir Salhan, Andrew Caines, Paula Buttery, Weiwei Sun

机构 * ALTA Institute(ALTA研究院) Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学)

专题命中 评测与基准 :language model(title);small language model(title);分类 cs.CL

Comments Accepted Paper at the BabyLM Workshop 2025 @ EMNLP (Presentation in Suzhou, China)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12499 2025-10-23 cs.HC cs.AI 83%

PTFA: An LLM-based Agent that Facilitates Online Consensus Building through Parallel Thinking

Wen Gu, Zhaoxing Li, Jan Buermann, Jim Dilkes, Dimitris Michailidis, Shinobu Hasegawa, Vahid Yazdanpanah, Sebastian Stein

机构 * Nagoya Institute of Technology(名古屋技术大学) University of Southampton(南安普顿大学) University of Amsterdam(阿姆斯特丹大学) Japan Advanced Institute of Science and Technology(日本先进科学研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19676 2025-10-23 cs.CR 82%

CircuitGuard: Mitigating LLM Memorization in RTL Code Generation Against IP Leakage

Nowfel Mashnoor, Mohammad Akyash, Hadi Kamali, Kimia Azar

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03502 2025-10-23 cs.CL cs.AI cs.LG 82%

ALHD: A Large-Scale and Multigenre Benchmark Dataset for Arabic LLM-Generated Text Detection

Ali Khairallah, Arkaitz Zubiaga

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 47 pages, 15 figures. Dataset available at Zenodo: https://doi.org/10.5281/zenodo.17249602 Codebase available at GitHub: https://github.com/alikhairallah/ALHD-Benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17501 2025-10-23 cs.CV cs.AI 81%

Context-Aware Pseudo-Label Scoring for Zero-Shot Video Summarization

Yuanli Wu, Long Zhang, Yue Du, Bin Li

机构 * Nanyang Technological University(南洋理工大学) Guilin University of Electronic Technology(桂林电子科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19345 2025-10-23 cs.LG cs.AI 81%

Foundation Model Forecasts: Form and Function

Alvaro Perez-Diaz, James C. Loach, Danielle E. Toutoungi, Lee Middleton

机构 * Senseye, Siemens Digital Industries(Senseye,西门子数字工业)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19181 2025-10-23 cs.CL cs.AI cs.LG 80%

Interpretable Question Answering with Knowledge Graphs

Kartikeya Aneja, Manasvi Srivastava, Subhayan Das, Nagender Aneja

机构 * Department of Electrical and Computer Engineering, University of Wisconsin-Madison, Madison, USA(威斯康星大学麦迪逊分校电子与计算机工程系) Department of Computer Science, Banasthali Vidyapeeth, Rajasthan, India(班纳斯塔利大学计算机科学系) Ansyst Consulting, Gurgaon, India(安西斯特咨询公司) Huawei Ireland Research Center, Dublin, Ireland(华为爱尔兰研究中心) Bradley Department of Electrical and Computer Engineering, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院布拉德利电子与计算机工程系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref International Semantic Intelligence Conference (ISIC), Germany, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19559 2025-10-23 cs.CV cs.AI cs.IR cs.MM 79%

A Matter of Time: Revealing the Structure of Time in Vision-Language Models

Nidham Tekaya, Manuela Waldner, Matthias Zeppelzauer

机构 * St. Pölten University of Applied Sciences(施普伦特应用科学大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19236 2025-10-23 cs.LG 79%

Understanding the Implicit Biases of Design Choices for Time Series Foundation Models

Annan Yu, Danielle C. Maddix, Boran Han, Xiyuan Zhang, Abdul Fatir Ansari, Oleksandr Shchur, Christos Faloutsos, Andrew Gordon Wilson, Michael W. Mahoney, Yuyang Wang

机构 * Center for Applied Mathematics(应用数学中心) Cornell University(康奈尔大学) Amazon Web Services(亚马逊网络服务) Amazon Selling Partner Services(亚马逊销售合作伙伴服务) Amazon Supply Chain Optimization Technologies(亚马逊供应链优化技术)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18893 2025-10-23 cs.DC cs.AI cs.SE 79%

CodeCRDT: Observation-Driven Coordination for Multi-Agent LLM Code Generation

Sergey Pugachev

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19799 2025-10-23 cs.CY cs.AI cs.HC cs.LG cs.SE econ.GN q-fin.EC 79%

Integrating Transparent Models, LLMs, and Practitioner-in-the-Loop: A Case of Nonprofit Program Evaluation

Ji Ma, Albert Casella

机构 * LBJ School of Public Affairs, The University of Texas at Austin(德克萨斯大学奥斯汀分校劳伦斯·伯克曼公共事务学院) Gradel Institute of Charity, University of Oxford(牛津大学格拉德利慈善研究所) Michael & Susan Dell Foundation(迈克尔与苏珊·德尔基金会)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16062 2025-10-23 cs.CL cs.AI 79%

Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs

Guiyao Tie, Zenghui Yuan, Zeli Zhao, Chaoran Hu, Tianhe Gu, Ruihang Zhang, Sizhe Zhang, Junran Wu, Xiaoyue Tu, Ming Jin, Qingsong Wen, Lixing Chen, Pan Zhou, Lichao Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Griffith University(格里菲斯大学) Squirrel Ai Learning(squirrel ai 学习) Shanghai Jiaotong University(上海交通大学) Lehigh University(莱斯大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 47 pages, 25 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08800 2025-10-23 cs.AI cs.CL 79%

Measuring Data Science Automation: A Survey of Evaluation Tools for AI Assistants and Agents

Irene Testini, José Hernández-Orallo, Lorenzo Pacchiardi

机构 * Leverhulme Centre for the Future of Intelligence, University of Cambridge, UK(未来智能研究中心、剑桥大学) Valencian Research Institute for Artificial Intelligence (VRAIN), Universitat Politècnica de València, Spain(瓦伦西亚人工智能研究 institutes (VRAIN)、瓦伦西亚理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Published in Transactions of Machine Learning Research (TMLR), 10/2025 https://openreview.net/forum?id=MB0TCLfLn1

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05735 2025-10-23 cs.CL cs.LG 79%

Do LLMs Really Forget? Evaluating Unlearning with Knowledge Correlation and Confidence Awareness

Rongzhe Wei, Peizhi Niu, Hans Hao-Hsun Hsu, Ruihan Wu, Haoteng Yin, Mohsen Ghassemi, Yifan Li, Vamsi K. Potluru, Eli Chien, Kamalika Chaudhuri, Olgica Milenkovic, Pan Li

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments NeurIPS Camera-Ready Version. Code available at: https://github.com/Graph-COM/Knowledge_Unlearning

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18129 2025-10-23 cs.CL cs.AI 79%

GeoBenchX: Benchmarking LLMs in Agent Solving Multistep Geospatial Tasks

Varvara Krechetova, Denis Kochedykov

机构 * World Bank(世界银行) JP Morgan Chase & Co(摩根大通公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Github with code and benchmark set: https://github.com/Solirinai/GeoBenchX

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18892 2025-10-23 cs.CL cs.LG 79%

When Models Can't Follow: Testing Instruction Adherence Across 256 LLMs

Richard J. Young, Brandon Gillins, Alice M. Matthews

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 21 pages, 3 figures, 5 tables. Comprehensive evaluation of 256 LLMs on instruction-following tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14000 2025-10-23 cs.SE 78%

Type-aware LLM-based Regression Test Generation for Python Programs

Runlin Liu, Zhe Zhang, Yunge Hu, Yuhang Lin, Xiang Gao, Hailong Sun

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19346 2025-10-23 cs.CL 77%

Local Obfuscation by GLINER for Impartial Context Aware Lineage: Development and evaluation of PII Removal system

Prakrithi Shivaprakash, Lekhansh Shukla, Animesh Mukherjee, Prabhat Chand, Pratima Murthy

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

Comments 30 pages, 15 main text and 15 supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21625 2025-10-23 cs.CL 77%

Meeseeks: A Feedback-Driven, Iterative Self-Correction Benchmark evaluating LLMs' Instruction Following Capability

Jiaming wang, Yunke Zhao, Peng Ding, Jun Kuang, Yibin Shen, Zhe Tang, Yilin Jin, ZongYu Wang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19274 2025-10-23 cs.SE 75%

From Specification to Service: Accelerating API-First Development Using Multi-Agent Systems

Saurabh Chauhan, Zeeshan Rasheed, Malik Abdul Sami, Kai-Kristian Kemell, Muhammad Waseem, Zheying Zhang, Jussi Rasku, Mika Saari, Pekka Abrahamsson

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 9 Figures, 6Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18923 2025-10-23 cs.SE 75%

A Survey on Feedback Types in Automated Programming Assessment Systems

Eduard Frankford, Tobias Antensteiner, Michael Vierhauser, Clemens Sauerwein, Vivien Wallner, Iris Groher, Reinhold Plösch, Ruth Breu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18909 2025-10-23 cs.CL cs.AI 73%

Learning from the Best, Differently: A Diversity-Driven Rethinking on Data Selection

Hongyi He, Xiao Liu, Zhenghao Lin, Mingni Tang, Yi Cheng, Jintao Wang, Wenjie Li, Peng Cheng, Yeyun Gong

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19628 2025-10-23 cs.CL 70%

CrossNews-UA: A Cross-lingual News Semantic Similarity Benchmark for Ukrainian, Polish, Russian, and English

Daryna Dementieva, Evgeniya Sukhodolskaya, Alexander Fraser

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19005 2025-10-23 cs.CL 70%

Dynamic Evaluation for Oversensitivity in LLMs

Sophia Xiao Pu, Sitao Cheng, Xin Eric Wang, William Yang Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

Comments EMNLP-Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05931 2025-10-23 cs.CL cs.CY 70%

Hire Your Anthropologist! Rethinking Culture Benchmarks Through an Anthropological Lens

Mai AlKhamissi, Yunze Xiao, Badr AlKhamissi, Mona Diab

机构 * Carnegie Mellon University(卡内基梅隆大学) EPFL(苏黎世联邦理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 12 pages; 2 figures; First two author contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08616 2025-10-23 math.ST cs.LG stat.ML stat.TH 70%

Generalizing while preserving monotonicity in comparison-based preference learning models

Julien Fageot, Peva Blanchard, Gilles Bareilles, Lê-Nguyên Hoang

机构 * Tournesol(图努索尔) Kleis Technology(克莱斯技术) CTU in Prague(布拉格CTU) Calicarpa(卡利卡尔帕)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05136 2025-10-23 cs.CL 70%

LV-Eval: A Balanced Long-Context Benchmark with 5 Length Levels Up to 256K

Tao Yuan, Xuefei Ning, Dong Zhou, Zhijie Yang, Shiyao Li, Minghui Zhuang, Zheyue Tan, Zhuyu Yao, Dahua Lin, Boxun Li, Guohao Dai, Shengen Yan, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence-AI Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18608 2025-10-23 cs.IR cs.AI 70%

Embedding in Recommender Systems: A Survey

Maolin Wang, Xinjian Zhao, Wanyu Wang, Sheng Zhang, Jiansheng Li, Bowen Yu, Binhao Wang, Shucheng Zhou, Dawei Yin, Qing Li, Ruocheng Guo, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Baidu Inc.(百度公司) Hong Kong Polytechnic University(香港理工大学) Unaffiliated Researcher(无隶属机构)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19955 2025-10-23 cs.LG cs.AI cs.CL 67%

MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research

Hui Chen, Miao Xiong, Yujie Lu, Wei Han, Ailin Deng, Yufei He, Jiaying Wu, Yibo Li, Yue Liu, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 49 pages, 9 figures. Accepted by NeurIPS 2025 D&B Track

详情

展开后加载摘要…

URL PDF HTML 收藏