arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-30 至 2025-09-30 共收录 512 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 114 篇

2509.25107 2025-09-30 cs.CL 77%

Knowledge Extraction on Semi-Structured Content: Does It Remain Relevant for Question Answering in the Era of LLMs?

Kai Sun, Yin Huang, Srishti Mehra, Mohammad Kachuee, Xilun Chen, Renjie Tao, Zhaojiang Lin, Andrea Jessee, Nirav Shah, Alex Betty, Yue Liu, Anuj Kumar, Wen-tau Yih, Xin Luna Dong

机构 * Meta Reality Labs(Meta现实实验室) FAIR, Meta(FAIR,Meta)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24468 2025-09-30 cs.CL 77%

Bias Mitigation or Cultural Commonsense? Evaluating LLMs with a Japanese Dataset

Taisei Yamamoto, Ryoma Kumon, Danushka Bollegala, Hitomi Yanaka

机构 * The University of Tokyo(东京大学) Riken(理化学研究所) University of Liverpool(利物浦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24323 2025-09-30 cs.MA cs.CL 77%

MAS$^2$: Self-Generative, Self-Configuring, Self-Rectifying Multi-Agent Systems

Kun Wang, Guibin Zhang, ManKit Ye, Xinyu Deng, Dongxia Wang, Xiaobin Hu, Jinyang Guo, Yang Liu, Yufei Guo

机构 * NTU(国立新加坡大学) NUS(国立大学) USTC(中国科学技术大学) ZJU(浙江大学) BUAA(北京航空航天大学) PKU(北京大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24080 2025-09-30 cs.CL 77%

Ensembling Multilingual Transformers for Robust Sentiment Analysis of Tweets

Meysam Shirdel Bilehsavar, Negin Mahmoudi, Mohammad Jalili Torkamani, Kiana Kiashemshaki

机构 * Department of Computer Science, University of South Carolina, USA(南卡罗来纳大学计算机科学系) Artificial Intelligence Institute, University of South Carolina, USA(南卡罗来纳大学人工智能研究所) Department of Civil, Environmental, and Ocean Engineering, Stevens Institute of Technology, New Jersey, USA(史蒂文斯理工学院土木、环境与海洋工程系) School of Computing, University of Nebraska–Lincoln, Lincoln, Nebraska, USA(内布拉斯加大学林肯分校计算机学院) Department of Computer Science, Bowling Green State University, Bowling Green, Ohio, USA(伯灵顿州立大学计算机科学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 19 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09507 2025-09-30 cs.CL 77%

AERA Chat: An Interactive Platform for Automated Explainable Student Answer Assessment

Jiazheng Li, Artem Bobrov, Runcong Zhao, Cesare Aloisi, Yulan He

机构 * King’s College London(伦敦国王学院) AQA

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23055 2025-09-30 cs.CL 77%

Peacemaker or Troublemaker: How Sycophancy Shapes Multi-Agent Debate

Binwei Yao, Chao Shang, Wanyu Du, Jianfeng He, Ruixue Lian, Yi Zhang, Hang Su, Sandesh Swamy, Yanjun Qi

机构 * AWS AI Labs(AWS人工智能实验室) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22856 2025-09-30 cs.CL 77%

The Bias is in the Details: An Assessment of Cognitive Bias in LLMs

R. Alexander Knipper, Charles S. Knipper, Kaiqi Zhang, Valerie Sims, Clint Bowers, Santu Karmaker

机构 * Department of Psychology(心理学系) University of Central Florida, USA(佛罗里达中央大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00691 2025-09-30 cs.CL 77%

CE-Bench: Towards a Reliable Contrastive Evaluation Benchmark of Interpretability of Sparse Autoencoders

Alex Gulko, Yusen Peng, Sachin Kumar

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24096 2025-09-30 cs.CL cs.AI cs.LG 75%

GEAR: A General Evaluation Framework for Abductive Reasoning

Kaiyu He, Peilin Wu, Mian Zhang, Kun Wan, Wentian Zhao, Xinya Du, Zhiyu Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Coda and Data: https://github.com/KaiyuHe998/GEAR-Abduction_evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10186 2025-09-30 cs.CL cs.AI cs.CY cs.LG 75%

PakBBQ: A Culturally Adapted Bias Benchmark for QA

Abdullah Hashmat, Muhammad Arham Mirza, Agha Ali Raza

机构 * Lahore University of Management Sciences(拉瓦尔大学管理科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 13 total pages, 7 figures, 2 tables, Accepted at Main Conference of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23338 2025-09-30 cs.DB cs.AI cs.CL cs.IR cs.LG 75%

PARROT: A Benchmark for Evaluating LLMs in Cross-System SQL Translation

Wei Zhou, Guoliang Li, Haoyu Wang, Yuxing Han, Xufei Wu, Fan Wu, Xuanhe Zhou

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To appear in NeurIPS 2025. Welcome your submission to challenge our leaderboard at: https://code4db.github.io/parrot-bench/. Also visit our code repository at: https://github.com/weAIDB/PARROT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24435 2025-09-30 cs.CL cs.AI 73%

Alternatives To Next Token Prediction In Text Generation -- A Survey

Charlie Wyatt, Aditya Joshi, Flora Salim

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06583 2025-09-30 cs.CL cs.AI 73%

Discerning minds or generic tutors? Evaluating instructional guidance capabilities in Socratic LLMs

Ying Liu, Can Li, Ting Zhang, Mei Wang, Qiannan Zhu, Jian Li, Hua Huang

机构 * Beijing Normal University(北京师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12795 2025-09-30 cs.AI cs.LG 73%

FRABench and UFEval: Unified Fine-grained Evaluation with Task and Aspect Generalization

Shibo Hong, Jiahao Ying, Haiyuan Liang, Mengdi Zhang, Jun Kuang, Jiazheng Zhang, Yixin Cao

机构 * School of Computer Science, Fudan University(复旦大学计算机学院) Meituan Group(美团集团) School of Computer Science, Singapore Management University(新加坡管理学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23879 2025-09-30 cs.CV cs.AI cs.CL cs.MM 73%

PCRI: Measuring Context Robustness in Multimodal Models for Enterprise Applications

Hitesh Laxmichand Patel, Amit Agarwal, Srikant Panda, Hansa Meghwani, Karan Dua, Paul Li, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted in EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14279 2025-09-30 cs.CL cs.CY cs.LG 73%

GRILE: A Benchmark for Grammar Reasoning and Explanation in Romanian LLMs

Adrian-Marius Dumitran, Alexandra-Mihaela Danila, Angela-Liliana Dumitran

机构 * University of Bucharest Faculty of Mathematics and Computer Science(布加勒斯大学数学与计算机科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted as long paper @RANLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10274 2025-09-30 cs.SD cs.AI cs.CL eess.AS 73%

Discrete Audio Tokens: More Than a Survey!

Pooneh Mousavi, Gallil Maimon, Adel Moumen, Darius Petermann, Jiatong Shi, Haibin Wu, Haici Yang, Anastasia Kuznetsova, Artem Ploujnikov, Ricard Marxer, Bhuvana Ramabhadran, Benjamin Elizalde, Loren Lugosch, Jinyu Li, Cem Subakan, Phil Woodland, Minje Kim, Hung-yi Lee, Shinji Watanabe, Yossi Adi, Mirco Ravanelli

机构 * Concordia University(康科迪亚大学) Mila-Quebec AI Institute(魁北克人工智能研究所) The Hebrew University of Jerusalem(特拉维夫大学) University of Cambridge(剑桥大学) Indiana University(印第安纳大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软公司) Université de Montréal(蒙特利尔大学) Université de Toulon(托尔努瓦大学) Google(谷歌公司) Apple(苹果公司) Laval University(拉瓦尔大学) National Taiwan University(台湾大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05990 2025-09-30 cs.SE cs.AI cs.CY cs.LG 73%

Leveraging Generative AI for Enhancing Automated Assessment in Programming Education Contests

Stefan Dascalescu, Adrian Marius Dumitran, Mihai Alexandru Vasiluta

机构 * University of Bucharest Faculty of Mathematics and Computer Science(布加勒斯大学数学与计算机科学学院) Softbinator Technologies(Softbinator技术公司) Delft University of Technology(代尔夫特理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 11 pages, 2 chart pies, 1 figure Pre-print version Accepted at BEA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13068 2025-09-30 cs.CL cs.AI 73%

Accuracy is Not Agreement: Expert-Aligned Evaluation of Crash Narrative Classification Models

Sudesh Ramesh Bhagat, Ibne Farabi Shihab, Anuj Sharma

机构 * Institute for Transportation(交通研究所) Iowa State University(爱荷华州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Journal ref 2025 IEEE 28th International Conference on Intelligent Transportation

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24120 2025-09-30 cs.CL 70%

EduVidQA: Generating and Evaluating Long-form Answers to Student Questions based on Lecture Videos

Sourjyadip Ray, Shubham Sharma, Somak Aditya, Pawan Goyal

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克哈格普尔) Panjab University, Chandigarh(旁遮普大学,昌迪加尔)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22582 2025-09-30 cs.CL 70%

Fine-Grained Detection of Context-Grounded Hallucinations Using LLMs

Yehonatan Peisakhovsky, Zorik Gekhman, Yosi Mass, Liat Ein-Dor, Roi Reichart

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04516 2025-09-30 cs.CL cs.CY 70%

Artificially Fluent: Swahili AI Performance Benchmarks Between English-Trained and Natively-Trained Datasets

Sophie Jaffer, Simeon Sayer

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 13 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04484 2025-09-30 cs.SE cs.LG 70%

An Empirical Analysis of Machine Learning Model and Dataset Documentation, Supply Chain, and Licensing Challenges on Hugging Face

Trevor Stalnaker, Nathan Wintersgill, Oscar Chaparro, Laura A. Heymann, Massimiliano Di Penta, Daniel M German, Denys Poshyvanyk

机构 * University of Sannio(萨恩尼奥大学) University of Victoria(维多利亚大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23783 2025-09-30 cs.AI 70%

Falcon: A Cross-Modal Evaluation Dataset for Comprehensive Safety Perception

Qi Xue, Minrui Jiang, Runjia Zhang, Xiurui Xie, Pei Ke, Guisong Liu

机构 * Laboratory of Intelligent Collaborative Computing University of Electronic Science and Technology of China(智能协同计算实验室 电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23482 2025-09-30 cs.AI 70%

GeoBS: Information-Theoretic Quantification of Geographic Bias in AI Models

Zhangyu Wang, Nemin Wu, Qian Cao, Jiangnan Xia, Zeping Liu, Yiqun Xie, Akshay Nambi, Tanuja Ganu, Ni Lao, Ninghao Liu, Gengchen Mai

机构 * SIT Lab, University of Maine(缅因大学SIT实验室) University of Georgia(佐治亚大学) SEAI Lab, University of Texas at Austin(德克萨斯大学奥斯汀分校SEAI实验室) University of Maryland(马里兰大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23395 2025-09-30 cs.CL 70%

Liaozhai through the Looking-Glass: On Paratextual Explicitation of Culture-Bound Terms in Machine Translation

Sherrie Shen, Weixuan Wang, Alexandra Birch

机构 * Institute for Language, Cognition and Computation(语言、认知与计算研究所) School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23156 2025-09-30 cs.LG 70%

CrystalGym: A New Benchmark for Materials Discovery Using Reinforcement Learning

Prashant Govindarajan, Mathieu Reymond, Antoine Clavaud, Mariano Phielipp, Santiago Miret, Sarath Chandar

机构 * Chandar Research Lab(昌达研究实验室) Mila – Quebec AI Institute(魁北克人工智能研究所) Polytechnique Montréal(蒙特利尔理工学院) Université de Montréal(蒙特利尔大学) Intel(英特尔) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13899 2025-09-30 cs.LG 70%

Causes and Consequences of Representational Similarity in Machine Learning Models

Zeyu Michael Li, Hung Anh Vu, Damilola Awofisayo, Emily Wenger

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09701 2025-09-30 cs.CL 70%

VeriFact: Enhancing Long-Form Factuality Evaluation with Refined Fact Extraction and Reference Facts

Xin Liu, Lechen Zhang, Sheza Munir, Yiyang Gu, Lu Wang

机构 * Computer Science and Engineering University of Michigan(计算机科学与工程大学密歇根大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19951 2025-09-30 cs.CV cs.AI 70%

Audio-centric Video Understanding Benchmark without Text Shortcut

Yudong Yang, Jimin Zhuang, Guangzhi Sun, Changli Tang, Yixuan Li, Peihan Li, Yifan Jiang, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted for publication in the Proceedings of EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏