arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32207 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32207 篇

2502.20344 2025-09-16 cs.CL 88%

LinguaLens: Towards Interpreting Linguistic Mechanisms of Large Language Models via Sparse Auto-Encoder

Yi Jing, Zijun Yao, Hongzhu Guo, Lingxu Ran, Xiaozhi Wang, Lei Hou, Juanzi Li

机构 * DCST, BNRist(DCST、BNRist;KIRC、人工智能研究院、清华大学,中国) KIRC, Institute for Artificial Intelligence, Tsinghua University, China(中文语言文学系、北京大学,中国) Department of Chinese Language and Literature, Peking University, China

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11335 2025-09-16 cs.LG cond-mat.mtrl-sci 88%

MatQnA: A Benchmark Dataset for Multi-modal Large Language Models in Materials Characterization and Analysis

Yonghao Weng, Liqiang Gao, Linwu Zhu, Jian Huang

机构 * Department of Materials Engineering(材料工程系) Zhejiang University(浙江大学) Department of Data Intelligence(数据智能系) Shiyanjia Lab of Scientific Compass(科学之桥实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10697 2025-09-16 cs.CL 88%

A Survey on Retrieval And Structuring Augmented Generation with Large Language Models

Pengcheng Jiang, Siru Ouyang, Yizhu Jiao, Ming Zhong, Runchu Tian, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments KDD'25 survey track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05070 2025-09-16 cs.CL 88%

Performance Evaluation of Large Language Models in Bangla Consumer Health Query Summarization

Ajwad Abrar, Farzana Tabassum, Sabbir Ahmed

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23231 2025-09-16 cs.SE cs.AI 88%

CCCI: Code Completion with Contextual Information for Complex Data Transfer Tasks Using Large Language Models

Hangzhan Jin, Mohammad Hamdaqa

机构 * PolyTechnique Montréal(蒙特利尔理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments The 29th International Conference on Evaluation and Assessment in Software Engineering

Journal ref The 29th International Conference on Evaluation and Assessment in Software Engineering (EASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09918 2025-09-15 cs.SE cs.AI 88%

WALL: A Web Application for Automated Quality Assurance using Large Language Models

Seyed Moein Abtahi, Akramul Azim

机构 * Faculty of Engineering(工程学院) Applied Science Ontario Tech University(应用科学Ontario技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20241 2025-09-15 cs.CL 88%

Reframe Your Life Story: Interactive Narrative Therapist and Innovative Moment Assessment with Large Language Models

Yi Feng, Jiaqi Wang, Wenxuan Zhang, Zhuang Chen, Yutong Shen, Xiyao Xiao, Minlie Huang, Liping Jing, Jian Yu

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通大数据挖掘与具身智能重点实验室) Beijing Jiaotong University(北京交通大学) CoAI Group(CoAI集团) DCST(国防科技大学) IAI(人工智能院) BNRIST(北航机器人与智能技术研究院) Tsinghua University(清华大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Singapore University of Technology and Design(新加坡科技与设计大学) Central South University(中南大学) Lingxin AI(灵犀AI)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09229 2025-09-12 cs.CL 88%

Reading Between the Lines: Classifying Resume Seniority with Large Language Models

Matan Cohen, Shira Shani, Eden Menahem, Yehudit Aperstein, Alexander Apartsin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19548 2025-09-10 cs.CL cs.SD eess.AS 88%

When Large Language Models Meet Speech: A Survey on Integration Approaches

Zhengdong Yang, Shuichiro Shimizu, Yahan Yu, Chenhui Chu

机构 * Kyoto University(京都大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted at Findings of ACL 2025 (Long Paper)

Journal ref Findings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05881 2025-09-09 cs.SE cs.AI 88%

GeoAnalystBench: A GeoAI benchmark for assessing large language models for spatial analysis workflow and code generation

Qianheng Zhang, Song Gao, Chen Wei, Yibo Zhao, Ying Nie, Ziru Chen, Shijie Chen, Yu Su, Huan Sun

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) The Ohio State University(俄亥根州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 34 pages, 8 figures

Journal ref Transactions in GIS, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05315 2025-09-09 cs.RO cs.AI cs.CV 88%

Evaluation of Large Language Models for Anomaly Detection in Autonomous Vehicles

Petros Loukas, David Bassir, Savvas Chatzichristofis, Angelos Amanatiadis

机构 * Democritus University of Thrace(德米特里乌斯大学) Dongguan University of Technology(东莞理工大学) ENS-Paris-Saclay University(巴黎-萨克雷大学) Neapolis University Pafos(纳皮奥斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04866 2025-09-08 cs.CL 88%

Memorization $\neq$ Understanding: Do Large Language Models Have the Ability of Scenario Cognition?

Boxiang Ma, Ru Li, Yuanlong Wang, Hongye Tan, Xiaoli Li

机构 * School of Computer and Information Technology, Shanxi University(山西大学计算机与信息学院) Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04455 2025-09-08 cs.CL 88%

INSEva: A Comprehensive Chinese Benchmark for Large Language Models in Insurance

Shisong Chen, Qian Zhu, Wenyan Yang, Chengyi Yang, Zhong Wang, Ping Wang, Xuan Lin, Bo Xu, Daqian Li, Chao Yuan, Licai Qi, Wanqing Xu, sun zhenxing, Xin Lu, Shiqiang Xiong, Chao Chen, Haixiang Hu, Yanghua Xiao

机构 * Ant Group(蚂蚁集团) Fudan University(复旦大学) East China Normal University(东华大学) Donghua University(东华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01359 2025-09-05 cs.CL cs.SE 88%

R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models

Ken Deng, Jiaheng Liu, He Zhu, Congnan Liu, Jingxin Li, Jiakai Wang, Peng Zhao, Chenchen Zhang, Yanan Wu, Xueqiao Yin, Yuanxing Zhang, Zizheng Zhan, Wenbo Su, Bangyu Xiang, Tiezheng Ge, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02227 2025-09-03 cs.IR cs.AI physics.acc-ph 88%

Application Of Large Language Models For The Extraction Of Information From Particle Accelerator Technical Documentation

Qing Dai, Rasmus Ischebeck, Maruisz Sapinski, Adam Grycner

机构 * Google DeepMind(谷歌DeepMind) Paul Scherrer Institut(保罗·谢尔研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15000 2025-08-28 cs.CL cs.IR 88%

MDEval: Evaluating and Enhancing Markdown Awareness in Large Language Models

Zhongpu Chen, Yinfeng Liu, Long Shi, Xingyan Chen, Yu Zhao, Fuji Ren

机构 * Southwestern University of Finance and Economics(西南财经大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments WWW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22863 2025-08-27 cs.HC cs.CL 88%

Large Language Models for Depression Recognition in Spoken Language Integrating Psychological Knowledge

Yupei Li, Shuaijie Shao, Manuel Milling, Björn W. Schuller

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref Frontiers in Computer Science, Volume 7, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05873 2025-08-27 cs.CL 88%

Recognizing Limits: Investigating Infeasibility in Large Language Models

Wenbo Zhang, Zihang Xu, Hengrui Cai

机构 * University of California Irvine(加州大学尔滨分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18245 2025-08-26 cs.CL 88%

Demographic Biases and Gaps in the Perception of Sexism in Large Language Models

Judith Tavarez-Rodríguez, Fernando Sánchez-Vega, A. Pastor López-Monroy

机构 * Computer Science Department, Mathematics Research Center (CIMAT)(计算机科学系,数学研究中心(CIMAT))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments This work was presented as a poster at the Latin American Meeting in Artificial Intelligence KHIPU 2025, Santiago, Chile, March 10th - 14th 2025, https://khipu.ai/khipu2025/poster-sessions-2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17647 2025-08-26 cs.CL cs.DL cs.IR 88%

SurveyGen: Quality-Aware Scientific Survey Generation with Large Language Models

Tong Bao, Mir Tafseer Nayeem, Davood Rafiei, Chengzhi Zhang

机构 * Nanjing University of Science and Technology(南京理工大学) University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15361 2025-08-22 cs.CL 88%

A Survey on Large Language Model Benchmarks

Shiwen Ni, Guhong Chen, Shuaimin Li, Xuanang Chen, Siyi Li, Bingli Wang, Qiyao Wang, Xingjian Wang, Yifan Zhang, Liyang Fan, Chengming Li, Ruifeng Xu, Le Sun, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所) Southern University of Science and Technology(南方科技大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Shanghai University of Electric Power(上海电力大学) Shanghai AI Lab(上海人工智能实验室) South China University of Technology(华南理工大学) Shenzhen University(深圳大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen University of Advanced Technology(深圳大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16622 2025-08-22 cs.CL 88%

Leveraging Large Language Models for Explainable Activity Recognition in Smart Homes: A Critical Evaluation

Michele Fiori, Gabriele Civitarese, Priyankar Choudhary, Claudio Bettini

机构 * EveryWare Lab, Dept. of Computer Science, University of Milan(米兰大学计算机科学系EveryWare实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13938 2025-08-20 cs.CL cs.CV 88%

MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models

Jiacheng Ruan, Dan Jiang, Xian Gao, Ting Liu, Yuzhuo Fu, Yangyang Kang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13206 2025-08-20 cs.CL 88%

BQA: Body Language Question Answering Dataset for Video Large Language Models

Shintaro Ozaki, Kazuki Hayashi, Miyu Oba, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to ACL2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10368 2025-08-15 cs.CL 88%

Large Language Models for Summarizing Czech Historical Documents and Beyond

Václav Tran, Jakub Šmíd, Jiří Martínek, Ladislav Lenc, Pavel Král

机构 * Department of Computer Science and Engineering, University of West Bohemia in Pilsen(计算机科学与工程系,西波西米亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Published in Proceedings of the 17th International Conference on Agents and Artificial Intelligence - Volume 2 (ICAART 2025). Official version: https://www.scitepress.org/Link.aspx?doi=10.5220/0013374100003890

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10007 2025-08-15 cs.CL stat.ME 88%

Automated scoring of the Ambiguous Intentions Hostility Questionnaire using fine-tuned large language models

Y. Lyu, D. Combs, D. Neumann, Y. C. Leong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments We have no known conflict of interest

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09101 2025-08-13 cs.CL cs.SE 88%

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Jason Chou, Ao Liu, Yuchi Deng, Zhiying Zeng, Tao Zhang, Haotian Zhu, Jianwei Cai, Yue Mao, Chenchen Zhang, Lingyun Tan, Ziyan Xu, Bohui Zhai, Hengyi Liu, Speed Zhu, Wiggin Zhou, Fengzong Lian

机构 * Hunyuan Team, Tencent(腾讯文心团队)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Homepage: https://autocodebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07766 2025-08-12 cs.CV cs.AI 88%

UniSVG: A Unified Dataset for Vector Graphic Understanding and Generation with Multimodal Large Language Models

Jinke Li, Jiarui Yu, Chenxing Wei, Hande Dong, Qiang Lin, Liangjing Yang, Zhicai Wang, Yanbin Hao

机构 * Zhejiang University(浙江大学) Tencent(腾讯) Shenzhen University(深圳大学) Hefei University of Technology(合肥工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted at ACM MM 2025 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07753 2025-08-12 cs.CL 88%

Exploring Causal Effect of Social Bias on Faithfulness Hallucinations in Large Language Models

Zhenliang Zhang, Junzhe Zhang, Xinyu Hu, HuiXuan Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted by CIKM 2025 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12962 2025-08-12 cs.CL cs.SD eess.AS 88%

CLAIR-A: Leveraging Large Language Models to Judge Audio Captions

Tsung-Han Wu, Joseph E. Gonzalez, Trevor Darrell, David M. Chan

机构 * Department of Electrical Engineering and Computer Science (EECS)(电气工程与计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to ASRU 2025; Code is publicly available at https://github.com/DavidMChan/clair-a

详情

展开后加载摘要…

URL PDF HTML 收藏