arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-03 至 2025-09-03 共收录 72 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 72 篇

2404.07851 2025-09-03 cs.CL cs.AI 91%

Guiding Large Language Models to Post-Edit Machine Translation with Error Annotations

Dayeon Ki, Marine Carpuat

机构 * Computer Science University of Maryland(计算机科学大学马里兰大学) Computer Science, UMIACS University of Maryland(计算机科学,UMIACS大学马里兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments NAACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00963 2025-09-03 cs.CY cs.AI 90%

Who Gets Left Behind? Auditing Disability Inclusivity in Large Language Models

Deepika Dash, Yeshil Bangera, Mithil Bangera, Gouthami Vadithya, Srikant Panda

机构 * IBM India(IBM印度分公司) University of New Haven(新罕布什尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02514 2025-09-03 cs.CL cs.LG 90%

Comparative Study of Pre-Trained BERT and Large Language Models for Code-Mixed Named Entity Recognition

Mayur Shirke, Amey Shembade, Pavan Thorat, Madhushri Wagh, Raviraj Joshi

机构 * Dept. of Computer Engineering, Pune Institute of Computer Technology, Pune, India(计算机工程系,普那计算机技术研究所,普那,印度) Indian Institute of Technology Madras, Chennai, India(印度理工学院马德拉斯学院,钦奈,印度) L3Cube Labs, Pune, Maharashtra, India(L3Cube实验室,普那,马哈拉施特拉邦,印度)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01962 2025-09-03 cs.CL 89%

DRAssist: Dispute Resolution Assistance using Large Language Models

Sachin Pawar, Manoj Apte, Girish K. Palshikar, Basit Ali, Nitin Ramrakhiyani

机构 * TCS Research, Tata Consultancy Services Limited(塔塔咨询公司研究部)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted at the 20th International Conference on Artificial Intelligence and Law (ICAIL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00987 2025-09-03 cs.AI 89%

Causal MAS: A Survey of Large Language Model Architectures for Discovery and Effect Estimation

Adib Bazgir, Amir Habibdoust, Yuwen Zhang, Xing Song

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 24 pages. 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00630 2025-09-03 cs.SE 89%

MCeT: Behavioral Model Correctness Evaluation using Large Language Models

Khaled Ahmed, Jialing Song, Boqi Chen, Ou Wei, Bingzhou Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments MODELS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02227 2025-09-03 cs.IR cs.AI physics.acc-ph 88%

Application Of Large Language Models For The Extraction Of Information From Particle Accelerator Technical Documentation

Qing Dai, Rasmus Ischebeck, Maruisz Sapinski, Adam Grycner

机构 * Google DeepMind(谷歌DeepMind) Paul Scherrer Institut(保罗·谢尔研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01311 2025-09-03 cs.CL 87%

FactGenius: Combining Zero-Shot Prompting and Fuzzy Relation Mining to Improve Fact Verification with Knowledge Graphs

Sushant Gautam

机构 * Simula Metropolitan Center for Digital Engineering(模拟元数字工程中心)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments accepted and presented at the 6th IN5550 Workshop on Neural Natural Language Processing (WNNLP 2024) at the University of Oslo, Norway

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16682 2025-09-03 cs.CL cs.AI 87%

Automatic Input Rewriting Improves Translation with Large Language Models

Dayeon Ki, Marine Carpuat

机构 * University of Maryland(马里兰大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17967 2025-09-03 cs.LG cs.AI cs.CL cs.MA q-fin.ST 87%

Agent Trading Arena: A Study on Numerical Understanding in LLM-Based Agents

Tianmi Ma, Jiawei Du, Wenxin Huang, Wenjie Wang, Liang Xie, Xian Zhong, Joey Tianyi Zhou

机构 * Wuhan University of Technology(武汉理工大学) Agency for Science, Technology and Research, Singapore(新加坡科技研究局) Hubei University(湖北大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11452 2025-09-03 cs.AI cs.CL cs.HC 86%

Inclusion Arena: An Open Platform for Evaluating Large Foundation Models with Real-World Apps

Kangyu Wang, Hongliang He, Lin Liu, Ruiqi Liang, Zhenzhong Lan, Jianguo Li

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Our platform is publicly accessible at https://www.tbox.cn/about/model-ranking

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24671 2025-09-03 cs.CL cs.AI 86%

Multiple LLM Agents Debate for Equitable Cultural Alignment

Dayeon Ki, Rachel Rudinger, Tianyi Zhou, Marine Carpuat

机构 * University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07407 2025-09-03 cs.AI cs.CL cs.MA 86%

A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems

Jinyuan Fang, Yanwen Peng, Xi Zhang, Yingxu Wang, Xinhao Yi, Guibin Zhang, Yi Xu, Bin Wu, Siwei Liu, Zihao Li, Zhaochun Ren, Nikos Aletras, Xi Wang, Han Zhou, Zaiqiao Meng

机构 * University of Glasgow(格拉斯哥大学) University of Sheffield(谢菲尔德大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) National University of Singapore(新加坡国家大学) University of Cambridge(剑桥大学) University College London(伦敦大学学院) University of Aberdeen(阿伯丁大学) Leiden University(莱顿大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Github Repo: https://github.com/EvoAgentX/Awesome-Self-Evolving-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02363 2025-09-03 cs.CL 85%

Towards Temporal Knowledge-Base Creation for Fine-Grained Opinion Analysis with Language Models

Gaurav Negi, Atul Kr. Ojha, Omnia Zayed, Paul Buitelaar

机构 * Insight SFI Research Ireland Centre for Data Analytics, University of Galway(爱尔兰数据分析师中心,Galway大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02666 2025-09-03 cs.CL 85%

A Survey on Progress in LLM Alignment from the Perspective of Reward Design

Miaomiao Ji, Yanqiu Wu, Zhibin Wu, Shoujin Wang, Jian Yang, Mark Dras, Usman Naseem

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02198 2025-09-03 cs.CL 85%

FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain

Anum Afzal, Juraj Vladika, Florian Matthes

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01441 2025-09-03 cs.AI cs.MA 85%

LLM-empowered Agents Simulation Framework for Scenario Generation in Service Ecosystem Governance

Deyu Zhou, Yuqi Hou, Xiao Xue, Xudong Lu, Qingzhong Li, Lizhen Cui

机构 * School of Software, Shandong University(软件学院,山东大学) Joint SDU-NTU Centre for Artificial Intelligence Research (C-FAIR), Shandong University(SDU-NTU人工智能研究中心(C-FAIR),山东大学) College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Tianjin Key Laboratory of Healthy Habitat and Smart Technology(天津健康人居环境与智能技术重点实验室) Laboratory of Computation and Analytics of Complex Management Systems, Tianjin University(复杂管理系统计算与分析实验室,天津大学) ShanDa Dareway Software Co. Ltd(山东达瑞软件有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18190 2025-09-03 cs.AI cs.DB cs.IR 85%

ST-Raptor: LLM-Powered Semi-Structured Table Question Answering

Zirui Tang, Boyu Niu, Xuanhe Zhou, Boxiu Li, Wei Zhou, Jiannan Wang, Guoliang Li, Xinyi Zhang, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Simon Fraser University(西蒙弗雷泽大学) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Extension of our SIGMOD 2026 paper. Please refer to source code available at: https://github.com/weAIDB/ST-Raptor

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00273 2025-09-03 cs.CL 85%

Echoes in AI: Quantifying lack of plot diversity in LLM outputs

Weijia Xu, Nebojsa Jojic, Sudha Rao, Chris Brockett, Bill Dolan

机构 * Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments PNAS Vol. 122 No. 35. Copyright \c{opyright} 2025 the Author(s). Published by PNAS. This open access article is distributed under Creative Commons Attribution-NonCommercial-NoDerivatives License 4.0 (CC BY-NC-ND)

Journal ref Proc. Natl. Acad. Sci. U.S.A. 122 (35) e2504966122 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01590 2025-09-03 q-fin.CP 85%

Is All the Information in the Price? LLM Embeddings versus the EMH in Stock Clustering

Bingyang Wang, Grant Johnson, Maria Hybinette, Tucker Balch

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 5 pages with references

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01460 2025-09-03 cs.HC 85%

Dissecting Atomic Facts: Visual Analytics for Improving Fact Annotations in Language Model Evaluation

Manuel Schmidt, Daniel A. Keim, Frederik L. Dennig

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract)

Comments 2 pages text plus poster, 2 figures, LaTeX

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02330 2025-09-03 cs.SE cs.AI 83%

ReCode: Improving LLM-based Code Repair with Fine-Grained Retrieval-Augmented Generation

Yicong Zhao, Shisong Chen, Jiacheng Zhang, Zhixu Li

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai Institute of Artificial Intelligence for Education(教育人工智能研究所) East China Normal University(华东师范大学) School of Information, Renmin University of China(信息学院,中国人民大学) School of Smart Governance, Renmin University of China(智能治理学院,中国人民大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted by CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00069 2025-09-03 cs.LG 83%

AnomalyExplainer Explainable AI for LLM-based anomaly detection using BERTViz and Captum

Prasasthy Balasubramanian, Dumindu Kankanamge, Ekaterina Gilman, Mourad Oussalah

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07268 2025-09-03 cs.MM cs.CL cs.CV 83%

Advancing Grounded Multimodal Named Entity Recognition via LLM-Based Reformulation and Box-Based Segmentation

Jinyuan Li, Ziyan Li, Han Li, Jianfei Yu, Rui Xia, Di Sun, Gang Pan

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) NJUST(南京理工大学) College of Mathematics, Taiyuan University of Technology(数学学院,太原科技大学) Tianjin University of Science and Technology(天津科技大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments Extension of our Findings of EMNLP 2023 & ACL 2024 paper, IEEE Transactions on Multimedia accepted on July 19, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00728 2025-09-03 cs.IR cs.DB 82%

A Survey on Open Dataset Search in the LLM Era: Retrospectives and Perspectives

Pengyue Li, Sheng Wang, Hua Dai, Zhiyu Chen, Zhifeng Bao, Brian D. Davison

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01772 2025-09-03 cs.CL cs.AI 81%

chDzDT: Word-level morphology-aware language model for Algerian social media text

Abdelkrime Aries

机构 * Laboratoire de la Communication dans les Systèmes Informatiques, Ecole Nationale Supérieure d’Informatique(信息通信系统通信实验室,国家高等信息学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01554 2025-09-03 cs.CV cs.AI cs.LG 81%

Unified Supervision For Vision-Language Modeling in 3D Computed Tomography

Hao-Chih Lee, Zelong Liu, Hamza Ahmed, Spencer Kim, Sean Huver, Vishwesh Nath, Zahi A. Fayad, Timothy Deyer, Xueyan Mei

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

Comments ICCV 2025 VLM 3d Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01790 2025-09-03 cs.CL cs.AI cs.LG 80%

Flaw or Artifact? Rethinking Prompt Sensitivity in Evaluating LLMs

Andong Hua, Kenan Tang, Chenhe Gu, Jindong Gu, Eric Wong, Yao Qin

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) UC Irvine(加州大学伊尔弗雷德分校) University of Oxford(牛津大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02730 2025-09-03 cs.CV cs.CL cs.RO 79%

DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes

Zhaowei Wang, Hongming Zhang, Tianqing Fang, Ye Tian, Yue Yang, Kaixin Ma, Xiaoman Pan, Yangqiu Song, Dong Yu

机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系) Tencent AI Lab(腾讯AI实验室) Robotics X, Tencent(腾讯机器人实验室) University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00849 2025-09-03 cs.CL 79%

Prompting Away Stereotypes? Evaluating Bias in Text-to-Image Models for Occupations

Shaina Raza, Maximus Powers, Partha Pratim Saha, Mahveen Raza, Rizwan Qureshi

专题命中 评测与基准 :prompting(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏