arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-23 至 2025-09-23 共收录 350 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 90 篇

2509.16679 2025-09-23 cs.CL 92%

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle

Keliang Liu, Dingkang Yang, Ziyun Qian, Weijie Yin, Yuchi Wang, Hongsheng Li, Jun Liu, Peng Zhai, Yang Liu, Lihua Zhang

机构 * Fudan University(复旦大学) The Chinese University of Hong Kong, MMLab(香港中文大学MMLab) Lancaster University(兰卡斯特大学) Tongji University(同济大学) The University of Toronto(多伦多大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title,abstract);分类 cs.CL

Comments A Survey of Reinforcement Learning for Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17276 2025-09-23 cs.CL cs.AI cs.LG 90%

Probabilistic Token Alignment for Large Language Model Fusion

Runjia Zeng, James Chenhao Liang, Cheng Han, Zhiwen Cao, Jiahao Liu, Xiaojun Quan, Yingjie Victor Chen, Lifu Huang, Tong Geng, Qifan Wang, Dongfang Liu

机构 * Rochester Institute of Technology(罗切斯特理工学院) U.S. Naval Research Laboratory(美国海军研究实验室) University of Missouri-Kansas City(密苏里大学-Kansas城分校) Adobe(Adobe公司) Meituan(美团) Sun Yat-sen University(孙中山大学) Purdue University(普渡大学) UC Davis(加州大学戴维斯分校) University of Rochester(罗切斯特大学) Rice University(莱斯大学) Meta AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20099 2025-09-23 cs.CL cs.AI cs.IR 90%

Large Language Models Meet Knowledge Graphs for Question Answering: Synthesis and Opportunities

Chuangtao Ma, Yongrui Chen, Tianxing Wu, Arijit Khan, Haofen Wang

机构 * Aalborg University(奥尔堡大学) Southeast University(东南大学) Bowling Green State University(布雷恩特绿色州立大学) Tongji University(同济大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08498 2025-09-23 cs.CL cs.AI 90%

LCES: Zero-shot Automated Essay Scoring via Pairwise Comparisons Using Large Language Models

Takumi Shibata, Yuichi Miyamura

机构 * Deloitte Analytics R&D(德勤分析研究与开发)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16610 2025-09-23 cs.CL 89%

LLMsPark: A Benchmark for Evaluating Large Language Models in Strategic Gaming Contexts

Junhao Chen, Jingbo Sun, Xiang Li, Haidong Xin, Yuhao Xue, Yibin Xu, Hao Zhao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Tongji University(同济大学) AIR, Tsinghua University(清华大学人工智能研究院) BAAI(百度人工智能研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11528 2025-09-23 cs.AI 89%

A Survey of Personalized Large Language Models: Progress and Future Directions

Jiahong Liu, Zexuan Qiu, Zhongyang Li, Quanyu Dai, Wenhao Yu, Jieming Zhu, Minda Hu, Menglin Yang, Tat-Seng Chua, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co., Ltd(华为技术有限公司) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

Comments 34 pages, 8 figures, 7 tables, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16330 2025-09-23 cs.AI 89%

Generalizability of Large Language Model-Based Agents: A Comprehensive Survey

Minxing Zhang, Yi Yang, Roy Xie, Bhuwan Dhingra, Shuyan Zhou, Jian Pei

机构 * Duke University(杜克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12459 2025-09-23 cs.CL cs.AI cs.LG 89%

Large Language Models Badly Generalize across Option Length, Problem Types, and Irrelevant Noun Replacements

Guangxiang Zhao, Saier Hu, Xiaoqi Jian, Jinzhu Wu, Yuhan Wu, Change Jia, Lin Sun, Xiangzheng Zhang

机构 * Qiyuan Tech(奇源科技) Zhinao(360智脑) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18172 2025-09-23 cs.CL cs.AI 88%

Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering

Zixin Chen, Sicheng Song, Kashun Shum, Yanna Lin, Rui Sheng, Weiqi Wang, Huamin Qu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 34 pages in total, EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08406 2025-09-23 cs.HC cs.CL cs.LG math.OC 88%

OptiChat: Bridging Optimization Models and Practitioners with Large Language Models

Hao Chen, Gonzalo Esteban Constante-Flores, Krishna Sri Ipsit Mantri, Sai Madhukiran Kompalli, Akshdeep Singh Ahluwalia, Can Li

机构 * Davidson School of Chemical Engineering(大卫逊化学工程学院) Purdue University(普渡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17938 2025-09-23 cs.CL 88%

D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models

Satyapriya Krishna, Andy Zou, Rahul Gupta, Eliot Krzysztof Jones, Nick Winter, Dan Hendrycks, J. Zico Kolter, Matt Fredrikson, Spyros Matsoukas

机构 * Amazon Nova Responsible AI(亚马逊Nova负责任的人工智能) Center for AI Safety(人工智能安全中心) CMU(卡内基梅隆大学) Gray Swan AI(灰天鹅人工智能)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16268 2025-09-23 cs.SE cs.AI 87%

Digging Into the Internal: Causality-Based Analysis of LLM Function Calling

Zhenlan Ji, Daoyuan Wu, Wenxuan Wang, Pingchuan Ma, Shuai Wang, Lei Ma

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10572 2025-09-23 cs.SE cs.AI cs.DB 86%

Quality Assessment of Tabular Data using Large Language Models and Code Generation

Ashlesha Akella, Akshar Kaul, Krishnasuri Narayanam, Sameep Mehta

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16686 2025-09-23 cs.CL 86%

NILE: Internal Consistency Alignment in Large Language Models

Minda Hu, Qiyuan Zhang, Yufei Wang, Bowei He, Hongru Wang, Jingyan Zhou, Liangyou Li, Yasheng Wang, Chen Ma, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments This work has been accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00367 2025-09-23 cs.CL cs.AI 86%

KoACD: The First Korean Adolescent Dataset for Cognitive Distortion Analysis via Role-Switching Multi-LLM Negotiation

JunSeo Kim, HyeHyeon Kim

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16394 2025-09-23 cs.CL cs.AI cs.HC 86%

Evaluating Behavioral Alignment in Conflict Dialogue: A Multi-Dimensional Comparison of LLM Agents and Humans

Deuksin Kwon, Kaleen Shrestha, Bin Han, Elena Hayoung Lee, Gale Lucas

机构 * University of Southern California(南加州大学) USC for Institute of Creative Technologies(南加州大学创意技术研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17436 2025-09-23 cs.CL 85%

MedFact: A Large-scale Chinese Dataset for Evidence-based Medical Fact-checking of LLM Responses

Tong Chen, Zimu Wang, Yiyi Miao, Haoran Luo, Yuanfei Sun, Wei Wang, Zhengyong Jiang, Procheta Sen, Jionglong Su

机构 * School of AI and Advanced Computing, Xi’an Jiaotong-Liverpool University, China(人工智能与高级计算学院,西安交通大学利物浦大学,中国) School of Advanced Technology, Xi’an Jiaotong-Liverpool University, China(先进技术学院,西安交通大学利物浦大学,中国) Department of Computer Science, University of Liverpool, United Kingdom(计算机科学系,利物浦大学,英国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16861 2025-09-23 cs.CR cs.AI cs.SE 85%

AdaptiveGuard: Towards Adaptive Runtime Safety for LLM-Powered Software

Rui Yang, Michael Fu, Chakkrit Tantithamthavorn, Chetan Arora, Gunel Gulmammadova, Joey Chua

机构 * Monash University(墨尔本大学) The University of Melbourne(墨尔本大学) Transurban

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted to the ASE 2025 International Conference on Automated Software Engineering, Industry Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12797 2025-09-23 cs.PF cs.LG 85%

CEBench: A Benchmarking Toolkit for the Cost-Effectiveness of LLM Pipelines

Wenbo Sun, Jiaqi Wang, Qiming Guo, Ziyu Li, Wenlu Wang, Rihan Hai

机构 * Delft University of Technology(代尔夫特理工大学) Texas A&M University - Corpus Christi(德克萨斯A&M大学-科罗萨多)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17335 2025-09-23 cs.SE 85%

BASFuzz: Towards Robustness Evaluation of LLM-based NLP Software via Automated Fuzz Testing

Mingxuan Xiao, Yan Xiao, Shunhui Ji, Jiahe Tu, Pengcheng Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16920 2025-09-23 cs.RO cs.HC 85%

SwarmChat: An LLM-Based, Context-Aware Multimodal Interaction System for Robotic Swarms

Ettilla Mohiuddin Eumi, Hussein Abbass, Nadine Marcus

机构 * School of Systems & Computing, UNSW Canberra(系统与计算学院,UNSW堪培拉) School of Computer Science and Engineering, UNSW Sydney(计算机科学与工程学院,UNSW悉尼)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments This paper has been accepted and presented at the 16th International Conference on Swarm Intelligence (ICSI 2025), held on July 11-15, 2025, in Yokohama, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16784 2025-09-23 cs.HC 85%

Controlled Yet Natural: A Hybrid BDI-LLM Conversational Agent for Child Helpline Training

Mohammed Al Owayyed, Adarsh Denga, Willem-Paul Brinkman

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Journal ref ACM International Conference on Intelligent Virtual Agents (IVA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09043 2025-09-23 cs.CL cs.AI cs.MA 84%

Stated Preference for Interaction and Continued Engagement (SPICE): Evaluating an LLM's Willingness to Re-engage in Conversation

Thomas Manuel Rost, Martina Figlia, Bernd Wallraff

机构 * Thomas Rost(未知) Martina Figlia(未知) Bernd Wallraff(未知)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Added link to GitHub and Bayesian Analysis Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03823 2025-09-23 cs.CV cs.AI cs.CL cs.MM 84%

Both Text and Images Leaked! A Systematic Analysis of Data Contamination in Multimodal LLM

Dingjie Song, Sicheng Lai, Mingxuan Wang, Shunian Chen, Lichao Sun, Benyou Wang

机构 * Lehigh University(莱维大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16332 2025-09-23 cs.AI cs.CL 84%

Psychometric Personality Shaping Modulates Capabilities and Safety in Language Models

Stephen Fitz, Peter Romero, Steven Basart, Sipeng Chen, Jose Hernandez-Orallo

机构 * Keio University(keio大学) Universitat Politècnica de València(巴塞罗那理工大学) Center for AI Safety(人工智能安全中心) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17589 2025-09-23 cs.AI 83%

Table2LaTeX-RL: High-Fidelity LaTeX Code Generation from Table Images via Reinforced Multimodal Language Models

Jun Ling, Yao Qi, Tao Huang, Shibo Zhou, Yanqin Huang, Jiang Yang, Ziqi Song, Ying Zhou, Yang Yang, Heng Tao Shen, Peng Wang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Research Center for Scientific Data Hub, Zhejiang Lab, Hangzhou, China(浙江实验室科学数据中心研究中心) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17974 2025-09-23 cs.CL cs.CV 83%

Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts

Xuyang Wu, Yuan Wang, Hsin-Tai Wu, Zhiqiang Tao, Yi Fang

机构 * Santa Clara University(圣克拉拉大学) DOCOMO Innovations, Inc.(DOCOMO创新公司) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL

Comments EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17353 2025-09-23 cs.AI eess.IV physics.med-ph 82%

Medical AI Consensus: A Multi-Agent Framework for Radiology Report Generation and Evaluation

Ahmed T. Elboardy, Ghada Khoriba, Essam A. Rashed

机构 * Graduate School of Information Science, University of Hyogo(京都大学垣田学园信息科学研究生院) Center for Informatics Science, School of Information Technology and Computer Science, Nile University(尼罗大学信息科学中心)

专题命中 评测与基准 :LLM(abstract,comments);large language model(abstract);language model(abstract);pretraining(abstract)

Comments NeurIPS2025 Workshop: Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17240 2025-09-23 cs.AI cs.CL cs.LG cs.MA 82%

Can Agents Judge Systematic Reviews Like Humans? Evaluating SLRs with LLM-based Multi-Agent System

Abdullah Mushtaq, Muhammad Rafay Naeem, Ibrahim Ghaznavi, Alaa Abd-alrazaq, Aliya Tabassum, Junaid Qadir

机构 * Department of Computer Science(计算机科学系) Information Technology University(信息技术大学) AI Center for Precision Health(精准健康人工智能中心) Weill Cornell Medicine–Qatar(韦尔·科恩医学中心–卡塔尔) Computer Science and Engineering Department(计算机科学与工程系)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16671 2025-09-23 cs.CR 82%

"Digital Camouflage": The LLVM Challenge in LLM-Based Malware Detection

Ekin Böke, Simon Torka

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏