arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2508.06595 2025-10-08 cs.CL cs.AI cs.LG 87%

LLM Unlearning Without an Expert Curated Dataset

Xiaoyuan Zhu, Muru Zhang, Ollie Liu, Robin Jia, Willie Neiswanger

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04950 2025-10-07 cs.CL cs.AI cs.LG cs.NE stat.ME 87%

Mind Your Tone: Investigating How Prompt Politeness Affects LLM Accuracy (short paper)

Om Dobariya, Akhil Kumar

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

Comments 5 pages, 3 tables; includes Limitations and Ethical Considerations sections; short paper under submission to Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10127 2025-10-07 cs.CL cs.AI cs.LG 87%

Population-Aligned Persona Generation for LLM-based Social Simulation

Zhengyu Hu, Jianxun Lian, Zheyuan Xiao, Max Xiong, Yuxuan Lei, Tianfu Wang, Kaize Ding, Ziang Xiao, Nicholas Jing Yuan, Xing Xie

机构 * HKUST(香港科技大学) Microsoft Research Asia(微软亚洲研究院) Duke University(杜克大学) Northwestern University(西北大学) Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00083 2025-10-01 cs.SE cs.AI cs.CL cs.LG 87%

A Survey on Code Generation with LLM-based Agents

Yihong Dong, Xue Jiang, Jiaru Qian, Tian Wang, Kechi Zhang, Zhi Jin, Ge Li

机构 * School of Computer Science, Peking University(计算机科学学院,北京大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress (V2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22376 2025-09-30 cs.LG cs.AI cs.CL cs.CV 87%

Rare-to-Frequent: Unlocking Compositional Generation Power of Diffusion Models on Rare Concepts with LLM Guidance

Dongmin Park, Sebin Kim, Taehong Moon, Minkyu Kim, Kangwook Lee, Jaewoong Cho

机构 * KRAFTON Seoul National University(首尔国立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14624 2025-09-19 cs.CL cs.AI cs.LG 87%

Reveal and Release: Iterative LLM Unlearning with Self-generated Data

Linxi Xie, Xin Teng, Shichang Ke, Hongyi Wen, Shengjie Wang

机构 * New York University Shanghai(纽约大学上海)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10682 2025-09-16 cs.CR cs.AI cs.CL cs.ET cs.LG 87%

LLM in the Middle: A Systematic Review of Threats and Mitigations to Real-World LLM-based Systems

Vitor Hugo Galhardo Moia, Igor Jochem Sanz, Gabriel Antonio Fontes Rebello, Rodrigo Duarte de Meneses, Briland Hitaj, Ulf Lindqvist

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 37 pages, 8 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09912 2025-09-15 cs.CY cs.CR 87%

When Your Reviewer is an LLM: Biases, Divergence, and Prompt Injection Risks in Peer Review

Changjia Zhu, Junjie Xiong, Renkai Ma, Zhicong Lu, Yao Liu, Lingyao Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09740 2025-09-15 q-bio.QM cs.AI cs.CL cs.LG 87%

HypoGeneAgent: A Hypothesis Language Agent for Gene-Set Cluster Resolution Selection Using Perturb-seq Datasets

Ying Yuan, Xing-Yue Monica Ge, Aaron Archer Waterman, Tommaso Biancalani, David Richmond, Yogesh Pandit, Avtar Singh, Russell Littman, Jin Liu, Jan-Christian Huetter, Vladimir Ermakov

专题命中 评测与基准 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07389 2025-09-10 cs.CL cs.AI cs.HC cs.LG 87%

Talking with Oompa Loompas: A novel framework for evaluating linguistic acquisition of LLM agents

Sankalp Tattwadarshi Swain, Anshika Krishnatray, Dhruv Kumar, Jagat Sesh Challa

机构 * BITS Pilani(比特兰学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12226 2025-09-09 cs.CL cs.AI cs.CV cs.LG 87%

AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling

Jun Zhan, Junqi Dai, Jiasheng Ye, Yunhua Zhou, Dong Zhang, Zhigeng Liu, Xin Zhang, Ruibin Yuan, Ge Zhang, Linyang Li, Hang Yan, Jie Fu, Tao Gui, Tianxiang Sun, Yu-Gang Jiang, Xipeng Qiu

机构 * Fudan University(复旦大学) Multimodal Art Projection Research Community(多模态艺术投影研究社区) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages, 16 figures, under review, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17967 2025-09-03 cs.LG cs.AI cs.CL cs.MA q-fin.ST 87%

Agent Trading Arena: A Study on Numerical Understanding in LLM-Based Agents

Tianmi Ma, Jiawei Du, Wenxin Huang, Wenjie Wang, Liang Xie, Xian Zhong, Joey Tianyi Zhou

机构 * Wuhan University of Technology(武汉理工大学) Agency for Science, Technology and Research, Singapore(新加坡科技研究局) Hubei University(湖北大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17435 2025-08-26 cs.CV 87%

An LLM-LVLM Driven Agent for Iterative and Fine-Grained Image Editing

Zihan Liang, Jiahao Sun, Haoran Ma

机构 * Kunming University of Science and Technology(昆明理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14701 2025-08-12 cs.CL cs.AI cs.HC cs.LG q-bio.NC 87%

COMPASS: Computational Mapping of Patient-Therapist Alliance Strategies with Language Modeling

Baihan Lin, Djallel Bouneffouf, Yulia Landa, Rachel Jespersen, Cheryl Corcoran, Guillermo Cecchi

机构 * Department of Artificial Intelligence and Human Health, Icahn School of Medicine at Mount Sinai(人工智能与人类健康系,伊坎医学院 Mount Sinai 分校) Department of Psychiatry, Icahn School of Medicine at Mount Sinai(精神病学系,伊坎医学院 Mount Sinai 分校) Department of Neuroscience, Icahn School of Medicine at Mount Sinai(神经科学系,伊坎医学院 Mount Sinai 分校) Berkman Klein Center for Internet & Society, Harvard University(互联网与社会研究中心,哈佛大学) IBM Research, T.J. Watson Research Center(IBM 研究,T.J. Watson 研究中心) Mental Illness Research, Education and Clinical Center, James J. Peters VA Medical Center(精神疾病研究、教育与临床中心,James J. Peters VA 医疗中心)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Translational Psychiatry, in press. This work extends our research series in computational psychiatry (e.g auto annotation in arXiv:2204.05522, topic extraction in arXiv:2204.10189, and diagnosis in arXiv:2210.15603) with the introduction of LLMs to complete the full cycle of interpreting and understanding psychotherapy strategies as a comprehensive analytical framework

Journal ref Transl Psychiatry 15, 166 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06047 2025-08-11 cs.AR 87%

ArchXBench: A Complex Digital Systems Benchmark Suite for LLM Driven RTL Synthesis

Suresh Purini, Siddhant Garg, Mudit Gaur, Sankalp Bhat, Sohan Mupparapu, Arun Ravindran

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Published in 7th ACM/IEEE International Symposium on Machine Learning for CAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03558 2025-08-06 cs.PL 87%

SAGE-HLS: Syntax-Aware AST-Guided LLM for High-Level Synthesis Code Generation

M Zafir Sadik Khan, Nowfel Mashnoor, Mohammad Akyash, Kimia Azar, Hadi Kamali

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to the IEEE International Conference on Computer Design (ICCD 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18203 2025-08-04 cs.HC cs.AI cs.CL cs.LG 87%

Policy Maps: Tools for Guiding the Unbounded Space of LLM Behaviors

Michelle S. Lam, Fred Hohman, Dominik Moritz, Jeffrey P. Bigham, Kenneth Holstein, Mary Beth Kery

机构 * Stanford University(斯坦福大学) Apple(苹果公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments UIST 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18392 2025-07-25 cs.CL cs.AI cs.LG 87%

CLEAR: Error Analysis via LLM-as-a-Judge Made Easy

Asaf Yehudai, Lilach Eden, Yotam Perlitz, Roy Bar-Haim, Michal Shmueli-Scheuer

机构 * IBM Research(IBM研究院) The Hebrew University of Jerusalem(特拉维夫大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00838 2025-07-25 cs.CL cs.AI cs.LG 87%

Stylometry recognizes human and LLM-generated texts in short samples

Karol Przystalski, Jan K. Argasiński, Iwona Grabska-Gradzińska, Jeremi K. Ochab

机构 * Sano -- Centre for Computational Medicine(Sano计算医学中心) Faculty of Physics, Astronomy and Applied Computer Science(物理学、天文学与应用计算机科学学院) Applied Computer Science, Jagiellonian University(应用计算机科学,雅盖隆大学) Mark Kac Centre for Complex Systems Research(Mark Kac复杂系统研究中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref Expert Systems with Applications 296, 129001 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09490 2025-07-15 cs.SE 87%

Towards LLM-Based Automatic Playtest

Yan Zhao, Chiwei Tang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09488 2025-07-15 cs.IR 87%

Criteria-Based LLM Relevance Judgments

Naghmeh Farzi, Laura Dietz

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 10 pages, 3 figures, accepted to ICTIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02966 2025-07-10 cs.CL cs.AI cs.CR cs.LG 87%

PBa-LLM: Privacy- and Bias-aware NLP using Named-Entity Recognition (NER)

Gonzalo Mancera, Aythami Morales, Julian Fierrez, Ruben Tolosana, Alejandro Penna, Miguel Lopez-Duran, Francisco Jurado, Alvaro Ortigosa

机构 * Biometrics and Data Pattern Analytics Lab(生物识别与数据模式分析实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Presented at AAAI Workshop on Privacy-Preserving Artificial Intelligence (PPAI) 2025, Philadelphia, PA, USA, March 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17172 2025-07-09 cs.CL cs.AI cs.LG 87%

What Would You Ask When You First Saw $a^2+b^2=c^2$? Evaluating LLM on Curiosity-Driven Questioning

Shashidhar Reddy Javaji, Zining Zhu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref 2nd AI4Research Workshop: Towards a Knowledge-grounded Scientific Research Lifecycle, AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09605 2025-07-08 cs.CL cs.AI cs.LG 87%

Elements of World Knowledge (EWoK): A Cognition-Inspired Framework for Evaluating Basic World Knowledge in Language Models

Anna A. Ivanova, Aalok Sathe, Benjamin Lipkin, Unnathi Kumar, Setayesh Radkani, Thomas H. Clark, Carina Kauf, Jennifer Hu, R. T. Pramod, Gabriel Grand, Vivian Paulun, Maria Ryskina, Ekin Akyürek, Ethan Wilcox, Nafisa Rashid, Leshem Choshen, Roger Levy, Evelina Fedorenko, Joshua Tenenbaum, Jacob Andreas

机构 * Georgia Tech(佐治亚理工学院) Johns Hopkins University(约翰霍普金斯大学) UC Berkeley(加州大学伯克利分校) Brown University(布朗大学) Vector Institute(向量研究所) MIT-IBM Watson AI(MIT-IBM沃森人工智能实验室) MIT(麻省理工学院) Georgetown University(乔治城大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to Transactions of the ACL (TACL). Contains 25 pages (14 main), 6 figures. Visit http://ewok-core.github.io for data and code. Authors Anna Ivanova, Aalok Sathe, Benjamin Lipkin contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22419 2025-07-02 cs.AI cs.CL cs.LG 87%

The Automated LLM Speedrunning Benchmark: Reproducing NanoGPT Improvements

Bingchen Zhao, Despoina Magka, Minqi Jiang, Xian Li, Roberta Raileanu, Tatiana Shavrina, Jean-Christophe Gagnon-Audet, Kelvin Niu, Shagun Sodhani, Michael Shvartsman, Andrei Lupu, Alisia Lupidi, Edan Toledo, Karen Hambardzumyan, Martin Josifoski, Thomas Foster, Lucia Cipolina-Kun, Abhishek Charnalia, Derek Dunfield, Alexander H. Miller, Oisin Mac Aodha, Jakob Foerster, Yoram Bachrach

机构 * Meta University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20803 2025-06-27 cs.CL cs.AI cs.CY cs.HC cs.LG 87%

The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research Ideas

Chenglei Si, Tatsunori Hashimoto, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments main paper is 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14948 2025-06-19 cs.HC 87%

Structured Moral Reasoning in Language Models: A Value-Grounded Evaluation Framework

Mohna Chakraborty, Lu Wang, David Jurgens

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13070 2025-06-17 cs.CL cs.AI cs.LG 87%

CHILL at SemEval-2025 Task 2: You Can't Just Throw Entities and Hope -- Make Your LLM to Get Them Right

Jaebok Lee, Yonghyun Ryu, Seongmin Park, Yoonjung Choi

机构 * Samsung Research(三星研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The 19th International Workshop on Semantic Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12266 2025-06-17 cs.CL cs.AI cs.HC cs.LG 87%

The Behavior Gap: Evaluating Zero-shot LLM Agents in Complex Task-Oriented Dialogs

Avinash Baidya, Kamalika Das, Xiang Gao

机构 * Intuit AI Research(Intuit AI研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2025; 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14074 2025-06-09 cs.AI cs.CL cs.LG 87%

Investigating Non-Transitivity in LLM-as-a-Judge

Yi Xu, Laura Ruis, Tim Rocktäschel, Robert Kirk

机构 * AI Centre, UCL(UCL人工智能中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏