arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-01 至 2025-10-01 共收录 274 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 57 篇

2505.13355 2025-10-01 cs.AI 89%

Survey: Multi-Armed Bandits Meet Large Language Models

Djallel Bouneffouf, Raphael Feraud

机构 * IBM Research(IBM研究院) Orange Lab(Orange实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26111 2025-10-01 cs.SE 89%

A Multi-Language Object-Oriented Programming Benchmark for Large Language Models

Shuai Wang, Liang Ding, Li Shen, Yong Luo, Han Hu, Lefei Zhang, Fu Lin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25240 2025-10-01 cs.LG cs.AI cs.CL 89%

HAMMER: Hamiltonian Curiosity Augmented Large Language Model Reinforcement

Ming Yang, Xiaofan Li, Zhiyuan Ma, Dengliang Shi, Jintao Du, Yu Cheng, Weiguo Zheng

机构 * Fudan University(复旦大学) Tiansuan Lab, Ant Group Co., Ltd.(蚂蚁集团天算实验室) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 20 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09897 2025-10-01 cs.CE 89%

Finetuning Large Language Model as an Effective Symbolic Regressor

Yingfan Hua, Ruikun Li, Jun Yao, Guohang Zhuang, Shixiang Tang, Bin Liu, Wanli Ouyang, Yan Lu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25922 2025-10-01 cs.AI cs.CL 88%

DeepJSONEval: Benchmarking Complex Nested JSON Data Mining for Large Language Models

Zhicheng Zhou, Jing Li, Suming Qiu, Junjie Huang, Linyuan Qiu, Zhijie Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13614 2025-10-01 cs.CL cs.AI 88%

Linguistic and Embedding-Based Profiling of Texts generated by Humans and Large Language Models

Sergio E. Zanotto, Segun Aroyehun

机构 * Department of Politics and Public Administration University of Konstanz(政治与公共管理系 康斯坦茨大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments arXiv admin note: text overlap with arXiv:2412.03025

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20862 2025-10-01 cs.CV 88%

AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding

Chaeyoung Jung, Youngjoon Jang, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00083 2025-10-01 cs.SE cs.AI cs.CL cs.LG 87%

A Survey on Code Generation with LLM-based Agents

Yihong Dong, Xue Jiang, Jiaru Qian, Tian Wang, Kechi Zhang, Zhi Jin, Ge Li

机构 * School of Computer Science, Peking University(计算机科学学院,北京大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress (V2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26128 2025-10-01 cs.AI 86%

MEDAKA: Construction of Biomedical Knowledge Graphs Using Large Language Models

Asmita Sengupta, David Antony Selby, Sebastian Josef Vollmer, Gerrit Großmann

机构 * Department of Data Science and its Applications, German Research Center for Artificial Intelligence (DFKI GmbH)(数据科学及其应用系,德国人工智能研究中心(DFKI GmbH)) Department of Computer Science, University of Kaiserslautern–Landau (RPTU)(计算机科学系,凯撒斯劳滕-兰道大学(RPTU))

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

Comments 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25818 2025-10-01 cs.CV cs.AI cs.CL 86%

VELA: An LLM-Hybrid-as-a-Judge Approach for Evaluating Long Image Captions

Kazuki Matsuda, Yuiga Wada, Shinnosuke Hirano, Seitaro Otsuki, Komei Sugiura

机构 * Keio University(庆应大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25248 2025-10-01 cs.SE cs.AI cs.PL 85%

BuildBench: Benchmarking LLM Agents on Compiling Real-World Open-Source Software

Zehua Zhang, Ati Priya Bajaj, Divij Handa, Siyu Liu, Arvind S Raj, Hongkai Chen, Hulin Wang, Yibo Liu, Zion Leonahenahe Basque, Souradip Nath, Vishal Juneja, Nikhil Chapre, Yan Shoshitaishvili, Adam Doupé, Chitta Baral, Ruoyu Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25491 2025-10-01 cs.HC 85%

LLM-Assisted News Discovery in High-Volume Information Streams: A Case Study

Nick Hagar, Ethan Silver, Clare Spencer, Nicholas Diakopoulos

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted to Computation + Journalism Symposium 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25281 2025-10-01 cond-mat.mtrl-sci cs.LG 81%

Mechanisms of Matter: Language Inferential Benchmark on Physicochemical Hypothesis in Materials Synthesis

Yingming Pu, Tao Lin, Hongyu Chen

机构 * Westlake University(西湖大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21500 2025-10-01 cs.CV cs.AI cs.CL 81%

ViewSpatial-Bench: Evaluating Multi-perspective Spatial Localization in Vision-Language Models

Dingming Li, Hongxing Li, Zixuan Wang, Yuchen Yan, Hang Zhang, Siqi Chen, Guiyang Hou, Shengpei Jiang, Wenqi Zhang, Yongliang Shen, Weiming Lu, Yueting Zhuang

机构 * Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Project: https://zju-real.github.io/ViewSpatial-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01332 2025-10-01 cs.CL cs.AI 81%

Answer, Refuse, or Guess? Investigating Risk-Aware Decision Making in Language Models

Cheng-Kuang Wu, Zhi Rui Tam, Chieh-Yen Lin, Yun-Nung Chen, Hung-yi Lee

机构 * Appier AI Research(Appier人工智能研究院) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13425 2025-10-01 cs.CR cs.CL cs.LG 81%

Watermark under Fire: A Robustness Evaluation of LLM Watermarking

Jiacheng Liang, Zian Wang, Lauren Hong, Shouling Ji, Ting Wang

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

Comments 25 pages. Accepted by The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25873 2025-10-01 cs.AI cs.CL cs.LG cs.PL cs.SE 80%

Lita: Light Agent Uncovers the Agentic Coding Capabilities of LLMs

Hankun Dai, Maoquan Wang, Mengnan Qi, Yikai Zhang, Zijian Jin, Yongqiang Yao, Yufan Huang, Shengyu Fu, Elsie Nallipogu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17521 2025-10-01 cs.LG cs.AI cs.CL 80%

Recent Advances in Large Langauge Model Benchmarks against Data Contamination: From Static to Dynamic Evaluation

Simin Chen, Yiming Chen, Zexin Li, Yifan Jiang, Zhongwei Wan, Yixin He, Dezhi Ran, Tianle Gu, Haizhou Li, Tao Xie, Baishakhi Ray

机构 * Columbia University(哥伦比亚大学) National University of Singapore(国立新加坡大学) University of California, Riverside(加州大学河滨分校) University of Southern California(南加州大学) The Ohio State University(俄亥俄州立大学) Peking University(北京大学) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Github Link: https://github.com/SeekingDream/Static-to-Dynamic-LLMEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25673 2025-10-01 cs.CL 79%

Mitigating Biases in Language Models via Bias Unlearning

Dianqing Liu, Yi Liu, Guoqing Jin, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Communication Content Cognition, People’s Daily Online(通信内容认知国家重点实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments EMNLP 2025 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24116 2025-10-01 cs.CL 79%

Dual-Scale World Models for LLM Agents Towards Hard-Exploration Problems

Minsoo Kim, Seung-won Hwang

机构 * Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26103 2025-10-01 cs.CL cs.AI 79%

End-to-End Aspect-Guided Review Summarization at Scale

Ilya Boytsov, Vinny DeGenova, Mikhail Balyasin, Joseph Walt, Caitlin Eusden, Marie-Claire Rochat, Margaret Pierson

机构 * Wayfair

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Camera-ready preprint for EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25903 2025-10-01 cs.CL cs.AI 79%

PerQ: Efficient Evaluation of Multilingual Text Personalization Quality

Dominik Macko, Andrew Pulver

机构 * Kempelen Institute of Intelligent Technologies(克姆佩尔智能技术研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00751 2025-10-01 cs.LG cs.AI cs.CR 79%

Fast Exact Unlearning for In-Context Learning Data for LLMs

Andrei I. Muresanu, Anvith Thudi, Michael R. Zhang, Nicolas Papernot

机构 * Department of Computer Science, University of Waterloo, Waterloo, Canada(滑铁卢大学计算机科学系) Department of Computer Science, University of Toronto, Toronto, Canada(多伦多大学计算机科学系) Vector Institute, Toronto, Canada(向量研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26223 2025-10-01 q-bio.GN 78%

Nephrobase Cell+: Multimodal Single-Cell Foundation Model for Decoding Kidney Biology

Chenyu Li, Elias Ziyadeh, Yash Sharma, Bernhard Dumoulin, Jonathan Levinsohn, Eunji Ha, Siyu Pan, Vishwanatha Rao, Madhav Subramaniyam, Mario Szegedy, Nancy Zhang, Katalin Susztak

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25676 2025-10-01 cs.SE 78%

Explainable Fault Localization for Programming Assignments via LLM-Guided Annotation

Fang Liu, Tianze Wang, Li Zhang, Zheyu Yang, Jing Jiang, Zian Sun

专题命中 评测与基准 :LLM(title,abstract)

Comments Accepted by ASE'2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26205 2025-10-01 cs.AI 77%

Human-Centered Evaluation of RAG outputs: a framework and questionnaire for human-AI collaboration

Aline Mangold, Kiran Hoffmann

机构 * Dresden University of Technology(德累斯顿技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25672 2025-10-01 cs.AI cs.DB 77%

SING-SQL: A Synthetic Data Generation Framework for In-Domain Text-to-SQL Translation

Hasan Alp Caferoğlu, Mehmet Serhat Çelik, Özgür Ulusoy

机构 * Bilkent University(比尔肯特大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);post-training(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09993 2025-10-01 cs.CL 77%

Agent-as-Judge for Factual Summarization of Long Narratives

Yeonseok Jeong, Minsoo Kim, Seung-won Hwang, Byung-Hak Kim

机构 * IPAI, Seoul National University(IPAI,首尔国立大学) Seoul National University(首尔国立大学) Hyundai Card(现代卡)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25654 2025-10-01 cs.CV 75%

DescribeEarth: Describe Anything for Remote Sensing Images

Kaiyu Li, Zixuan Jiang, Xiangyong Cao, Jiayu Wang, Yuchen Xiao, Deyu Meng, Zhi Wang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) School of Computer Science and Technology and Ministry of Education Key Lab For Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院和教育部智能网络与网络安全重点实验室) School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学院和教育部智能网络与网络安全重点实验室) Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(琶洲实验室(黄埔),广州,广东,中国)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00894 2025-10-01 cs.LG cs.AI cs.CL 75%

Pretrained Hybrids with MAD Skills

Nicholas Roberts, Samuel Guo, Zhiqi Gao, Satya Sai Srinath Namburi GNVV, Sonia Cromp, Chengjun Wu, Chengyu Duan, Frederic Sala

机构 * UniversityofWisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏