arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-05 至 2025-11-05 共收录 42 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 42 篇

2511.02458 2025-11-05 cs.CL cs.CE econ.GN q-fin.EC 90%

Prompting for Policy: Forecasting Macroeconomic Scenarios with Synthetic LLM Personas

Giulia Iadisernia, Carolina Camassa

机构 * Banca d’Italia(意大利银行)

专题命中 评测与基准 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

Comments 9 pages, 8-pages appendix, accepted at ICAIF 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02119 2025-11-05 cs.AI cs.CL 90%

InsurAgent: A Large Language Model-Empowered Agent for Simulating Individual Behavior in Purchasing Flood Insurance

Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng, Dan M. Frangopol, Minghui Cheng

机构 * University of Miami(迈阿密大学) Hunan University(湖南大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Lehigh University(莱斯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02347 2025-11-05 cs.CL 89%

LTD-Bench: Evaluating Large Language Models by Letting Them Draw

Liuhao Lin, Ke Li, Zihan Xu, Yuchen Shi, Yulei Qin, Yan Zhang, Xing Sun, Rongrong Ji

机构 * Youtu-Agent Team(优图智能团队)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08903 2025-11-05 cs.SE 89%

Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks

Xing Hu, Feifei Niu, Junkai Chen, Xin Zhou, Junwei Zhang, Junda He, Xin Xia, David Lo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23081 2025-11-05 cs.CL 89%

A Survey on LLM Mid-Training

Chengying Tu, Xuemiao Zhang, Rongxiang Weng, Rumei Li, Chen Zhang, Yang Bai, Hongfei Yan, Jingang Wang, Xunliang Cai

机构 * Peking University(北京大学) Meituan(美团)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02593 2025-11-05 cs.LG 88%

A Large Language Model for Corporate Credit Scoring

Chitro Majumdar, Sergio Scandizzo, Ratanlal Mahanta, Avradip Mandal, Swarnendu Bhattacharjee

机构 * RsRL (R-square RiskLab)(RsRL(R-square RiskLab))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18835 2025-11-05 cs.SE 87%

AUCAD: Automated Construction of Alignment Dataset from Log-Related Issues for Enhancing LLM-based Log Generation

Hao Zhang, Dongjun Yu, Lei Zhang, Guoping Rong, Yongda Yu, Haifeng Shen, He Zhang, Dong Shao, Hongyu Kuang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments In the 16th International Conference on Internetware 2025. 13 pages

Journal ref Proceedings of the 16th International Conference on Internetware (2025) 413-425

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24450 2025-11-05 cs.CL cs.AI 86%

Charting the European LLM Benchmarking Landscape: A New Taxonomy and a Set of Best Practices

Špela Vintar, Taja Kuzman Pungeršek, Mojca Brglez, Nikola Ljubešić

机构 * Jožef Stefan Institute(乔塞夫·斯塔芬研究所) University of Ljubljana(卢布尔雅那大学) Faculty of Arts, University of Ljubljana(艺术学院,卢布尔雅那大学) Faculty of Computer and Information Science, University of Ljubljana(计算机与信息科学学院,卢布尔雅那大学) Institute of Contemporary History(现代史研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 17 pages, 1 figure, 4 tables. Submitted to the LREC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00621 2025-11-05 cs.CR cs.AI cs.CY cs.SI 85%

Exposing LLM Vulnerabilities: Adversarial Scam Detection and Performance

Chen-Wei Chang, Shailik Sarkar, Shutonu Mitra, Qi Zhang, Hossein Salemi, Hemant Purohit, Fengxiu Zhang, Michin Hong, Jin-Hee Cho, Chang-Tien Lu

机构 * Department of Computer Science, Virginia Tech, USA(维吉尼亚理工学院计算机科学系) Department of Information Sciences(信息科学系) School of Policy and Government, George Mason University, USA(乔治·马歇尔大学政策与政府学院) School of Social Work, Indiana University, USA(印第安纳大学社会工作学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 4 pages, 2024 IEEE International Conference on Big Data workshop BigEACPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02223 2025-11-05 physics.med-ph 85%

Quantitative Risk Assessment in Radiation Oncology via LLM-Powered Root Cause Analysis of Incident Reports

Yuntao Wang, Siamak P. Najad-Davarani, Elizabeth Bossart, Matthew T. Studenski, Mariluz De Ornelas, Yunze Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04633 2025-11-05 cs.NE cs.AI cs.LG q-bio.NC 84%

The Physical Basis of Prediction: World Model Formation in Neural Organoids via an LLM-Generated Curriculum

Brennen Hill

机构 * Department of Computer Science University of Wisconsin-Madison(计算机科学系 威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Published in the proceedings of the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Scaling Environments for Agents (SEA). Additionally accepted for presentation in NeurIPS 2025 Workshop: Embodied World Models for Decision Making

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02713 2025-11-05 cs.SE 82%

ReleaseEval: A Benchmark for Evaluating Language Models in Automated Release Note Generation

Qianru Meng, Zhaochun Ren, Joost Visser

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01915 2025-11-05 cs.CV eess.IV 82%

Challenging DINOv3 Foundation Model under Low Inter-Class Variability: A Case Study on Fetal Brain Ultrasound

Edoardo Conti, Riccardo Rosati, Lorenzo Federici, Adriano Mancini, Maria Chiara Fiorentin

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01854 2025-11-05 cs.CL 79%

Tool-to-Agent Retrieval: Bridging Tools and Agents for Scalable LLM Multi-Agent Systems

Elias Lumer, Faheem Nizar, Anmol Gulati, Pradeep Honaganahalli Basavaraju, Vamse Kumar Subbiah

机构 * PricewaterhouseCoopers U.S.A.(普华永道美国公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26205 2025-11-05 cs.CL cs.AI 79%

Towards Global Retrieval Augmented Generation: A Benchmark for Corpus-Level Reasoning

Qi Luo, Xiaonan Li, Tingshuo Fan, Xinchi Chen, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15112 2025-11-05 cs.CR 78%

AndroByte: LLM-Driven Privacy Analysis through Bytecode Summarization and Dynamic Dataflow Call Graph Generation

Mst Eshita Khatun, Lamine Noureddine, Zhiyong Sui, Aisha Ali-Gombe

专题命中 评测与基准 :LLM(title,abstract)

Comments Accepted at the Annual Computer Security Applications Conference (ACSAC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02794 2025-11-05 cs.AI cs.MA 77%

When One Modality Sabotages the Others: A Diagnostic Lens on Multimodal Reasoning

Chenyu Zhang, Minsol Kim, Shohreh Ghorbani, Jingyao Wu, Rosalind Picard, Patricia Maes, Paul Pu Liang

机构 * Harvard University(哈佛大学) MIT Media Lab(麻省理工学院媒体实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

Comments Accepted at the Multimodal Algorithmic Reasoning (MAR) Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01183 2025-11-05 cs.AI cs.PL 77%

QiMeng-NeuComBack: Self-Evolving Translation from IR to Assembly Code

Hainan Fang, Yuanbo Wen, Jun Bi, Yihan Wang, Tonghui He, Yanlin Tang, Di Huang, Jiaming Guo, Rui Zhang, Qi Guo, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所处理器重点实验室,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07453 2025-11-05 cs.AI 77%

How well do LLMs reason over tabular data, really?

Cornelius Wolff, Madelon Hulsebos

机构 * Centrum Wiskunde & Informatica(数学与信息学研究中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 10 pages, 4 figures

Journal ref The 4th Table Representation Learning Workshop at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01907 2025-11-05 cs.CY cs.AI cs.HC 77%

Between Myths and Metaphors: Rethinking LLMs for SRH in Conservative Contexts

Ameemah Humayun, Bushra Zubair, Maryam Mustafa

机构 * Lahore University of Management Sciences(拉合尔管理科学大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21080 2025-11-05 cs.CL 77%

EmoDebt: Bayesian-Optimized Emotional Intelligence for Strategic Agent-to-Agent Debt Recovery

Yunbo Long, Yuhan Liu, Liming Xu, Alexandra Brintrup

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16392 2025-11-05 cs.CL cs.LG 76%

Scaffolded Language Models with Language Supervision for Mixed-Autonomy: A Survey

Matthieu Lin, Jenny Sheng, Andrew Zhao, Shenzhi Wang, Yang Yue, Victor Shea Jay Huang, Huan Liu, Jun Liu, Gao Huang, Yong-Jin Liu

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(计算机科学与技术系,清华大学,北京,中国) Department of Automation, Tsinghua University, Beijing, China(自动化系,清华大学,北京,中国) Shanghai AI Lab, Shanghai, China(上海人工智能实验室,上海,中国) Xi'an Jiaotong University, Xi'an, China(西安交通大学,西安,中国)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02203 2025-11-05 cs.SE 75%

LLMs as Judges: Toward The Automatic Review of GSN-compliant Assurance Cases

Gerhard Yu, Mithila Sivakumar, Alvine B. Belle, Soude Ghari, Song Wang, Timothy C. Lethbridge

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01864 2025-11-05 cs.CY 75%

Missing the Margins: A Systematic Literature Review on the Demographic Representativeness of LLMs

Indira Sen, Marlene Lutz, Elisa Rogers, David Garcia, Markus Strohmaier

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Journal ref Findings of the Association for Computational Linguistics (ACL 2025), page 24263

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00689 2025-11-05 cs.CL 70%

Do Methods to Jailbreak and Defend LLMs Generalize Across Languages?

Berk Atil, Rebecca J. Passonneau, Fred Morstatter

机构 * Penn State University(宾夕法尼亚州立大学) Information Sciences Institute, USC(信息科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27195 2025-11-05 cs.CV cs.CL cs.SI 70%

Can MLLMs Read the Room? A Multimodal Benchmark for Verifying Truthfulness in Multi-Party Social Interactions

Caixin Kang, Yifei Huang, Liangyang Ouyang, Mingfang Zhang, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments ICCV2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10584 2025-11-05 cs.SE cs.AI 70%

ARPaCCino: An Agentic-RAG for Policy as Code Compliance

Francesco Romeo, Luigi Arena, Francesco Blefari, Francesco Aurelio Pironti, Matteo Lupinacci, Angelo Furfaro

机构 * University of Calabria(卡塔尼亚大学) IMT School for Advanced Studies Lucca(卢塞恩高级研究学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17435 2025-11-05 cs.CL 70%

Beyond the Link: Assessing LLMs' ability to Classify Political Content across Global Media

Alejandro De La Fuente-Cuesta, Alberto Martinez-Serra, Nienke Visscher, Laia Castro, Ana S. Cardenal

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20411 2025-11-05 cs.SE cs.CL 70%

SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents

Ibragim Badertdinov, Alexander Golubev, Maksim Nekrashevich, Anton Shevtsov, Simon Karasik, Andrei Andriushchenko, Maria Trofimova, Daria Litvintseva, Boris Yangel

机构 * Nebius

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

Comments Dataset: https://huggingface.co/datasets/nebius/SWE-rebench, SWE-rebench leaderboard https://swe-rebench.com NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02094 2025-11-05 cs.AI 70%

Automated Reward Design for Gran Turismo

Michel Ma, Takuma Seno, Kaushik Subramanian, Peter R. Wurman, Peter Stone, Craig Sherstan

机构 * Mila, University of Montreal(蒙特利尔大学Mila) Turing Inc.(图灵公司) Sony AI(索尼人工智能) Sony AI, UT Austin(索尼人工智能、得克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏