arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32335 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32335 篇

2508.20996 2025-10-15 cs.AI 87%

ChatThero: An LLM-Supported Chatbot for Behavior Change and Therapeutic Support in Addiction Recovery

Junda Wang, Zonghai Yao, Lingxi Li, Junhui Qian, Zhichao Yang, Hong Yu

机构 * Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(VA Bedford Health Care 医疗组织与实施研究中心) Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校信息与计算机科学学院) Miner School of Computer and Information Sciences, University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校计算机与信息科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);language agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04013 2025-10-07 cs.CL 87%

LLM Microscope: What Model Internals Reveal About Answer Correctness and Context Utilization

Jiarui Liu, Jivitesh Jain, Mona Diab, Nishant Subramani

机构 * Carnege Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19926 2025-09-25 cs.LG 87%

MMSE-Calibrated Few-Shot Prompting for Alzheimer's Detection

Jana Sweidan, Mounim A. El-Yacoubi, Nasredine Semmar

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18846 2025-09-24 cs.AI 87%

Model selection meets clinical semantics: Optimizing ICD-10-CM prediction via LLM-as-Judge evaluation, redundancy-aware sampling, and section-aware fine-tuning

Hong-Jie Dai, Zheng-Hao Li, An-Tai Lu, Bo-Tsz Shain, Ming-Ta Li, Tatheer Hussain Mir, Kuang-Te Wang, Min-I Su, Pei-Kang Liu, Ming-Ju Tsai

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 28 Pages, 4 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16268 2025-09-23 cs.SE cs.AI 87%

Digging Into the Internal: Causality-Based Analysis of LLM Function Calling

Zhenlan Ji, Daoyuan Wu, Wenxuan Wang, Pingchuan Ma, Shuai Wang, Lei Ma

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12158 2025-09-22 cs.CL 87%

A Rigorous Evaluation of LLM Data Generation Strategies for Low-Resource Languages

Tatiana Anikina, Jan Cegin, Jakub Simko, Simon Ostermann

机构 * German Research Institute for Artificial Intelligence (DFKI)(德国人工智能研究所) Faculty of Information Technology, Brno University of Technology(信息科技学院,布拉格技术大学) Kempelen Institute of Intelligent Technologies(智能技术研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02754 2025-09-04 cs.AI 87%

Do LLM Modules Generalize? A Study on Motion Generation for Autonomous Driving

Mingyi Wang, Jingke Wang, Tengju Ye, Junbo Chen, Kaicheng Yu

机构 * Autolab, Westlake University(自动化实验室,西lake大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01311 2025-09-03 cs.CL 87%

FactGenius: Combining Zero-Shot Prompting and Fuzzy Relation Mining to Improve Fact Verification with Knowledge Graphs

Sushant Gautam

机构 * Simula Metropolitan Center for Digital Engineering(模拟元数字工程中心)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments accepted and presented at the 6th IN5550 Workshop on Neural Natural Language Processing (WNNLP 2024) at the University of Oslo, Norway

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21273 2025-09-01 cs.LG 87%

CALM: A Framework for Continuous, Adaptive, and LLM-Mediated Anomaly Detection in Time-Series Streams

Ashok Devireddy, Shunping Huang

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07805 2025-08-12 cs.CL 87%

Can You Trick the Grader? Adversarial Persuasion of LLM Judges

Yerin Hwang, Dongryeol Lee, Taegwan Kang, Yongil Kim, Kyomin Jung

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01685 2025-08-05 cs.LG cs.CR 87%

Innovative tokenisation of structured data for LLM training

Kayvan Karim, Hani Ragab Hassen. Hadj Batatia

机构 * School of Mathematics and Computer Science(数学与计算机科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00435 2025-08-04 cs.CL 87%

AILS-NTUA at SemEval-2025 Task 8: Language-to-Code prompting and Error Fixing for Tabular Question Answering

Andreas Evangelatos, Giorgos Filandrianos, Maria Lymperaiou, Athanasios Voulodimos, Giorgos Stamou

机构 * National Technical University of Athens(希腊国家技术大学)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Journal ref The 19th International Workshop on Semantic Evaluation (SemEval 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23370 2025-08-01 cs.SE cs.AI 87%

Trae Agent: An LLM-based Agent for Software Engineering with Test-time Scaling

Trae Research Team, Pengfei Gao, Zhao Tian, Xiangxin Meng, Xinchen Wang, Ruida Hu, Yuanan Xiao, Yizhou Liu, Zhao Zhang, Junjie Chen, Cuiyun Gao, Yun Lin, Yingfei Xiong, Chao Peng, Xia Liu

机构 * Trae Research(Trae研究)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Pengfei Gao and Zhao Tian contributed equally to this technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22619 2025-07-31 cs.AI 87%

Enhancing Manufacturing Knowledge Access with LLMs and Context-aware Prompting

Sebastian Monka, Irlan Grangel-González, Stefan Schmid, Lavdim Halilaj, Marc Rickart, Oliver Rudolph, Rui Dias

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) Robert Bosch GmbH(博世集团) Mobility Electronics(移动电子)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments European Conference on Artificial Intelligence (ECAI) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21285 2025-07-30 cs.AI 87%

Curiosity by Design: An LLM-based Coding Assistant Asking Clarification Questions

Harsh Darji, Thibaud Lutellier

机构 * University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20774 2025-07-29 cs.AI 87%

evalSmarT: An LLM-Based Framework for Evaluating Smart Contract Generated Comments

Fatou Ndiaye Mbodji

机构 * SnT – University of Luxembourg(卢森堡大学SnT学院) Université Cheikh Anta Diop(谢赫·安塔·迪奥普大学) Huawei(华为)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 4 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15675 2025-07-22 cs.CL 87%

P3: Prompts Promote Prompting

Xinyu Zhang, Yuanquan Hu, Fangchao Liu, Zhicheng Dou

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted to ACL 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11981 2025-07-17 cs.CL 87%

Simplifications are Absolutists: How Simplified Language Reduces Word Sense Awareness in LLM-Generated Definitions

Lukas Ellinger, Miriam Anschütz, Georg Groh

机构 * School for Computation, Information and Technology(计算、信息与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Accepted by RANLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11457 2025-07-16 cs.LG eess.IV 87%

LRMR: LLM-Driven Relational Multi-node Ranking for Lymph Node Metastasis Assessment in Rectal Cancer

Yaoxian Dong, Yifan Gao, Haoyue Li, Yanfen Cui, Xin Gao

机构 * Shanxi Province Cancer Hospital, Chinese Academy of Medical Sciences(山西省肿瘤医院、中国医学科学院) Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Sciences(苏州生物医学工程与技术研究所、中国科学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19185 2025-06-25 cs.AI 87%

Spiritual-LLM : Gita Inspired Mental Health Therapy In the Era of LLMs

Janak Kapuriya, Aman Singh, Jainendra Shukla, Rajiv Ratn Shah

机构 * Data Science Institute University of Galway(都柏林大学数据科学研究所) MIDAS Lab IIIT Delhi(德里IIIT MIDAS实验室) HMI Lab IIIT Delhi(德里IIIT HMI实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05716 2025-06-19 cs.LG cs.CY 87%

Single-Agent vs. Multi-Agent LLM Strategies for Automated Student Reflection Assessment

Gen Li, Li Chen, Cheng Tang, Valdemar Švábenský, Daisuke Deguchi, Takayoshi Yamashita, Atsushi Shimada

机构 * Kyushu University, Fukuoka, Japan(九州大学) Nagoya University, Nagoya, Japan(名古屋大学) Chubu University, Kasugai, Japan(名古屋大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Published in Proceedings of the 29th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD 2025), see https://doi.org/10.1007/978-981-96-8186-0_24

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11361 2025-06-16 cs.CL cs.CY 87%

The Biased Samaritan: LLM biases in Perceived Kindness

Jack H Fagan, Ruhaan Juyaal, Amy Yue-Ming Yu, Siya Pun

机构 * Department of Cognitive Science University of California, Davis(认知科学系加州大学戴维斯分校) Department of Statistics University of California, Davis(统计学系加州大学戴维斯分校) Department of Computer Science University of California, Davis(计算机科学系加州大学戴维斯分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23953 2025-06-02 cs.SE cs.AI 87%

Enhancing LLM-Based Code Generation with Complexity Metrics: A Feedback-Driven Approach

Melika Sepidband, Hamed Taherkhani, Song Wang, Hadi Hemmati

机构 * Lassonde School of Eng. York University(埃克塞特工程学院约克大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 11 pages, 5 figures. Accepted to COMPSAC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18638 2025-05-30 cs.CL 87%

Multilingual Question Answering in Low-Resource Settings: A Dzongkha-English Benchmark for Foundation Models

Md. Tanzib Hosain, Rajan Das Gupta, Md. Kishor Morol

专题命中 评测与基准 :foundation model(title);LLM(abstract);large language model(abstract);language model(abstract)

Comments 24 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06149 2025-05-27 cs.CL cs.CY cs.MM 87%

Can Prompting LLMs Unlock Hate Speech Detection across Languages? A Zero-shot and Few-shot Study

Faeze Ghorbanpour, Daryna Dementieva, Alexander Fraser

机构 * School of Computation, Information and Technology, TU Munich(技术计算与信息学院,慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12273 2025-05-20 cs.CL 87%

LLM-Based Evaluation of Low-Resource Machine Translation: A Reference-less Dialect Guided Approach with a Refined Sylheti-English Benchmark

Md. Atiqur Rahman, Sabrina Islam, Mushfiqul Haque Omi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09027 2025-05-15 cs.SE cs.AI 87%

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation

Yi Cui

机构 * ONEKQ Lab, USA(ONEKQ实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments arXiv admin note: text overlap with arXiv:2409.05177

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01383 2025-05-15 cs.CL 87%

LLM-based NLG Evaluation: Current Status and Challenges

Mingqi Gao, Xinyu Hu, Jie Ruan, Xiao Pu, Xiaojun Wan

机构 * Peking University(北京大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20464 2025-05-14 cs.AI 87%

A Survey on GUI Agents with Foundation Models Enhanced by Reinforcement Learning

Jiahao Li, Kaer Huang

机构 * Lenovo Research(联想研究院)

专题命中 评测与基准 :foundation model(title);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00711 2025-05-06 cs.LG 87%

GraphMaster: Automated Graph Synthesis via LLM Agents in Data-Limited Environments

Enjun Du, Xunkai Li, Tian Jin, Zhihan Zhang, Rong-Hua Li, Guoren Wang

机构 * Department of Cyberspace Science and Technology(网络空间科学与技术系) Beijing Institude of Technology(北京理工大学) Department of Computer Science and Technology(计算机科学与技术系) Pittsburgh Institute Sichuan University(四川大学 Pittsburgh 院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏