arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-13 至 2025-08-13 共收录 159 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 30 篇

2508.08632 2025-08-13 cs.AI 89%

AgriGPT: a Large Language Model Ecosystem for Agriculture

Bo Yang, Yu Zhang, Lanfei Feng, Yunkui Chen, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Yurui Li, Yuxuan Chen, Guijun Yang, Yong He, Runhe Huang, Shijian Li

机构 * College of Computer Science and Technology, Zhejiang University, China(浙江大学计算机科学与技术学院) College of Software Technology, Zhejiang University, China(浙江大学软件学院) School of Geological Engineering and Geomatics, Chang’an University, China(长安大学地质工程与测绘学院) College of Biosystems Engineering and Food Science, Zhejiang University, China(浙江大学生物系统工程与食品科学学院) Faculty of Computer and Information Sciences, Hosei University, Japan(立命馆大学计算机与信息科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02141 2025-08-13 cs.CV cs.CL 89%

WSI-LLaVA: A Multimodal Large Language Model for Whole Slide Image

Yuci Liang, Xinheng Lyu, Wenting Chen, Meidan Ding, Jipeng Zhang, Xiangjian He, Song Wu, Xiaohan Xing, Sen Yang, Xiyue Wang, Linlin Shen

机构 * Shenzhen University(深圳大学) University of Nottingham Ningbo China(诺丁汉大学宁波分校) City University of Hong Kong(香港城市大学) Stanford University(斯坦福大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL

Comments ICCV 2025, 38 pages, 22 figures, 35 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08678 2025-08-13 cs.CY 89%

Exploring Large Language Model Agents for Piloting Social Experiments

Jinghua Piao, Yuwei Yan, Nian Li, Jun Zhang, Yong Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted by COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14805 2025-08-13 cs.CV cs.AI cs.CL cs.LG cs.MM 89%

Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?

Yang Yao, Lingyu Li, Jiaxin Song, Chiyu Chen, Zhenqi He, Yixu Wang, Xin Wang, Tianle Gu, Jie Li, Yan Teng, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12192 2025-08-13 cs.HC 89%

Towards Dataset-scale and Feature-oriented Evaluation of Text Summarization in Large Language Model Prompts

Sam Yu-Te Lee, Aryaman Bahukhandi, Dongyu Liu, Kwan-Liu Ma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Journal ref IEEE Transactions on Visualization and Computer Graphics, vol. 31, no. 1, pp. 481-491, Jan. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13983 2025-08-13 cs.CL cs.AI 88%

AdEval: Alignment-based Dynamic Evaluation to Mitigate Data Contamination in Large Language Models

Yang Fan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments There are serious academic problems in this paper, such as data falsification and plagiarism in the method of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09101 2025-08-13 cs.CL cs.SE 88%

AutoCodeBench: Large Language Models are Automatic Code Benchmark Generators

Jason Chou, Ao Liu, Yuchi Deng, Zhiying Zeng, Tao Zhang, Haotian Zhu, Jianwei Cai, Yue Mao, Chenchen Zhang, Lingyun Tan, Ziyan Xu, Bohui Zhai, Hengyi Liu, Speed Zhu, Wiggin Zhou, Fengzong Lian

机构 * Hunyuan Team, Tencent(腾讯文心团队)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Homepage: https://autocodebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08777 2025-08-13 cs.IR cs.AI cs.LG 88%

Evaluating Podcast Recommendations with Profile-Aware LLM-as-a-Judge

Francesco Fabbri, Gustavo Penha, Edoardo D'Amico, Alice Wang, Marco De Nadai, Jackie Doremus, Paul Gigioli, Andreas Damianou, Oskar Stal, Mounia Lalmas

机构 * Spotify

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted at RecSys '25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08262 2025-08-13 cs.CL 86%

Argument Quality Annotation and Gender Bias Detection in Financial Communication through Large Language Models

Alaa Alhamzeh, Mays Al Rebdawi

机构 * First Author Affiliation(第一作者机构) Second Author Affiliation(第二作者机构)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

Comments 8 pages, 4 figures, Passau uni, Master thesis in NLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08761 2025-08-13 cs.CL cs.AI 86%

DevNous: An LLM-Based Multi-Agent System for Grounding IT Project Management in Unstructured Conversation

Stavros Doropoulos, Stavros Vologiannidis, Ioannis Magnisalis

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08287 2025-08-13 cs.CL cs.AI cs.CY 86%

Sacred or Synthetic? Evaluating LLM Reliability and Abstention for Religious Questions

Farah Atif, Nursultan Askarbekuly, Kareem Darwish, Monojit Choudhury

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 8th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09124 2025-08-13 cs.CL 85%

OdysseyBench: Evaluating LLM Agents on Long-Horizon Complex Office Application Workflows

Weixuan Wang, Dongge Han, Daniel Madrigal Diaz, Jin Xu, Victor Rühle, Saravan Rajmohan

机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) Microsoft(微软公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09036 2025-08-13 cs.CY cs.AI 83%

Can We Trust AI to Govern AI? Benchmarking LLM Performance on Privacy and AI Governance Exams

Zane Witherspoon, Thet Mon Aye, YingYing Hao

机构 * Superset Labs PBC(Superset实验室)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08709 2025-08-13 cs.RO cs.AR cs.LG cs.MA 79%

CRADLE: Conversational RTL Design Space Exploration with LLM-based Multi-Agent Systems

Lukas Krupp, Maximilian Schöffel, Elias Biehl, Norbert Wehn

机构 * RPTU University of Kaiserslautern-Landau(凯撒斯劳滕-兰道大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

Comments Accepted for presentation at the 22nd International SoC Conference (ISOCC 2025). Proceedings to be included in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14412 2025-08-13 cs.IR cs.AI cs.LG 79%

RAGtifier: Evaluating RAG Generation Approaches of State-of-the-Art RAG Systems for the SIGIR LiveRAG Competition

Tim Cofala, Oleh Astappiev, William Xion, Hailay Teklehaymanot

机构 * L3S Research Center(L3S研究所以) Inria Paris-Rocquencourt(Inria巴黎-罗克琴克特研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 4 pages, 6 figures. Report for SIGIR 2025 LiveRAG Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08620 2025-08-13 eess.SP 75%

Agentic Graph Neural Networks for Wireless Communications and Networking Towards Edge General Intelligence: A Survey

Yang Lu, Shengli Zhang, Chang Liu, Ruichen Zhang, Bo Ai, Dusit Niyato, Wei Ni, Xianbin Wang, Abbas Jamalipour

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07414 2025-08-13 cs.CL cs.LG 73%

Grounding Multilingual Multimodal LLMs With Cultural Knowledge

Jean de Dieu Nyandwi, Yueqi Song, Simran Khanuja, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08629 2025-08-13 cs.CY cs.AI 70%

Securing Educational LLMs: A Generalised Taxonomy of Attacks on LLMs and DREAD Risk Assessment

Farzana Zahid, Anjalika Sewwandi, Lee Brandon, Vimal Kumar, Roopak Sinha

机构 * University of Waikato(怀卡托大学) Deakin University(迪金大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01354 2025-08-13 cs.RO cs.HC 67%

Human-Robot Interaction Conversational User Enjoyment Scale (HRI CUES)

Bahar Irfan, Jura Miniota, Sofia Thunberg, Erik Lagerstedt, Sanna Kuoppamäki, Gabriel Skantze, André Pereira

机构 * Division of Speech, Music and Hearing(语音、音乐与听觉研究室) KTH Royal Institute of Technology(皇家理工学院) Department of Computer Science and Engineering(计算机科学与工程系) Chalmers University of Technology(查尔姆斯理工大学) Gothenburg University(哥德堡大学) Department of Philosophy, Linguistics, Theory of Science(哲学、语言学与科学理论系) University of Gothenburg(哥德堡大学) Division of Health Informatics and Logistics(健康信息学与物流研究室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Published in IEEE Transactions on Affective Computing on 18 July 2025. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media

Journal ref IEEE Transactions on Affective Computing 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21798 2025-08-13 cs.SE cs.AI cs.CL 62%

SWE-smith: Scaling Data for Software Engineering Agents

John Yang, Kilian Lieret, Carlos E. Jimenez, Alexander Wettig, Kabir Khandpur, Yanzhe Zhang, Binyuan Hui, Ofir Press, Ludwig Schmidt, Diyi Yang

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Alibaba Qwen(阿里巴巴文言)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments All assets available at https://swesmith.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07114 2025-08-13 cs.CL cs.AI cs.CY cs.HC 62%

ChatBench: From Static Benchmarks to Human-AI Evaluation

Serina Chang, Ashton Anderson, Jake M. Hofman

机构 * Microsoft Research(微软研究院) University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00027 2025-08-13 cs.CL cs.AI 62%

Opioid Named Entity Recognition (ONER-2025) from Reddit

Muhammad Ahmad, Rita Orji, Fida Ullah, Ildar Batyrshin, Grigori Sidorov

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08769 2025-08-13 cs.LG 57%

Differentiated Information Mining: A Semi-supervised Learning Framework for GNNs

Long Wang, Kai Liu

专题命中 评测与基准 :language model(abstract);分类 cs.LG

Comments 13 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08661 2025-08-13 cs.SE cs.AI 57%

Hallucinations in Code Change to Natural Language Generation: Prevalence and Evaluation of Detection Metrics

Chunhua Liu, Hong Yi Lin, Patanamon Thongtanunam

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

Comments 8 main pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08244 2025-08-13 cs.CV cs.AI 57%

Cut2Next: Generating Next Shot via In-Context Tuning

Jingwen He, Hongbo Liu, Jiajun Li, Ziqi Huang, Yu Qiao, Wanli Ouyang, Ziwei Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01306 2025-08-13 cs.LG cs.CV 57%

ICC: Quantifying Image Caption Concreteness for Multimodal Dataset Curation

Moran Yanuka, Morris Alper, Hadar Averbuch-Elor, Raja Giryes

机构 * Tel-Aviv University(特拉维夫大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

Comments Accepted to ACL 2024 (Finding). For Project webpage, see https://moranyanuka.github.io/icc/

Journal ref Findings of the Association for Computational Linguistics: ACL 2024, pages 11048-11064, Bangkok, Thailand, August 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06555 2025-08-13 cs.CV cs.CY cs.MA 50%

StyleTailor: Towards Personalized Fashion Styling via Hierarchical Negative Feedback

Hongbo Ma, Fei Shen, Hongbin Xu, Xiaoce Wang, Gang Xu, Jinkai Zheng, Liangqiong Qu, Ming Li

专题命中 评测与基准 :language model(abstract)

Comments 24pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02488 2025-08-13 cs.CV 50%

SCB-Dataset: A Dataset for Detecting Student and Teacher Classroom Behavior

Fan Yang

机构 * Fan Yang

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 31 篇

2508.08300 2025-08-13 cs.AI 92%

LLM-BI: Towards Fully Automated Bayesian Inference with Large Language Models

Yongchao Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08332 2025-08-13 cs.SE cs.AI 89%

Energy-Aware Code Generation with LLMs: Benchmarking Small vs. Large Language Models for Sustainable AI Programming

Humza Ashraf, Syed Muhammad Danish, Aris Leivadeas, Yazan Otoum, Zeeshan Sattar

机构 * Algoma University(阿尔戈马大学) École de Technologie Supérieure (ÉTS)(高等技术学院) Ericsson Inc.(爱立信公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏