arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-07-29 至 2025-07-29 共收录 67 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 67 篇

2504.07840 2025-07-29 cs.HC cs.AI cs.CL 91%

Understanding Learner-LLM Chatbot Interactions and the Impact of Prompting Guidelines

Cansu Koyuturk, Emily Theophilou, Sabrina Patania, Gregor Donabauer, Andrea Martinenghi, Chiara Antico, Alessia Telari, Alessia Testa, Sathya Bursic, Franca Garzotto, Davinia Hernandez-Leo, Udo Kruschwitz, Davide Taibi, Simona Amenta, Martin Ruskov, Dimitri Ognibene

专题命中 评测与基准 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

Comments Long paper accepted for AIED 2025, the 26th International Conference on Artificial Intelligence in Education, July 22 - 26, 2025, Palermo, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20762 2025-07-29 cs.IR 90%

Watermarking Large Language Model-based Time Series Forecasting

Wei Yuan, Chaoqun Yang, Yu Xing, Tong Chen, Nguyen Quoc Viet Hung, Hongzhi Yin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18784 2025-07-29 cs.SE 90%

Secret Breach Detection in Source Code with Large Language Models

Md Nafiu Rahman, Sadif Ahmed, Zahin Wahab, S M Sohan, Rifat Shahriyar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 19th ACM/IEEE International Symposium on Empirical Software Engineering and Measurement (ESEM 2025) cameraready

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19771 2025-07-29 cs.LG cs.AI 90%

Large Language Model Agent for Structural Drawing Generation Using ReAct Prompt Engineering and Retrieval Augmented Generation

Xin Zhang, Lissette Iturburu, Juan Nicolas Villamizar, Xiaoyu Liu, Manuel Salmeron, Shirley J. Dyke, Julio Ramirez

机构 * Lyles School of Civil and Construction Engineering(莱尔斯土木与建设工程学院) Purdue University(普渡大学) School of Mechanical Engineering(机械工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19904 2025-07-29 cs.SE cs.AI 89%

CrossPL: Evaluating Large Language Models on Cross Programming Language Code Generation

Zhanhang Xiong, Dongxia Wang, Yuekang Li, Xinyuan An, Wenhai Wang

机构 * Zhejiang University(浙江大学) The University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10271 2025-07-29 cs.CL 89%

Benchmarking Linguistic Diversity of Large Language Models

Yanzhu Guo, Guokan Shang, Chloé Clavel

机构 * Inria Paris(巴黎国家信息与自动化研究所) MBZUAI(穆斯林人工智能研究所) École Polytechnique(巴黎高等理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20163 2025-07-29 cs.CV 89%

Player-Centric Multimodal Prompt Generation for Large Language Model Based Identity-Aware Basketball Video Captioning

Zeyu Xi, Haoying Sun, Yaofei Wu, Junchi Yan, Haoran Zhang, Lifang Wu, Liang Wang, Changwen Chen

机构 * Beijing University of Technology(北京理工大学) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted by ICCV 2025 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20700 2025-07-29 cs.CL 89%

When Scale Meets Diversity: Evaluating Language Models on Fine-Grained Multilingual Claim Verification

Hanna Shcharbakova, Tatiana Anikina, Natalia Skachkova, Josef van Genabith

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

Comments Published at the FEVER Workshop, ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12327 2025-07-29 cs.CL cs.AI 88%

Intersectional Bias in Japanese Large Language Models from a Contextualized Perspective

Hitomi Yanaka, Xinqi He, Jie Lu, Namgi Han, Sunjin Oh, Ryoma Kumon, Yuma Matsuoka, Katsuhiko Watabe, Yuko Itatsu

机构 * The University of Tokyo(东京大学) Riken(理化学研究所) Rikkyo University(立命馆大学) Softbank corp.(软银公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to the 6th Workshop on Gender Bias in Natural Language Processing (GeBNLP2025) at ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20995 2025-07-29 cs.CY cs.SY eess.SY 88%

VArsity: Can Large Language Models Keep Power Engineering Students in Phase?

Samuel Talkington, Daniel K. Molzahn

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20774 2025-07-29 cs.AI 87%

evalSmarT: An LLM-Based Framework for Evaluating Smart Contract Generated Comments

Fatou Ndiaye Mbodji

机构 * SnT – University of Luxembourg(卢森堡大学SnT学院) Université Cheikh Anta Diop(谢赫·安塔·迪奥普大学) Huawei(华为)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 4 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19570 2025-07-29 cs.AR cs.MA 86%

MCP4EDA: LLM-Powered Model Context Protocol RTL-to-GDSII Automation with Backend Aware Synthesis Optimization

Yiting Wang, Wanghao Ye, Yexiao He, Yiran Chen, Gang Qu, Ang Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments)

Comments 7 pages, 5 figures Keywords: Model Context Protocol, Electronic Design Automation, Large Language Models, Synthesis Optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21017 2025-07-29 cs.AI 85%

MIRAGE-Bench: LLM Agent is Hallucinating and Where to Find Them

Weichen Zhang, Yiyou Sun, Pohao Huang, Jiayue Pu, Heyue Lin, Dawn Song

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Code and data: https://github.com/sunblaze-ucb/mirage-bench.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20395 2025-07-29 cs.AI 85%

MazeEval: A Benchmark for Testing Sequential Decision-Making in Language Models

Hafsteinn Einarsson

机构 * University of Iceland(爱沙尼亚大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19962 2025-07-29 cs.CL 85%

KLAAD: Refining Attention Mechanisms to Reduce Societal Bias in Generative Language Models

Seorin Kim, Dongyoung Lee, Jaejin Lee

机构 * Dept. of Data Science, Seoul National University(数据科学系,首尔国立大学) Dept. of Computer Science and Engineering, Seoul National University(计算机科学与工程系,首尔国立大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06774 2025-07-29 cs.CL 85%

Checklist Engineering Empowers Multilingual LLM Judges

Mohammad Ghiasvand Mohammadkhani, Hamid Beigy

机构 * Amirkabir University of Technology(阿姆irkabir技术大学) Sharif University of Technology(沙里夫技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00946 2025-07-29 cs.HC 85%

A Review of LLM-Assisted Ideation

Sitong Li, Stefano Padilla, Pierre Le Bras, Junyu Dong, Mike Chantler

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19598 2025-07-29 cs.CL cs.AI cs.CR cs.LG 85%

MOCHA: Are Code Language Models Robust Against Multi-Turn Malicious Coding Prompts?

Muntasir Wahed, Xiaona Zhou, Kiet A. Nguyen, Tianjiao Yu, Nirav Diwan, Gang Wang, Dilek Hakkani-Tür, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Winner Defender Team at Amazon Nova AI Challenge 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08789 2025-07-29 cs.CV 83%

Generative AI in Agriculture: Creating Image Datasets Using DALL.E's Advanced Large Language Model Capabilities

Ranjan Sapkota, Manoj Karkee

专题命中 评测与基准 :large language model(title);language model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19899 2025-07-29 cs.CL 81%

A Gold Standard Dataset and Evaluation Framework for Depression Detection and Explanation in Social Media using LLMs

Prajval Bolegave, Pushpak Bhattacharya

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17773 2025-07-29 cs.DC cs.LG cs.PF cs.SE 81%

MultiKernelBench: A Multi-Platform Benchmark for Kernel Generation

Zhongzhen Wen, Yinghui Zhang, Zhong Li, Zhongxin Liu, Linna Xie, Tian Zhang

机构 * State Key Lab for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24371 2025-07-29 cs.CV cs.AI 81%

Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering

Md Intisar Chowdhury, Kittinun Aukkapinyo, Hiroshi Fujimura, Joo Ann Woo, Wasu Wasusatein, Fadoua Ghourabi

机构 * AWL, Inc.(AWL公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Copyright 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05167 2025-07-29 cs.AI cs.CL cs.SD eess.AS 81%

Benchmarking Open-ended Audio Dialogue Understanding for Large Audio-Language Models

Kuofeng Gao, Shu-Tao Xia, Ke Xu, Philip Torr, Jindong Gu

机构 * Tsinghua University(清华大学) University of Oxford(牛津大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21028 2025-07-29 cs.CL 79%

Multi-Agent-as-Judge: Aligning LLM-Agent-Based Automated Evaluation with Multi-Dimensional Human Evaluation

Jiaju Chen, Yuxuan Lu, Xiaojie Wang, Huimin Zeng, Jing Huang, Jiri Gesi, Ying Xu, Bingsheng Yao, Dakuo Wang

机构 * Rice University(里士满大学) Northeastern University(东北大学) Amazon(亚马逊) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03916 2025-07-29 cs.AI cs.CV 79%

Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models

Yifan Jiang, Yibo Xue, Yukun Kang, Pin Zheng, Jian Peng, Feiran Wu, Changliang Xu

机构 * Hangzhou Institute for Advanced Study(杭州先进研究所) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Comments Appendix at: https://github.com/PAMPAS-Lab/ANA-PPT-Anamation/blob/main/Appendix.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02022 2025-07-29 cs.LG q-bio.BM 79%

NbBench: Benchmarking Language Models for Comprehensive Nanobody Tasks

Yiming Zhang, Koji Tsuda

机构 * Department of Computational Biology and Medical Sciences(计算生物学与医学科学系) The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19643 2025-07-29 cs.CY cs.AI 79%

Can You Share Your Story? Modeling Clients' Metacognition and Openness for LLM Therapist Evaluation

Minju Kim, Dongje Yoo, Yeonjun Hwang, Minseok Kang, Namyoung Kim, Minju Gwak, Beong-woo Kwak, Hyungjoo Chae, Harim Kim, Yunjoong Lee, Min Hee Kim, Dayi Jung, Kyong-Mee Chung, Jinyoung Yeo

机构 * Yonsei University(延世大学) Eulji University(欧斯吉大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

Comments Published at ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02087 2025-07-29 cs.LG cs.CL cs.CY 79%

Evaluating the Promise and Pitfalls of LLMs in Hiring Decisions

Eitan Anzenberg, Arunava Samajpati, Sivasankaran Chandrasekar, Varun Kacholia

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments 10 pages, 2 figures, 2 tables. Submitted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20666 2025-07-29 eess.AS cs.AI cs.LG cs.SD 79%

MIMII-Agent: Leveraging LLMs with Function Calling for Relative Evaluation of Anomalous Sound Detection

Harsh Purohit, Tomoya Nishida, Kota Dohi, Takashi Endo, Yohei Kawaguchi

机构 * Hitachi Ltd., R\&D Group, Tokyo, Japan

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18509 2025-07-29 cs.CR cs.AI cs.CL 79%

Protecting Users From Themselves: Safeguarding Contextual Privacy in Interactions with Conversational Agents

Ivoline Ngong, Swanand Kadhe, Hao Wang, Keerthiram Murugesan, Justin D. Weisz, Amit Dhurandhar, Karthikeyan Natesan Ramamurthy

机构 * IBM Research(IBM研究院) University of Vermont(佛罗里达大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏