arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32599 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32599 篇

2507.16808 2025-07-23 cs.SE cs.AI 85%

Rethinking LLM-Based RTL Code Optimization Via Timing Logic Metamorphosis

Zhihao Xu, Bixin Li, Lulu Wang

机构 * school of Computer Science and Engineering(计算机科学与工程学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 13pages with 9 pictures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16754 2025-07-23 cs.SE cs.AI 85%

Never Come Up Empty: Adaptive HyDE Retrieval for Improving LLM Developer Support

Fangjian Lei, Mariam El Mezouar, Shayan Noei, Ying Zou

机构 * Queen's University(皇后大学) Royal Military College of Canada(加拿大皇家军事学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05445 2025-07-22 cs.CL 85%

clem:todd: A Framework for the Systematic Benchmarking of LLM-Based Task-Oriented Dialogue System Realisations

Chalamalasetti Kranti, Sherzod Hakimov, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(普腾多夫大学语言学系) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12370 2025-07-17 cs.CL cs.HC 85%

Beyond Single Models: Enhancing LLM Detection of Ambiguity in Requests through Debate

Ana Davila, Jacinto Colan, Yasuhisa Hasegawa

机构 * Institutes of Innovation for Future Society(未来社会创新研究所) Nagoya University(名古屋大学) Department of Micro-Nano Mechanical Science and Engineering(微纳米机械科学与工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at the 2025 SICE Festival with Annual Conference (SICE FES)

Journal ref 2025 SICE Festival with Annual Conference (SICE FES)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22998 2025-07-15 cs.LG 85%

LLM Agents for Bargaining with Utility-based Feedback

Jihwan Oh

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13640 2025-07-15 cs.CL 85%

Qorgau: Evaluating LLM Safety in Kazakh-Russian Bilingual Contexts

Maiya Goloburda, Nurkhan Laiyk, Diana Turmakhan, Yuxia Wang, Mukhammed Togmanov, Jonibek Mansurov, Askhat Sametov, Nurdaulet Mukhituly, Minghan Wang, Daniil Orel, Zain Muhammad Mujahid, Fajri Koto, Timothy Baldwin, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) Monash University(莫纳什大学) University of Copenhagen(哥本哈根大学) The University of Melbourne(墨尔本大学) LibrAI(LibrAI公司) Institute of Foundation Models(基础模型研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08498 2025-07-14 cs.CL 85%

Semantic-Augmented Latent Topic Modeling with LLM-in-the-Loop

Mengze Hong, Chen Jason Zhang, Di Jiang

机构 * Hong Kong Polytechnic University(香港理工大学) AI Group, WeBank Co., Ltd(WeBank金融科技集团)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02524 2025-07-11 cs.CL 85%

CheckEmbed: Effective Verification of LLM Solutions to Open-Ended Tasks

Maciej Besta, Lorenzo Paleari, Marcin Copik, Robert Gerstenberger, Ales Kubicek, Piotr Nyczyk, Patrick Iff, Eric Schreiber, Tanja Srindran, Tomasz Lehmann, Hubert Niewiadomski, Torsten Hoefler

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06323 2025-07-10 cs.CR cs.AI 85%

Bridging AI and Software Security: A Comparative Vulnerability Assessment of LLM Agent Deployment Paradigms

Tarek Gasmi, Ramzi Guesmi, Ines Belhadj, Jihene Bennaceur

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04877 2025-07-08 cs.AI 85%

DoPI: Doctor-like Proactive Interrogation LLM for Traditional Chinese Medicine

Zewen Sun, Ruoxiang Huang, Jiahe Feng, Rundong Kong, Yuqian Wang, Hengyu Liu, Ziqi Gong, Yuyuan Qin, Yingxue Wang, Yu Wang

机构 * Tianjin University(天津大学) The Chinese University of Hong Kong(香港中文大学) China Electronics Technology Group Corporation Limited(中国电子科技集团有限公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05853 2025-07-08 cs.DB cs.LG 85%

Training-Free Query Optimization via LLM-Based Plan Similarity

Nikita Vasilenko, Alexander Demin, Vladimir Boorlakov

机构 * Ershov Institute of Informatics Systems(信息系统埃尔绍夫研究所) Novosibirsk State Technical University(新西伯利亚国立技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03605 2025-07-08 cs.NE cs.AI 85%

Behaviour Space Analysis of LLM-driven Meta-heuristic Discovery

Niki van Stein, Haoran Yin, Anna V. Kononova, Thomas Bäck, Gabriela Ochoa

机构 * Leiden University(莱顿大学) University of Stirling(斯特灵大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03064 2025-07-08 cs.CR cs.AI 85%

LLM-Driven Auto Configuration for Transient IoT Device Collaboration

Hetvi Shastri, Walid A. Hanafy, Li Wu, David Irwin, Mani Srivastava, Prashant Shenoy

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01872 2025-07-03 cs.CL 85%

DIY-MKG: An LLM-Based Polyglot Language Learning System

Kenan Tang, Yanhong Li, Yao Qin

机构 * UCSB(UCSB大学) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Submitted to EMNLP 2025 System Demonstration

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01019 2025-07-03 cs.CL cs.CY 85%

MALIBU Benchmark: Multi-Agent LLM Implicit Bias Uncovered

Imran Mirza, Cole Huang, Ishwara Vasista, Rohan Patil, Asli Akalin, Sean O'Brien, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to Building Trust in LLMs @ ICLR 2025 and NAACL SRW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15154 2025-07-03 cs.AI 85%

MCCoder: Streamlining Motion Control with LLM-Assisted Code Generation and Rigorous Verification

Yin Li, Liangwei Wang, Shiyuan Piao, Boo-Ho Yang, Ziyue Li, Wei Zeng, Fugee Tsung

机构 * Thrust of Data Science and Analytics, The Hong Kong University of Science and Technology (Guangzhou)(数据科学与分析 thrust,香港科学与技术大学(广州)) Department of Industrial Engineering and Decision Analytics, The Hong Kong University of Science and Technology(工业工程与决策分析系,香港科学与技术大学) MOVENSYS Inc.(MOVENSYS公司) University of Cologne(科隆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments IEEE CASE 2025 Best Student Paper Finalists

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23520 2025-07-02 cs.AI 85%

ChemActor: Enhancing Automated Extraction of Chemical Synthesis Actions with LLM-Generated Data

Yu Zhang, Ruijie Yu, Jidong Tian, Feng Zhu, Jiapeng Liu, Xiaokang Yang, Yaohui Jin, Yanyan Xu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15044 2025-07-02 cs.CL 85%

SPADE: Structured Prompting Augmentation for Dialogue Enhancement in Machine-Generated Text Detection

Haoyi Li, Angela Yifei Yuan, Soyeon Caren Han, Christopher Leckie

机构 * The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :prompting(title);LLM(abstract);large language model(abstract);language model(abstract)

Comments ACL LLMSEC

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18504 2025-07-01 cs.CV cs.AI 85%

Generalizing vision-language models to novel domains: A comprehensive survey

Xinyao Li, Jingjing Li, Fengling Li, Lei Zhu, Yang Yang, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Technology Sydney(技术学院) Tongji University(同济大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08686 2025-07-01 cs.CL cs.CY 85%

Brevity is the soul of sustainability: Characterizing LLM response lengths

Soham Poddar, Paramita Koley, Janardan Misra, Sanjay Podder, Navveen Balani, Niloy Ganguly, Saptarshi Ghosh

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克哈格布尔分校) Indian Statistical Institute, Kolkata(印度统计研究所,科契) Accenture Labs, Bangalore(埃森哲实验室,班加罗尔)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to appear at the ACL 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02691 2025-07-01 cs.HC cs.AI 85%

LLM-Assisted Visual Analytics: Opportunities and Challenges

Maeve Hutchinson, Radu Jianu, Aidan Slingsby, Pranava Madhyastha

机构 * Department of Computer Science, City University of London(伦敦城市大学计算机科学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted at EG UK Computer Graphics & Visual Computing 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22157 2025-06-30 cs.CL 85%

Training Language Model to Critique for Better Refinement

Tianshu Yu, Chao Xiang, Mingchuan Yang, Pei Ke, Bosi Wen, Cunxiang Wang, Jiale Cheng, Li Zhang, Xinyu Mu, Chuxiong Sun, Minlie Huang

机构 * China Telecom Research Institute(中国电信研究院) The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) University of Electronic Science and Technology of China(电子科技大学) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程小组) Zhipu AI(智谱AI)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03492 2025-06-30 cs.CL 85%

Towards Reproducible LLM Evaluation: Quantifying Uncertainty in LLM Benchmark Scores

Robert E. Blackwell, Jon Barry, Anthony G. Cohn

机构 * The Alan Turing Institute(艾伦·图灵研究所) The Centre for Environment Fisheries and Aquaculture Science(环境渔业与水产科学研究中心) School of Computer Science, University of Leeds(利兹大学计算机科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 4 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03359 2025-06-27 cs.AI 85%

WiS Platform: Enhancing Evaluation of LLM-Based Multi-Agent Systems Through Game-Based Analysis

Chengwei Hu, Jianhui Zheng, Yancheng He, Hangyu Guo, Junguang Jiang, Han Zhu, Kai Sun, Yuning Jiang, Wenbo Su, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝及天猫集团)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05894 2025-06-26 cs.CV cs.CL 85%

GlyphPattern: An Abstract Pattern Recognition Benchmark for Vision-Language Models

Zixuan Wu, Yoolim Kim, Carolyn Jane Anderson

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

Journal ref Findings of the ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21819 2025-06-24 cs.CL 85%

Self-Preference Bias in LLM-as-a-Judge

Koki Wataoka, Tsubasa Takahashi, Ryokan Ri

机构 * SB Intuitions

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at NeurIPS 2024 Safe Generative AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17369 2025-06-24 cs.SE cs.AI 85%

Re-Evaluating Code LLM Benchmarks Under Semantic Mutation

Zhiyuan Pan, Xing Hu, Xin Xia, Xiaohu Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17363 2025-06-24 cs.CY cs.AI 85%

A Large-Scale Real-World Evaluation of LLM-Based Virtual Teaching Assistant

Sunjun Kweon, Sooyohn Nam, Hyunseung Lim, Hwajung Hong, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments ACL 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17163 2025-06-23 cs.AI 85%

The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making

Abinitha Gourabathina, Yuexing Hao, Walter Gerych, Marzyeh Ghassemi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16322 2025-06-23 cs.CL 85%

PL-Guard: Benchmarking Language Model Safety for Polish

Aleksandra Krasnodębska, Karolina Seweryn, Szymon Łukasik, Wojciech Kusa

机构 * NASK – National Research Institute(国家研究 institute)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments Accepted to the 10th Workshop on Slavic Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏