arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32413 篇

2505.13479 2025-05-21 cs.PL cs.AR cs.LG 86%

RTL++: Graph-enhanced LLM for RTL Code Generation

Mohammad Akyash, Kimia Azar, Hadi Kamali

机构 * Department of Electrical and Computer Engineering (ECE), University of Central Florida(电子与计算机工程系,中央佛罗里达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted to the IEEE International Conference on LLM-Aided Design (LAD '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06193 2025-04-22 cs.SE cs.AI 86%

Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering

Ruiqi Wang, Jiyu Guo, Cuiyun Gao, Guodong Fan, Chun Yong Chong, Xin Xia

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Monash University Malaysia(墨尔本大学马来西亚分校) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted by ISSTA 2025: https://conf.researchr.org/details/issta-2025/issta-2025-papers/85/Can-LLMs-replace-Human-Evaluators-An-Empirical-Study-of-LLM-as-a-Judge-in-Software-E

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04065 2025-01-30 cs.SE cs.LG 86%

On the Workflows and Smells of Leaderboard Operations (LBOps): An Exploratory Study of Foundation Model Leaderboards

Zhimin Zhao, Abdul Ali Bangash, Filipe Roseiro Côgo, Bram Adams, Ahmed E. Hassan

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Awesome Foundation Model Leaderboard List: https://github.com/SAILResearch/awesome-foundation-model-leaderboards; Foundation Model Leaderboard Search Toolkit: https://huggingface.co/spaces/zhiminy/awesome-foundation-model-leaderboard-search

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04373 2025-01-03 cs.SE cs.AI 86%

VerilogReader: LLM-Aided Hardware Test Generation

Ruiyang Ma, Yuxin Yang, Ziqian Liu, Jiaxi Zhang, Min Li, Junhua Huang, Guojie Luo

机构 * School of Computer Science, Peking University(北京大学计算机学院) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Journal ref 2024 IEEE LLM Aided Design Workshop (LAD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02074 2024-09-04 cs.CR cs.HC cs.LG cs.SE 86%

RACONTEUR: A Knowledgeable, Insightful, and Portable LLM-Powered Shell Command Explainer

Jiangyi Deng, Xinfeng Li, Yanjiao Chen, Yijie Bai, Haiqin Weng, Yan Liu, Tao Wei, Wenyuan Xu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted by NDSS Symposium 2025. Please cite this paper as "Jiangyi Deng, Xinfeng Li, Yanjiao Chen, Yijie Bai, Haiqin Weng, Yan Liu, Tao Wei, Wenyuan Xu. RACONTEUR: A Knowledgeable, Insightful, and Portable LLM-Powered Shell Command Explainer. In the 32nd Annual Network and Distributed System Security Symposium (NDSS 2025)."

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14029 2023-10-24 cs.CL cond-mat.mtrl-sci 86%

LLM-Prop: Predicting Physical And Electronic Properties Of Crystalline Solids From Their Text Descriptions

Andre Niyongabo Rubungo, Craig Arnold, Barry P. Rand, Adji Bousso Dieng

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Code for LLM-Prop can be found at: https://github.com/vertaix/LLM-Prop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05281 2026-08-28 cs.HC 版本更新 86%

Algorithmic Fairness Perceptions in the Global South: Evidence from Bangladesh on Ride-Sharing, Beauty Filters, and Large

全球南方的算法公平感知:来自孟加拉国关于网约车、美颜滤镜和大型语言模型的证据

Ahmed Abdal Shafi Rasel, Ahmed Mustafa Amlan, Tasmim Shajahan Mim

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究通过对孟加拉国199名民众的双语调查,揭示了情境影响算法公平感知、对算法保护需求普遍、美颜滤镜损害自我形象、识别与阐明LLM文化偏见存在差异等四个关键模式,指出仅结果导向的公平指标存在局限。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24976 2026-08-27 cs.DL 新提交 86%

A Comparative Evaluation of Digitization Pipelines for Historiographical Sources

史学资料数字化处理管道的对比评估

Marina Gómez Rey, Patricia Callejo, Mario Muñoz-Organero, Carlos Alario-Hoyos

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究对比评估了13种PDF转文本提取管道,发现Marker直接提取性能最优,LLM后校正无系统性改进,端到端解析是异构历史藏品的可靠方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23084 2026-08-25 cs.SE 新提交 86%

ARGUS: MCP-Grounded Root Cause Analysis for Kubernetes Incidents

ARGUS:基于MCP的Kubernetes事件根本原因分析工具

Ergi Senja, Seyed Mohammad Reza Razavi Zadegan, Philipp Leitner

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 ARGUS是一款基于MCP的Kubernetes事件根本原因分析助手,通过标准化MCP服务器关联LLM与实时可观测数据,在Slack频道提供诊断摘要,经评估其能100%识别根本原因,但修复建议可信度不足。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21387 2026-08-25 cs.RO cs.SY eess.SY 新提交 86%

Multimodal-Language-Model-Driven Interaction and Companionship for Service Robots in Elderly-Care Facilities

面向养老机构服务机器人的多模态语言模型驱动的交互与陪伴

Ching-Chieh Liu, Cong-Thanh Vu, Yen-Chen Liu

机构 * National Cheng Kung University (NCKU)(成功大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对养老机构服务机器人缺乏综合陪伴与安全能力的问题,提出整合主动视觉跟人、LLM语音交互及VLM安全监测的智能陪伴机器人系统,实验验证其跟随交互与跌倒检测的有效性。

Comments Accepted to the 2026 IEEE/ASME International Conference on Advanced Intelligent Mechatronics (AIM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20896 2026-08-24 cs.SE cs.HC 新提交 86%

Beyond the Traceback: Using LLMs for Adaptive Explanations of Programming Errors

超越回溯:利用大语言模型(LLMs)实现编程错误的自适应解释

Alexandru-Radu Moraru, Shreyan Biswas, Ujwal Gadiraju

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究通过103人众包实验,探究LLM生成的两类编程错误解释对调试的影响,发现LLM提升主观评价但未显著改善客观调试性能,提出自适应AI反馈系统需转向动态调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20822 2026-08-24 cs.CY 新提交 86%

Interaction Effects Between Learner Characteristics and Dialogue Format in TTS Dialogue-Based Lessons

基于TTS对话课程的学习者特征与对话形式间的交互效应

Fumie Watanabe, Tota Suko, Takashi Ishida, Yuko Kuma, Manabu Kobayashi, Shigeichi Hirasawa, Gendo Kumoi

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究以222名高一学生为对象,用LLM与TTS生成三类对话课程,发现学习者特征与对话形式对ARCS动机有显著交互效应,提示需结合学习者特征选对话形式,结果为个性化学习设计提供初步证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08866 2026-08-21 cs.SE 版本更新 86%

ArkEval: Benchmarking and Evaluating Automated CodeRepair for ArkTS

ArkEval: 对ArkTS自动代码修复的基准测试与评估

Bang Xie, Senjian Zhang, Zhiyuan Peng, Wei Chen, Chenhao Ying, Yuan Luo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 ArkEval为ArkTS自动代码修复提供首个全面基准,通过挖掘官方仓库问题并采用LLM测试机制,评估了四种先进模型的修复能力,揭示了LLM在该领域的现状与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17355 2026-08-19 cs.CR cs.CE cs.CY 新提交 86%

FlowShield: cryptocurrency anti-money laundering with transaction semantics parsing and fund flow tracking

FlowShield:基于交易语义解析与资金流追踪的加密货币反洗钱

Qishuang Fu, Andreas Deppeler, Joseph K. Liu, Yixin Liu, Shirui Pan, Qin Wang, Weiqing Wang, Tsz Hon Yuen

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 FlowShield是一种加密货币反洗钱框架,通过解析交易语义、重构资金流子图并结合LLM与GCN实现洗钱检测,在BybitML等数据集上平均F1达98.0%,还可生成可读报告辅助调查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17029 2026-08-19 cs.SE cs.HC 新提交 86%

LadderTeam: Dual-Agent Laddering Elicitation Framework

LadderTeam:双智能体阶梯式引出框架

Manjushree Aithal, Alexander Kotz, James Mitchell

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 LadderTeam是基于双智能体LLM架构的自动化UX线框图访谈框架,采用三种探测策略,经216次模拟访谈验证,实现高收敛率与可执行响应匹配率,且无主题偏离。

Comments 4 pages, 1 figure, 2 tables, Accepted in ACM AI Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16022 2026-08-18 cs.SE 新提交 86%

OpenHarmony Bench: Evaluating LLMs and Coding Agents on OpenHarmony App Development

OpenHarmony Bench:评估LLM与编码智能体在OpenHarmony应用开发中的表现

Li Li, Han Hu, Tianjian Zhang, Xin Peng, Fangzhu Mao, Qingyu Zhang, Xiaoheng Xie, Zhongmin Tang, Zhihao Lin, Haolin Ruan, Miaomiao Dong, Liuchuan Zhu, Yue Li, Chi Chen, Wenkang Zhong, Mingfei Zhang, Yang Yu, Bo Sun, Chaorui Zhang, Weixi Zhang, Wei Han, Bo Bai, Kui Liu, Gang Fan, Siru Liu, Jiaqian Zhou, Jiali Sun, Yunbiao Dong, Wenhao Zhong, Yunhong Xu

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 该研究推出OPENHARMONY BENCH应用级编码基准,评估8个LLM驱动的DevEco Code在三类OpenHarmony ArkTS应用任务中的表现,发现新一代模型任务完成率更高、构建性接近饱和但行为正确性不足、spec驱动任务完成率最低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15928 2026-08-18 cond-mat.mtrl-sci 新提交 86%

Synthesizing like a chemist: an iterative, feedback-driven loop for materials discovery

像化学家一样合成:用于材料发现的迭代式反馈驱动循环

Fang Sheng, Steven B. Torrisi, Amanda Volk, Kevin Tran, Koki Nakano, Brian W. Anthony, Tonio Buonassisi

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出一种结合LLM、高光谱成像与多目标贝叶斯优化的闭环框架,可自动化材料合成工作流程,在配对优化中表现优于基线方法,还成功合成了未报道的钙钛矿型化合物Rb3BiI6薄膜。

Comments 38 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15504 2026-08-18 cs.HC 版本更新 86%

Game-Master LLMs for Task-Based Role-Play: Supporting the Acquisition of Idiomatic Language in L2 Learning

游戏大师LLM:基于任务的角色扮演促进自然俚语学习

Amir Tahmasbi, Milad Esrafilian, Judson Wright, Sooyeon Jeong, Aniket Bera

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 本文提出一种基于LLM的任务型角色扮演游戏,通过沉浸式叙事帮助学习者自然习得俚语,实验表明该方法在词汇理解和句法使用方面效果显著,且学习成果能长期保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13454 2026-08-14 cs.HC 新提交 86%

Before You Say It: Anticipating Verbal Behavior from Longitudinal Everyday Conversations with LLMs

在你开口前:基于与大语言模型(LLM)的日常纵向对话预测言语行为

Yasith Samaradivakara, Valdemar Danry, Paul Liang, Pattie Maes

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 本研究提出基于LLM的预测性行为建模方法,通过14名参与者超1000小时的纵向对话数据集,证实可预测特定用户言语行为,为构建个性化AI系统提供新方向。

Journal ref The 39th Annual ACM Symposium on User Interface Software and Technology, UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30777 2026-08-14 cs.SE 版本更新 86%

What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants

当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障

Alif Al Hasan, Sumon Biswas

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)

AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。

Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08417 2026-08-13 cs.CR 版本更新 86%

Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs

注意力是所有你需要的:用于防御大语言模型中的间接提示注入攻击

Yinan Zhong, Qianhao Miao, Yanjiao Chen, Jiangyi Deng, Yushi Cheng, Wenyuan Xu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Rennervate框架,通过注意力机制在token级别检测并清除IPI攻击,有效提升LLM的安全性。

Comments Accepted by Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11033 2026-08-12 cs.MA 新提交 86%

Who Are You Explaining To? A Multi-Agent System for Audience-Aware XAI Narratives

你在向谁解释?面向受众感知的XAI叙事多智能体系统

Francesco Musicco, Danilo Danese, Giuseppe Fasano, Angela Lombardi, Alberto Carlo Maria Mancino, Tommaso Di Noia

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有XAI叙事无法适配不同受众的问题,提出XstrAI多智能体框架,结合三类LLM智能体与修正循环,在糖尿病、中风风险预测任务中,其叙事适配性与保真度优于多数基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08277 2026-08-11 cs.NI 新提交 86%

WirelessOpsAgent: A Benchmark and Agent Design for Action Assurance in Wireless Networks

WirelessOpsAgent:无线网络行动保障的基准测试与智能体设计

Zijian Lu, Yiping Zuo, Hao Xu, Weicong Chen, Xin He, Jiajia Guo, Shi Jin

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有无线网络运维LLM智能体基准未测试执行阶段支持检查的问题,本文提出WirelessOptBench基准与WirelessOpsAgent智能体,使后者在600片段评估中精确行动准确率达0.983,不安全执行率大幅下降。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04120 2026-08-06 cs.HC 新提交 86%

Echoes in the Sky: Computational Thematic Analysis of Online Public Discourse on Bluesky Across Trump's Reelection

空中回响:特朗普连任期间Bluesky平台线上公共话语的计算主题分析

Qile Wang, Ali Salloum, Carolina Coimbra Vieira, Benjamin E. Bagozzi, Mikko Kivelä, Kenneth E. Barner, Matthew Louis Mauriello

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究对特朗普连任期间Bluesky平台上的3850万条相关帖子进行分析,采用LLM辅助聚类结合人工验证识别主题,揭示话语与行政命令的主题分布及情绪变化。

Comments Accepted at ASONAM 2026, to appear in the Springer proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01592 2026-08-04 cs.SE 新提交 86%

How Well Do LLMs Generate Taxonomies in the SE Domain? A Multi-perspective Evaluation Framework

大型语言模型在软件工程领域生成分类体系的表现如何?一个多视角评估框架

Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Tao Xiao, Yasutaka Kamei

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出首个SE领域自动化分类体系生成的多视角评估框架,对比TnT-LLM与CLIMB两种方法及5种LLM,揭示二者在质量、效率上的权衡,为SE领域应用该技术提供了可操作见解。

Comments 13 pages, Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25907 2026-07-29 cs.LG cs.AI cs.CL 新提交 86%

Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models

最小化目标激活:大语言模型中仅输入的评估感知潜在因素抑制

Deepanshu Mody, Samarth Agarwal, Utkarsh Mittal, Dipesh Mahato

机构 * Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型中仅通过输入优化提示来抑制“评估感知”潜在因素,采用特定方法在多种目标结构下对Llama模型进行实验,发现潜在因素可抑制,但激活可读性与行为可控性不同,还解决了相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25447 2026-07-29 cs.MA 新提交 86%

CoRenew: A large language model agent-based policy simulation platform for multifamily residential redevelopment

CoRenew:一个基于大语言模型智能体的多户住宅重建政策模拟平台

Yudi Zhang, Yuming Lin, Li Tian, Yu Wang, Jianghao Yu

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 多户住宅重建政策设计面临集体行动难题,CoRenew平台基于大语言模型智能体,整合地理人口数据,能模拟多利益相关者谈判,评估政策组合效果,支持多种输入与可视化导出,经案例验证,可用于不同背景政策评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03552 2026-07-24 cs.SI 版本更新 86%

From Risk Perception to Behavior Large Language Models-Based Simulation of Pandemic Prevention Behaviors

从风险认知到行为:基于大语言模型的流行病预防行为模拟

Lujia Bo, Mingxuan Chen, Youduo Chen, Xiaofan Gui, Jiang Bian, Chunyan Wang, Yi Liu

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract)

AI总结 本文提出基于大语言模型的流行病预防行为模拟框架,通过静态和动态模块预测和更新行为,验证了其在不同数据环境下的有效性,并展示了政策放松期间行为变化的模拟结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15555 2026-07-20 cs.IR 新提交 86%

LLMs Encode Relevance as a Layer-Wise Cross-Lingual Signal

语言模型将相关性编码为分层跨语言信号

Pietro Bernardelle, Samaneh Mohtadi, Stefano Civelli, Joel Mackenzie, Gianluca Demartini

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型中查询与文档相关性是否可线性解码,通过引导中等规模模型、提取激活并训练线性探针,发现相关性是深度依赖信号,多语言实验有部分跨语言可移植性,为基于LLM的相关性评估提供表征视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07457 2026-07-10 physics.ed-ph 86%

How Well Do AI Systems Solve AP Physics? A Comparative Evaluation of Large Language Models on Algebra-Based Free Response Questions

AI系统如何解决AP物理问题?对大型语言模型在代数基础自由回答问题上的比较评估

Bilas Paul, Jashandeep Kaur, Shantanu Chakraborty, Shruti Shrestha

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract)

AI总结 本文评估了AI系统在解答AP物理自由回答问题上的表现,发现其在代数问题解决上表现良好,但在空间推理和视觉解释方面存在局限。

Comments 10 pages, 3 figures

Journal ref Phys. Educ. 61 045008 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏