arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2605.16832 2026-05-19 cs.CV 91%

Coarse Semantic Injection for LLM-Conditioned Structured Indoor Prediction

粗粒度语义注入用于LLM条件的结构室内预测

Shuliang Zhu, Tomiwa Adey, Jinjia Zhou

机构 * Shuliang Zhu(朱舒良) Tomiwa Adey(阿德伊汤米瓦) Jinjia Zhou(周锦佳)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种接口保持的语义增强方法,用于LLM条件的结构解码,通过将语义证据与点云表示关联,将其编码为RGBB点接口,以提升结构室内预测的精度,特别是在复杂场景中的门框定位和家具检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01245 2026-05-19 cs.CR 91%

Comprehensive Vulnerability Analysis is Necessary for Trustworthy LLM-MAS

全面的漏洞分析对于可信的LLM-MAS至关重要

Pengfei He, Yue Xing, Juanhui Li, Shen Dong, Zhenwei Dai, Xianfeng Tang, Hui Liu, Han Xu, Zhen Xiang, Charu C. Aggarwal, Hui Liu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文探讨了构建可信LLM-MAS需进行全面漏洞分析,提出统一框架以量化不同架构中的漏洞,并识别关键挑战如构建专用评估基准和实现安全信任管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15766 2026-05-18 cs.CE 91%

BioXArena: Benchmarking LLM Agents on Multi-Modal Biomedical Machine Learning Tasks

BioXArena:在多模态生物医学机器学习任务上评估LLM代理的基准测试

Loka Li, Duzhen Zhang, Xingbo Du, Leonard Song, Zixiao Wang, Assanali Aukenov, Noel Thomas, Shakhnazar Sailaukan, Yonghan Yang, Feilong Chen, Jiahua Dong, Kun Zhang, Bin Zhang, Le Song

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出BioXArena基准测试,旨在评估LLM代理能否为异构多模态生物医学数据集生成任务特定的模型训练流程,包含9个领域76个端到端任务,评估指标涵盖隐藏标签、隐藏评分者和生物意识度量,通过标准化环境评估11种代理配置。

Comments 69 pages, 13 figures, 34 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20924 2026-05-15 cs.CR 91%

RLCracker: Evaluating the Worst-Case Vulnerability of LLM Watermarks with Adaptive RL Attacks

RLCracker: 评估LLM水印的最坏情况漏洞

Hanbo Huang, Yiran Zhang, Hao Zheng, Xuan Gong, Yihan Li, Lin Liu, Zhuotao Liu, Shiyu Liang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出RLCracker,通过强化学习方法评估LLM水印的最坏情况漏洞,证明水印对改写攻击高度敏感,并在有限样本下实现高移除率。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04056 2026-05-13 cs.CR 91%

QuiLL: An LLM-Based Vulnerability Assessment Framework for the Wild

QuiLL:一种基于LLM的漏洞评估框架

Rijha Safdar, Danyail Mateen, Syed Taha Ali, Wajahat Hussain

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出QuiLL,首个针对真实世界漏洞检测的综合评估框架,通过端到端流程结合先进LLM优化技术,提供动态上下文学习和新颖评分指标,用于系统评估不同LLM的漏洞检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11772 2026-05-13 cs.SE 91%

Breaking the Dependency Chaos: A Constraint-Driven Python Dependency Resolution Strategy with Selective LLM Imputation

打破依赖混沌:一种基于约束的Python依赖解析策略与选择性LLM填补

Kowshik Chowdhury, Dipayan Banik, Shazibul Islam Shamim

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SMT-LLM,通过形式化约束求解替代LLM猜测,利用AST分析和vermin工具确定Python版本,并在PyPI查询前构建约束图以解决版本一致性问题,提升解析效率。

Comments 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14823 2026-05-11 physics.ed-ph 91%

Using an LLM to Investigate Students' Explanations on Conceptual Physics Questions

利用LLM探究学生对概念物理问题的解释

Sean Savage, N. Sanjay Rebello

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文利用LLM评估学生对能量与动量概念问题的书面解释,发现其评估结果与人类评分者一致,且能揭示不同错误解释类别,为教学提供更深入的理解。

Comments 5 pages, 3 figures and Physics Education Research Conference 2025

Journal ref 2025 PERC Proceedings, pp. 399-404 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02215 2026-05-11 cs.SE 91%

HEJ-Robust: A Robustness Benchmark for LLM-Based Automated Program Repair

HEJ-Robust:基于LLM的自动程序修复的鲁棒性基准

Fazle Rabbi, Jinqiu Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HEJ-Robust基准,通过八种语义保持的代码转换生成1450个实例,评估五种微调LLM,在多种转换下模型性能下降超50%,揭示当前LLM修复模型缺乏对细微语法变化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05260 2026-05-08 cs.CR 91%

SecureMCP: A Policy-Enforced LLM Data Access Framework for AIoT Systems via Model Context Protocol

SecureMCP: 一种通过模型上下文协议实现的基于策略的LLM数据访问框架,用于AIoT系统

Wonbae Kim, Hee-Kyong Yoo

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SecureMCP框架,结合RBAC与MCP服务器,通过五种防御模块实现多层防护,提升LLM生成SQL的安全性,实验显示其在保护数据安全和执行准确率方面表现优异。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27001 2026-05-01 cs.CR cs.SE 91%

An Empirical Security Evaluation of LLM-Generated Cryptographic Rust Code

对LLM生成的密码学Rust代码的实证安全评估

Mohamed Elsayed, Kenneth Fulton, Jeong Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了三种LLM生成的加密Rust代码的安全性,发现通用工具不足,提示策略对结果影响显著,且存在nonce重用等系统性问题。

Comments 10 pages, 2 figures , EASE 2026-The 6th International Workshop on Software Security Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24579 2026-04-28 cs.SE 91%

Measuring the Unmeasurable: Markov Chain Reliability for LLM Agents

测量不可测量的:用于LLM代理的马尔可夫链可靠性

Phat T. Tran-Truong, Xuan-Bach Le

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TraceToChain方法,通过构建吸收离散时间马尔可夫链模型,对LLM代理执行轨迹进行可靠性分析,提供更精确的成功时间分布估计和不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23374 2026-04-28 cs.CR 91%

Ghost in the Agent: Redefining Information Flow Tracking for LLM Agents

代理中的幽灵:重新定义LLM代理的信息流跟踪

Yuandao Cai, Wensheng Tang, Cheng Wen, Shengchao Qin

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出NeuroTaint框架,通过语义证据、因果推理和持久上下文跟踪,解决LLM代理中信息流跟踪问题,优于现有基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23196 2026-04-28 cs.CR 91%

AsmRAG: LLM-Driven Malware Detection by Retrieving Functionally Similar Assembly Code

AsmRAG:通过检索功能相似的汇编代码实现LLM驱动的恶意软件检测

ElMouatez Billah Karbab

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AsmRAG框架,利用LLM分析汇编代码,通过语义检索提升恶意软件检测的可解释性与鲁棒性,实验表明其在检测和家族归因任务中达到96%和95%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22234 2026-04-27 cs.AR 91%

GR-Evolve: Design-Adaptive Global Routing via LLM-Driven Algorithm Evolution

GR-Evolve: 通过LLM驱动的算法进化实现设计自适应的全局路由

Taizun Jafri, Vidya A. Chhabria

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出GR-Evolve框架,利用LLM自动优化EDA工具的全局路由算法,通过设计特性自适应提升路由性能,实验显示在三个工艺节点上实现8.72%的线长减少。

Comments Long version of ICCAD 2026 submitted paper under review. 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21505 2026-04-24 cs.SE 91%

Assessing the Impact of Requirement Ambiguity on LLM-based Function-Level Code Generation

评估需求模糊性对基于LLM的函数级代码生成的影响

Di Yang, Xinou Xie, Xiuwen Yang, Ming Hu, Yihao Huang, Yueling Zhang, Weikai Miao, Ting Su, Chengcheng Wan, Geguang Pu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Orchid基准,评估需求模糊性对LLM代码生成的影响,发现模糊性显著降低模型性能,且高阶模型受影响更严重,揭示了明确与模糊需求之间的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21377 2026-04-24 cs.RO cs.HC 91%

A Replicable Robotics Awareness Method Using LLM-Enabled Robotics Interaction: Evidence from a Corporate Challenge

一种利用LLM增强的机器人交互方法进行可复制的机器人意识:来自企业挑战的证据

S. A. Prieto, M. A. Gopee, Y. Ben Arab, B. García de Soto, J. Esteba, P. Olivera Brizzio

机构 * KINESIS Core Technology Platform, New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校KINESIS核心科技平台) S.M.A.R.T. Construction Research Group, Division of Engineering, New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校S.M.A.R.T.建筑研究小组) AD Ports Group, Corporate Innovation Department(AD Ports集团企业创新部)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于挑战的机器人意识方法,通过LLM增强的人形机器人与阿德港集团员工的互动,展示了在工业环境中提升机器人意识的可行性与可复制性。

Comments 10 pages, 8 Figures, to be submitted for journal per-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20310 2026-04-23 cs.HC 91%

Odor Maps from the LLM-derived similarity scores

从LLM衍生的相似性得分生成气味图

Yuki Harada, Manuel Aleixandre, Manabu Okumura, Takamichi Nakamoto

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究通过比较LLM生成的气味相似性与原始数据距离,验证了LLM在气味图生成中的潜力,展示了精油在气味图中的分布与人类评价的一致性。

Comments 9 pages, 7 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00253 2026-04-23 cs.SE 91%

Towards Explorative IRBL: Combining Semantic Retrieval with LLM-driven Iterative Code Exploration

迈向探索性IRBL:结合语义检索与LLM驱动的迭代代码探索

Moumita Asad, Rafed Muhammad Yasir, Sam Malek

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出GenLoc,结合语义检索与LLM驱动的代码探索功能,通过迭代分析代码库识别故障文件,优于传统和深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17750 2026-04-21 cs.CR cs.PL 91%

SDLLMFuzz: Dynamic-static LLM-assisted greybox fuzzing for structured input programs

SDLLMFuzz: 动-静态LLM辅助灰盒模糊测试用于结构化输入程序

Yihao Zou, Tianming Zheng, Futai Zou, Yue Wu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SDLLMFuzz框架,结合LLM生成结构化输入并利用静态崩溃分析,通过动态-静态反馈机制提升模糊测试效率,实验表明其在漏洞发现和时间效率上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17699 2026-04-21 cs.SE 91%

SelfHeal: Empirical Fix Pattern Analysis and Bug Repair in LLM Agents

SelfHeal:LLM代理中故障修复模式的实证分析与故障修复

Niful Islam, Muhammad Anas Raza, Mohammad Wardat

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究LLM代理中的故障修复模式,提出首个基准数据集AgentDefect,并设计SelfHeal多智能体系统,利用ReAct代理结合内部和外部知识实现高效故障修复。

Comments Accepted at EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17093 2026-04-21 cs.CR 91%

HarmChip: Evaluating Hardware Security Centric LLM Safety via Jailbreak Benchmarking

HarmChip:通过禁用基准测试评估以硬件安全为中心的LLM安全

Zeng Wang, Minghao Shao, Weimin Fu, Prithwish Basu Roy, Xiaolong Guo, Ramesh Karri, Muhammad Shafique, Johann Knechtel, Ozgur Sinanoglu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HarmChip基准测试,评估LLM在硬件安全领域的禁用脆弱性,涵盖16个领域、120种威胁和360个提示,揭示了先进LLM在安全查询与伪装攻击间的矛盾表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11438 2025-11-17 cs.CV 91%

VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models

Mingjie Xu, Jinpeng Chen, Yuzhi Zhao, Jason Chun Lok Li, Yue Qiu, Zekang Du, Mengyang Wu, Pingping Zhang, Kun Li, Hongzheng Yang, Wenao Ma, Jiaheng Wei, Qinbin Li, Kangcheng Liu, Wenqiang Lei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

Comments This is the extended version of the paper accepted at AAAI 2026, which includes all technical appendices and additional experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09724 2025-09-15 cs.CL cs.AI cs.LG 91%

DiTTO-LLM: Framework for Discovering Topic-based Technology Opportunities via Large Language Model

Wonyoung Kim, Sujeong Seo, Juhyun Lee

机构 * Department of Library and Information Science(图书馆与信息科学系) Chung-Ang University(Chung-Ang 大学) Insurance Strategy Planning Team(保险战略规划团队) Postal Savings & Insurance Development Institute(邮政储蓄与保险发展研究所) Future Technology Analysis Center(未来技术分析中心) Korea Institute of Science and Technology Information(韩国科学技术信息院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.AI、cs.LG

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16456 2025-07-23 eess.AS cs.SD 91%

An approach to measuring the performance of Automatic Speech Recognition (ASR) models in the context of Large Language Model (LLM) powered applications

Sujith Pulikodan, Sahapthan K, Prasanta Kumar Ghosh, Visruth Sanka, Nihar Desai

机构 * Department of Mathematics(数学系) Department of Electrical Engineering(电气工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Accepted at INTERSPEECH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00853 2025-05-05 cs.CY 91%

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models

Junfeng Jiao, Saleh Afroogh, Abhejay Murali, Kevin Chen, David Atkinson, Amit Dhurandhar

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11070 2024-12-17 cs.CV 91%

HC-LLM: Historical-Constrained Large Language Models for Radiology Report Generation

Tengfei Liu, Jiapu Wang, Yongli Hu, Mingjie Li, Junfei Yi, Xiaojun Chang, Junbin Gao, Baocai Yin

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13596 2024-12-02 cs.CV 91%

EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing

Wei Zhang, Miaoxin Cai, Tong Zhang, Jun Li, Yin Zhuang, Xuerui Mao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04987 2024-09-10 cs.HC 91%

How to Align Large Language Models for Teaching English? Designing and Developing LLM based-Chatbot for Teaching English Conversation in EFL, Findings and Limitations

Jaekwon Park, Jiyoung Bae, Unggi Lee, Taekyung Ahn, Sookbun Lee, Dohee Kim, Aram Choi, Yeil Jeong, Jewoong Moon, Hyeoncheol Kim

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21593 2024-08-01 cs.HC 91%

LLM-for-X: Application-agnostic Integration of Large Language Models to Support Personal Writing Workflows

Lukas Teufelberger, Xintong Liu, Zhipeng Li, Max Moebus, Christian Holz

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11007 2024-06-18 cs.CR cs.SE 91%

Threat Modelling and Risk Analysis for Large Language Model (LLM)-Powered Applications

Stephen Burabari Tete

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏