arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32271 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32271 篇

2608.04195 2026-08-06 cs.SE 新提交 89%

SONAR: Task-Aware Code Summary Evaluation for LLM Consumers Without References

SONAR:面向LLM使用者的任务感知型代码摘要评估框架(无需参考摘要)

Simantika Bhattacharjee Dristi, Matthew B. Dwyer

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究提出无需参考摘要的SONAR框架,从四个维度评估代码摘要,发现正确性、抽象性对LLM性能影响显著,简洁性、流畅性影响微弱,还明确了不同LLM在各维度的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03880 2026-08-05 cs.PF cs.DC 新提交 89%

Evaluating MFU as a Proxy for GPU Power for Energy-Aware Simulation of LLM Training

评估MFU作为GPU功耗代理用于LLM训练的能效感知仿真

Niklas Enskat, Philipp Wiesner

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本研究测试MFU能否作为LLM训练的GPU功耗预测器,通过近3000次单设备训练基准测试,发现计算密集型 workload 下基于MFU的线性模型适用,特定参数拟合可大幅降低误差。

Comments Accepted at MASCOTS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03535 2026-08-05 cs.SE 新提交 89%

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation

CodeAssay:带有审计基准真值的多指标大语言模型代码生成基准

Shahbaz Siddeeq, Muhammad Waseem, Umar Subhan Malhi, Pekka Abrahamsson

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CodeAssay基准,涵盖185个Python任务,结合多类测试与度量,经审计后发现模型正确性标签有9.0%变化,且验证了多类LLM代码生成的评估特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03091 2026-08-05 cs.IR 新提交 89%

Position Bias Undermines Preference Consistency in Listwise LLM-Based Reranking

位置偏差破坏基于大语言模型的列表式重排序中的偏好一致性

Ethan Bito, Yongli Ren, Estrid He

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究揭示基于LLM的列表式重排序存在位置偏差,引入多维度评估框架验证其会破坏偏好一致性,且均衡位置曝光无法修复该问题。

Comments Accepted at RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02827 2026-08-05 cs.MA 新提交 89%

Emergence of Biased Consensus in Multi-Agent LLM Debates

多智能体LLM辩论中偏向性共识的涌现

Maya Okawa

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究针对多智能体LLM辩论中集体偏向性共识的涌现问题,提出物理启发的社会动力学分析框架,经实验验证其相变规律,发现智能体异质性可抑制该现象,且见解可推广至投资等现实决策任务。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02758 2026-08-05 cs.MA 新提交 89%

Everyone Conforms, No One Believes: Pluralistic Ignorance in LLM Agent Populations

人人遵从,无人认同:LLM智能体群体中的多元无知

Yashwanth YS

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究证实LLM智能体群体中会出现多元无知,构建了多场景基准评估8种模型,发现遵从率高且级联成功率低,提示模型选择会影响模拟结果,LLM模拟或高估社会规范稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28814 2026-08-03 cs.CL cs.AI cs.LG 新提交 89%

Rolling With Resistance: Preference-Optimized LLM Counselors Can Trade Goal Persistence for Relational Attunement in Motivational Interviewing

顺应阻力:偏好优化的大型语言模型(LLM)咨询师可在动机访谈中权衡目标坚持性与关系调谐

Weiying Chen, Junlong Shen, Zhexuan Tang

专题命中 评测与基准 :LLM(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究基于动机访谈准则构建双轴评估框架,通过偏好优化训练LLM咨询师,发现惩罚对抗会降低目标坚持性,惩罚妥协无显著效果,仅提示控制可提升关系调谐且无目标坚持性代价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28165 2026-08-03 cs.CR 版本更新 89%

Piggybacking on Perception: Stealthy Concurrent Audio Prompt Injections against Multimodal LLM Agents

利用感知能力:针对多模态大语言模型智能体的隐蔽并发音频提示注入攻击

Mingxiao Liu, Yitong Li, Haoren Zhao, Yaoxiang Bian, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对多模态LLM智能体提出隐蔽并发音频提示注入攻击,构建首个相关基准并评估多款智能体,还提出CADV防御机制,经实验验证攻击有效且防御可靠。

Comments 19 pages, 8 figures, The code is publicly available at https://github.com/Limax666/AudioAgentSecurity

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11270 2026-07-31 cs.SE 版本更新 89%

Evaluating LLM Agents on Automated Software Analysis Tasks

评估LLM代理在自动化软件分析任务中的性能

Islem Bouzenia, Cristian Cadar, Michael Pradel

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过AnalysisBench评估四种LLM架构在自动化软件分析任务中的表现,发现AnalysisAgent在手动验证的成功率高达94%,而现有代理存在阶段混用、错误定位差等问题,且整程序分析和符号执行是最具挑战性的任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16794 2026-07-27 cs.CV 版本更新 89%

LLM-Based Visual Explanation Evaluation Framework for Assessing the Explainability of Facial Skin Disease Classification Models

基于LLM的视觉解释评估框架:用于评估面部皮肤病分类模型的可解释性

Gyuyeon Na

机构 * AI and Business Analytics, Ewha Womans University(人工智能与商业分析,成均馆大学)

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出基于LLM的视觉解释评估框架,通过渐进式提示工程评估Grad-CAM在面部皮肤病诊断模型中的解释质量,聚焦病变定位和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12467 2026-07-15 cs.SE 新提交 89%

Understanding before Naming! Enhancing LLM-based Method Name Prediction with Code Summarization

命名之前先理解!通过代码摘要增强基于大语言模型的方法名预测

Wei Liu, Weisong Sun, Tingting Xu, Hanwei Qian, Yi Zhao, Chunrong Fang, Xia Feng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对方法名预测中现有评估不能反映语义质量、基于LLM的方法与人命名过程不同的问题,通过实证研究比较多种评估器及策略,提出结合摘要和细化的SMNP方法,实验证明该方法在方法名预测上有效且鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12089 2026-07-15 cs.CR cs.SE 新提交 89%

Cross-Cutting Security Analysis of LLM-Generated Code via Metamorphic Testing and Association Rule Mining

通过变形测试和关联规则挖掘对大语言模型生成代码进行横切安全分析

Zedong Peng, Chenggang Wang, Shangyue Zhu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对LLM生成代码的安全漏洞,提出结合变形测试与关联规则挖掘的框架,定义九个MRs并应用于3700个代码片段,揭示共同违反结构与横切模式,还进行提示级风险分析,发现不安全代码生成具结构化和提示依赖性,推动相关验证与干预。

Comments This work has already been accepted by IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11390 2026-07-14 cs.SE 新提交 89%

TerraRepair: A Tool-Grounded LLM Agent for Infrastructure-as-Code Repair

TerraRepair:一种用于基础设施即代码修复的工具接地大语言模型代理

Minase Mekete Mengistu, Juri Di Rocco, Phuong T. Nguyen, Davide Di Ruscio

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究探讨工具接地能否改进基于LLM的Terraform修复及何时升级问题。提出TerraRepair工具接地LLM代理,通过检索上下文等操作进行修复。实验表明其能显著提高扫描器验证修复率,凸显工具接地改进修复效果,同时指出特定部署上下文是自主修复的主要限制。

Comments The paper has been peer reviewed and accepted for publication in the proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24283 2026-07-14 quant-ph 版本更新 89%

AutoQResearch: LLM-Guided Closed-Loop Policy Search for Adaptive Variational Quantum Optimization

AutoQResearch:基于LLM的闭环策略搜索用于自适应变分量子优化

Monit Sharma, Hoong Chuin Lau

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出AutoQResearch,通过LLM引导的闭环实验框架,实现变分量子优化中求解器的自适应配置,通过阶段确认和低成本评估避免过拟合,展示在最大独立集和车辆路径问题上的有效性。

Comments Accepted at the 2026 IEEE International Conference on Quantum Computing and Engineering (QCE 2026), Quantum-GenAI Co-Design & Co-Discovery (QGDD) Technical Papers Track. QCE26 Technical Paper 238

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03378 2026-07-10 cs.CR cs.SE 版本更新 89%

ARGUS: Defending LLM Agents Against Context-Aware Prompt Injection

ARGUS:防御大语言模型智能体免受上下文感知提示注入攻击

Shihao Weng, Yang Feng, Jinrui Zhang, Xiaofei Xie, Jiongchi Yu, Jia Liu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对LLM智能体的上下文感知提示注入攻击,提出AgentLure基准测试及ARGUS因果溯源审计器,通过构建溯源图等验证行动因果依据,在AgentLure上降低攻击成功率,提升安全-效用权衡表现。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07739 2026-07-10 cs.CR 新提交 89%

Controllability-Aware Adversarial Examples Against LLM-Based Network Traffic Classifiers

针对基于大语言模型的网络流量分类器的可控性感知对抗样本

Zhenpeng Li

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的网络流量分类器的对抗鲁棒性,提出可控性感知黑盒迁移框架,按通信语义划分特征组限制扰动,生成对抗样本并迁移到多个目标,发现LLM迁移漏洞及相关特性,验证跨架构迁移层次和交叉代理有效性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27140 2026-07-08 cs.CR 版本更新 89%

Measuring the Security of Mobile LLM Agents under Adversarial Prompts from Untrusted Third-Party Channels

在来自不受信任第三方渠道的对抗性提示下衡量移动大语言模型代理的安全性

Chenghao Du, Quanfeng Huang, Tingxuan Tang, Zihao Wang, Adwait Nadkarni, Yue Xiao

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究移动LLM代理在对抗性环境下的安全风险,设计评估一系列案例研究,涵盖多种攻击类型并涉及多个先进移动代理,通过大量试验揭示系统漏洞,映射攻击到相关框架发现新途径,证明其在现实中可被利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01855 2026-07-03 cs.SE 新提交 89%

Regression Accumulation in Multi-Turn LLM Programming Conversations

多轮LLM编程对话中的回归累积

Yonghui, Huang, Lin Ma, Amjed Tahir, Qian Zhang, Liwen Xiao, Lysa Xiao

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 研究多轮LLM编程对话中代码建议破坏先前需求的回归累积问题,通过构建542个任务链评估六种模型,发现40%-73%的任务出现回归,并验证了Verification Gate策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01277 2026-07-03 cs.CR 新提交 89%

Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety

认知防火墙:一种主动、零信任、多门控的LLM安全框架

Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01040 2026-07-02 cs.IR 新提交 89%

As It Was: Aligning LLM Search Evaluation with Historical User Preferences

如其所是:将LLM搜索评估与历史用户偏好对齐

Ali Vardasbi, Gustavo Penha, Enrico Palumbo, Claudia Hauff, Hugues Bouchard, Mounia Lalmas

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00910 2026-07-02 cs.MA 新提交 89%

Calibrating the Instrument: Controllability of an LLM-Driven Synthetic Population

校准仪器:LLM驱动的合成人群的可控性

Mirko Degli Esposti

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出SIVE实验,通过七项预注册标准评估LLM驱动合成人群对已知效价刺激的响应可控性,发现弱阳性消息被识别为阴性,经重新设计后恢复预期排序,并揭示噪声特性与微观动力学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00555 2026-07-02 cs.SE 新提交 89%

Rise From The Ashes: LLM-based Static Analysis for Deep Learning Framework Bugs

从灰烬中崛起:基于LLM的深度学习框架缺陷静态分析

Shaoyu Yang, Haifeng Lin, Chunrong Fang, Xiang Chen, Wei Cheng, Jiawei Liu, Yiyu Zhang, Hongyu Liu, Zhenyu Chen

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出首个基于LLM的静态分析技术Phoenix,通过结构化语义桥接中间表示建模跨语言张量流,结合多智能体工作流检测深度学习框架缺陷,已在PyTorch中发现31个新bug。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32034 2026-07-01 cs.LG cs.AI cs.CL 新提交 89%

QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents

QVal:廉价评估长周期LLM智能体的密集监督信号

Sergio Hernández-Gutiérrez, Matteo Merler, Ilze Amanda Auzina, Joschka Strüber, Ameya Prabhu, Matthias Bethge

机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出QVal,一种无需训练的基准测试,通过Q值对齐直接评估密集监督信号质量,避免下游训练开销。在21种方法、4个环境上的实验表明,简单提示基线优于现有方法。

Comments 10 pages, 5 figures in main text; 48 pages, 6 figures with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30109 2026-06-30 cs.RO 89%

TacEvo: Self-Evolving Architecture Discovery for Robotic Tactile Perception via LLM-Driven Quality-Diversity Search

TacEvo:通过LLM驱动的质量多样性搜索实现机器人触觉感知的自演化架构发现

Mohammed AbuSadeh, Lan Wei, Dandan Zhang

机构 * Department of Bioengineering, Imperial-X Initiative, Imperial College London(生物工程系、Imperial-X计划、伦敦帝国学院)

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出TacEvo框架,利用LLM生成代码级变异和交叉,结合MAP-Elites质量多样性循环,自动发现高效触觉感知网络架构,在力回归和光栅分类任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28340 2026-06-30 cs.IR 89%

Rethinking Fairness in LLM-Based Recommender Systems: A Survey

重新思考基于LLM的推荐系统中的公平性:一项综述

Song-Duo Ma, Chu-Yun Chen, Bang-An Li, Pin-Yu Chen, Shau-Yung Hsu, Yun-Nung Chen

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文系统综述了基于大语言模型的推荐系统中的公平性问题,从偏见机制和公平目标两个维度组织现有研究,并探讨了评估与缓解策略,旨在为未来研究提供结构化基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27666 2026-06-29 cs.AR 新提交 89%

MultModLM: A multi-modal benchmark for Large-Language Model based hardware schematic generation

MultModLM:基于大语言模型的硬件原理图生成的多模态基准

Dhruv Kulkarni, Sai Manoj Pudukotai Dinkarrao

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 提出MultModLM基准,评估LLM从RTL描述生成硬件原理图的能力,通过多阶段评估框架发现模型生成原理图功能正确性有限,且LLM评估者与人类评分一致性极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27650 2026-06-29 cs.MA 新提交 89%

GenWorld: Empirically Grounded Urban Simulation Infrastructure for Scalable LLM-Agent Studies

GenWorld:用于可扩展LLM智能体研究的经验性城市模拟基础设施

Gen Li, Jieyuan Lan, Pengcheng Xu, Zongyuan Wu, Masaki Ogura, Tao Feng

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出GenWorld,一种结合合成城市、结构化接口和离线编译LLM决策信号为查找策略的经验性城市模拟基础设施,实现可扩展的LLM智能体研究。

Comments 27 pages, 24 figures. Code: https://github.com/Perseus1993/genworld. Project page: https://genworld1993.netlify.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26978 2026-06-26 cs.SE 新提交 89%

To Run or Not to Run: Analyzing the Cost-Effectiveness of Code Execution in LLM-Based Program Repair

运行还是不运行:分析基于LLM的程序修复中代码执行的成本效益

Zhihao Lin, Junhua Zhu, Mingyi Zhou, Xin Wang, Zhensu Sun, Renyu Yang, David Lo, Li Li

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 通过分析SWE-bench上的代理轨迹和端到端修复尝试,发现代码执行在LLM程序修复中普遍使用但效益不均,限制执行可节省成本且不影响修复成功率。

Comments Accepted to the ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026). 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26937 2026-06-26 cs.HC 新提交 89%

Continuous Behavioral Synthesis for Adaptive Health Dashboards: An LLM-Mediated Architecture Integrating Explicit Preference, Spatial Reorganization, and Attention Allocation Signals

自适应健康仪表盘的连续行为合成:一种集成显式偏好、空间重组和注意力分配信号的LLM中介架构

Tiziano Santilli, Mina Alipour, Mahyar T. Moghaddam

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种利用大语言模型作为行为合成引擎的架构,通过集成显式反馈、空间重组和注意力信号,实现从稀疏异构用户信号中即时生成自适应仪表盘布局。

Comments 33 pages, Accepted EICS2026 Patras, Greece

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25296 2026-06-25 cs.AR 新提交 89%

SafeGen: LLM-Driven Assertion Generation and Fault Criticality Evaluation for Functional Safety

SafeGen: 面向功能安全的LLM驱动断言生成与故障关键性评估

Xuanyi Tan, Arjun Chaudhuri, Rubin Parekhji, Krishnendu Chakrabarty

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SafeGen框架,利用大语言模型和超知识图谱从设计文档提取规范并生成功能安全断言,结合门级到RTL故障映射与形式验证实现故障关键性语义分级,在FOC系统中验证了优于传统方法。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏