arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2607.28710 2026-08-03 cs.CY 新提交 91%

Structured AI Demonstrations and Student LLM Use in Engineering Mechanics: Study Design and Preliminary Results

工程力学中的结构化AI演示与学生大语言模型(LLM)使用:研究设计与初步结果

Shuang Geng, Helen Lallos-Harrell, Jiya Ashar, Thomas J. McKenna, Annwesa Dasgupta, Caleb Farny, Emma Lejeune

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对工程力学课程设计了含九次结构化AI演示的方法论框架,结合调查工具分析学生LLM使用情况,为工程教育应对LLM融入提供实证研究基础。

Comments 47 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04510 2026-07-31 cs.CE 版本更新 91%

OSCAgent: Accelerating the Discovery of Organic Solar Cells with LLM Agents

OSCAgent:利用LLM代理加速有机太阳能电池的发现

Zhaolin Hu, Zhiliang Wu, Kun Li, Hehe Fan, Yi Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 OSCAgent通过多代理框架整合检索增强设计、分子生成和系统评估,提升有机太阳能电池材料发现效率,实现预测性能超越传统和LLM基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17253 2026-07-15 cs.AR 版本更新 91%

PDAGENT-BENCH: Characterizing, Grounding, and Architecting LLM/VLM Agents for VLSI Physical Design

PDAGENT-BENCH: 用于VLSI物理设计的LLM代理的特征化、基础化与架构化

Qiufeng Li, Rongqian Chen, Quan Cheng, Chengxuan Wang, Sizhe Tang, Chia-Tung Ho, David Z. Pan, Tian Lan, Weidong Cao

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出PDAGENT-BENCH基准,用于评估LLM/VLM代理在VLSI物理设计中的能力,涵盖任务级和工作流级评估,揭示模型在工具执行和长程推理上的局限,并验证人类技能增强工作流的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28893 2026-07-07 cs.SE cs.CR 91%

Towards Demystifying and Repairing LLM-in-the-Loop Vulnerabilities

迈向揭示与修复LLM-in-the-Loop漏洞

Yujie Ma, Jialin Rong, Chenxi Yang, Lili Quan, Jin Wen, Xiaofei Xie, Yongqiang Lyu, Qiang Hu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过构建首个LLM-in-the-loop漏洞数据集LLMCVE,分析发现LLM常作为目标或传播向量而非根因,并评估现有修复方法,揭示此类漏洞修复更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02333 2026-07-03 cs.SE cs.PL 新提交 91%

Guiding Human Validation of LLM-Generated Code via Verifiable Literate Programming

通过可验证的文字编程指导用户验证LLM生成的代码

Ziqi Yuan, Wenhao Lu, Hao Wu, Dunhong Jin, Chuan Wu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出可验证文字编程框架,通过无歧义的自然语言文档作为中间层,结合细粒度不匹配检测和验证模块,帮助用户有效验证LLM生成代码,将pass@1从28.7%-73.2%提升至65.4%-93.5%。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01980 2026-07-03 cs.SE 新提交 91%

Epic-Organized vs. Requirement-Aligned Gherkin: An Empirical Evaluation of LLM-Based Acceptance Criteria Generation

史诗组织 vs. 需求对齐的 Gherkin:基于 LLM 的验收标准生成的实证评估

Shahbaz Siddeeq, Mateen Abbasi, Jussi Rasku, Zheying Zhang, François Christophe, Tommi Mikkonen, Pekka Abrahamsson

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究比较史诗组织与需求对齐的 LLM 生成 Gherkin 验收标准,发现史诗组织在正确性、可执行性和完整性上更优,语义覆盖率相当。

Comments Accepted for publication at the International Conference on Software Engineering of Emerging Technologies (SEET 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00403 2026-07-02 cs.HC cs.CR cs.CY 新提交 91%

A Penny for Your Prompts: Experiments Detecting and Mitigating LLM Usage by Survey Respondents

为提示付费:检测和减轻调查受访者使用LLM的实验

Zane Xu, Nathan Malkin

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过系列实验量化调查中LLM辅助响应的普遍性,发现其频率因平台而异(Prolific低于10%,MTurk超过80%),并测试了禁用复制粘贴等缓解措施,但未能显著提升数据质量。

Comments Published at SOUPS 2026 (Symposium on Usable Privacy and Security)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30163 2026-06-30 eess.SY cs.SY 91%

End-to-End Abstraction-Based Control with LLM-Enhanced NL-to-LTL Translation

基于端到端抽象的控制与LLM增强的NL到LTL翻译

Amir Bayat, Necmiye Ozay, Alessandro Abate, Raphael M. Jungers

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LLM增强的NL-to-LTL翻译管道,集成到ABCD框架中,并通过实验揭示翻译成功率与LTL公式复杂度的缩放规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12212 2026-06-24 cs.SE cs.CR 新提交 91%

Mind your key: An Empirical Study of LLM API Credential Leakage in iOS Apps

注意你的密钥:iOS应用中LLM API凭证泄露的实证研究

Pinran Gao, Lingxiang Wang, Yi Liu, Kunpeng Liu, Fan Yang, Ying Zhang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究首次系统调查iOS应用中LLM API密钥泄露问题,通过动态分析框架LLMKeyLens检测444个应用,发现282个存在可被利用的凭证泄露,并识别出三种泄露模式,三个月后仅28%完成修复。

Comments 12 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22548 2026-06-24 cs.CL cs.AI cs.LG 版本更新 91%

Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations

LLM评估者真的是自恋者吗?对自我偏好评估的健全性检查

Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Mackenzie Puig-Hall, Narmeen Oozeer

机构 * Department of Machine Learning, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器学习系) Department of Computer Science and Engineering, University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校计算机科学与工程系) Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系) Martian Research, San Francisco, California, USA(火星研究公司) Apart Research, San Francisco, California, USA(Apart研究公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 通过比较评估者自我评价与评价其他模型时的投票分布,发现仅51%的先前结果具有统计显著性,表明自我偏好主要由评估者质量而非自恋驱动。

Comments ICML 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21629 2026-06-23 cs.SE 新提交 91%

Assessing Language Models for Salient Class Identification

评估语言模型在显著类识别中的表现

Bo Xiong, Chaoran Cai, Kaipeng Xiong, Chong Wang, Peng Liang

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract)

AI总结 研究语言模型能否直接从代码提交中识别显著类,无需特征工程或图构建,发现小模型在少样本提示下性能接近大模型,可降低成本和隐私障碍。

Comments 22 pages, 1 images, 8 tables, Manuscript submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22219 2026-06-23 physics.soc-ph 新提交 91%

Lost in Aggregation: A Multi-Scale Diagnostic Benchmark for LLM Spatial Navigation

迷失在聚合中:LLM空间导航的多尺度诊断基准

Yuhan jiang, Peng Luo, Liqiu Meng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出多尺度诊断基准,将迷宫导航分解为局部、节点和全局三个认知层次,评估LLM在空间推理中的失败位置,发现跨尺度聚合是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02690 2026-06-18 cs.SE 版本更新 91%

Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All

超越LLM截止日期:一个面向所有人的实时内核崩溃修复基准

Chenxi Huang, Alex Mathai, Feiyang Yu, Aleksandr Nogikh, Petros Maniatis, Franjo Ivančić, Eugene Wu, Kostis Kaffes, Junfeng Yang, Baishakhi Ray

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Live-kBench和kEnv框架,用于持续评估LLM代理修复新发现的Linux内核崩溃,实验显示代理在截止日期前修复率高出25%,但仅20%的补丁与开发者修复匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17986 2026-06-17 cs.CR 新提交 91%

ShellGames: Speculative LLM-Driven SSH Deception

ShellGames: 基于LLM的推测性SSH欺骗

Umberto Salviati, Fabio De Gaspari, Mauro Conti, Luigi Vincenzo Mancini

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM在欺骗系统中缺乏持久状态、输出不一致等问题,提出ShellGames,结合思维链、记忆管理、推测执行等五种技术,在正确性、一致性、状态跟踪和鲁棒性上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16778 2026-06-16 cs.HC 新提交 91%

A comparison of human and LLM-simulated participants in a writing style task

人类与LLM模拟参与者在写作风格任务中的比较

Felix Gröner, Erin K. Chiou

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过对比30名人类参与者和GPT-4o模拟参与者在写作风格偏好推断任务中的表现,发现LLM存在偏见和缺乏深度,无法准确模拟人类行为,并强调了人类因素在评估人机交互系统中的重要性。

Comments 37 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15610 2026-06-16 cs.CL astro-ph.IM cs.AI cs.LG 新提交 91%

LLM Judges Have Dark Current: A Psychometric Datasheet for LLM-as-a-Judge Evaluation

LLM 裁判具有暗电流:LLM 作为裁判评估的心理测量数据表

Hiroyasu Usami, Keisuke Hara, Ayato Tsuboi, Naohiko Matsuda

机构 * Chubu University(中部大学) Mitsubishi Heavy Industries, Ltd., Research & Innovation Center(三菱重工业株式会社研究创新中心)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出裁判数据表协议,通过真空输入、表面变异、位置偏好等指标测量 LLM 裁判的暗电流和偏差,揭示其测量特性。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13140 2026-06-16 cs.SI 新提交 91%

MIDSim: Simulating Multi-Channel Information Diffusion in Social Media with LLM-Powered Multi-Agent System

MIDSim: 基于LLM多智能体系统的社交媒体多渠道信息扩散模拟

Lexi Liu, Qi Cao, Yuanhao Liu, Huawei Shen, Xueqi Cheng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LLM驱动的多智能体系统,联合建模社交与算法曝光流,模拟多渠道信息扩散,在三个真实数据集上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10546 2026-06-11 cs.MA 版本更新 91%

SkillAxe: Sharpening LLM-Authored Agent Skills Through Evaluation-Guided Self-Refinement

SkillAxe: 通过评估引导的自我精炼提升LLM编写的智能体技能

Srishti Gautam, Arjun Radhakrishna, Sumit Gulwani

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SkillAxe框架,通过无监督评估引导LLM自我诊断和精炼技能,在SkillsBench上提升通过率28%,缩小与人类技能的差距47-67%。

Comments 9 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10095 2026-06-10 cs.HC 新提交 91%

LLM-Based Visualization Evaluation: How Well Do Literacy-Stratified Personas Approximate Human Judgments?

基于LLM的可视化评估:按识字分层的人物角色在多大程度上接近人类判断?

Swaroop Panda

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出识字分层LLM评估框架(LSLE),通过构建可视化识字角色并引导LLM模拟评估,与人类数据对比,发现其在早期设计探索中有效,但在总结性评估中系统失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08588 2026-06-09 cs.SE 新提交 91%

LLM vs. Human Unit Tests: Fault Detection on Real Python Bugs

LLM vs. 人类单元测试:对真实 Python 错误的故障检测

Phouvadeth Vathana, Prapti Bhatt, Rishi Patel, Nasir U. Eisty

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过对比 LLM 生成与人工编写的单元测试在真实 Python 错误上的故障检测能力,发现 LLM 结合检索增强上下文可检测 69% 的故障,远超人工测试的 17.2%,且代码覆盖率相近,表明覆盖率不足以衡量故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08283 2026-06-09 q-fin.PM q-fin.TR 新提交 91%

Macro Economists in the Machine: A Multi-Agent LLM Framework for Commodity-Related ETF Portfolio Construction

机器中的宏观经济学家:用于商品相关ETF投资组合构建的多智能体LLM框架

Yiqing Wang, Dehao Dai, Ding Ma, Kerui Geng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究固定信息集和规则下,LLM在商品投资组合构建中能否增加价值。三种LLM策略(鹰派、鸽派、辩论)在夏普比率上优于规则代理,鹰派和辩论代理增益显著,但辩论代理未超越最佳单一代理,其贡献在于偏差校正。

Comments 45 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02334 2026-06-02 cs.DB 91%

Less Is More? When Dataset Context Hurts LLM-Generated Dataset Descriptions

少即是多?当数据集上下文损害LLM生成的数据集描述时

Lisa-Yao Gan, Arunav Das, Johanna Walker, Klaus Diepold, Elena Simperl

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过大规模消融实验,研究不同数据集上下文(标题、模式、代表性数据)对LLM生成数据集描述质量的影响,发现模式单独使用会降低叙事质量,而代表性数据部分改善但未提升整体面向人类的质量。

Comments Accepted to ICDE26 KDExLLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14097 2026-06-02 cs.HC 91%

Real-Time Group Dynamics with LLM Facilitation: Evidence from a Charity Allocation Task

基于LLM辅助的实时群体动态:来自慈善分配任务的证据

Aaron Parisi, Nithum Thain, Alden Hallak, Vivian Tsai, Crystal Qian

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过两项激励相容的慈善分配实验(N=879),研究LLM辅助对群体共识、分配结果和参与感知的影响,发现LLM虽未提升共识但被偏好,且存在算法引导和包容性幻觉风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20070 2026-06-02 cs.RO 91%

LLM Trainer: Automated Robotic Data Generation via Demonstration Augmentation using LLMs

LLM Trainer:利用大语言模型通过演示增强自动生成机器人数据

Abraham George, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出LLM Trainer,一种利用大语言模型的世界知识将少量人类演示自动扩展为大规模机器人数据集的管道,通过离线标注和在线关键姿势重定向生成新轨迹,并采用汤普森采样优化标注。

Comments 9 pages, 5 figures, 4 tables. Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29293 2026-05-29 cs.MA 91%

LLM-ALSO: LLM-Driven Adaptive Learning-Signal Optimization for Multi-Agent Reinforcement Learning

LLM-ALSO:基于大语言模型驱动的自适应学习信号优化用于多智能体强化学习

Xiaoguang Wu, Zhi Zheng, Hui Xiong

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对稀疏奖励下多智能体强化学习协调困难的问题,提出LLM-ALSO框架,通过迭代诊断、提议和验证机制利用大语言模型自适应优化奖励塑形配置,提升学习效率与性能。

Comments 14 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03089 2026-05-27 cs.CL cs.AI cs.LG 91%

Faithfulness Evaluation for Decoder-only LLM Attributions with Controlled Retained Information

基于受控保留信息的仅解码器LLM归因忠实性评估

Xin Huang, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有软扰动忠实性指标因保留词数不同导致评估偏差的问题,提出π-Soft-NC和π-Soft-NS框架,通过控制期望保留概率公平比较归因方法,并引入专用于自回归解码器LLM的梯度归因方法Grad-ELLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25273 2026-05-26 cs.CY 91%

LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment

LLM-as-a-Judge 在医疗保健中的应用:应用、方法和人类一致性的范围分析

Lingyao Li, Deyi Li, Chen Chen, Renkai Ma, Runlong Yu, Mingquan Lin, Rui Yin, Lizhou Fan, Cathy Shyr, Siyuan Ma, Mei Liu, Steven Bethard

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过PRISMA指导的系统综述,分析了LLM-as-a-Judge在医疗保健中的应用场景、技术配置和与人类专家判断的一致性,发现其在临床决策支持、自然语言处理等领域有广泛应用,但可靠性因任务而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13510 2026-05-26 cs.CY 91%

Safe-Child-LLM: A Developmental Benchmark for Evaluating LLM Safety in Child-LLM Interactions

Safe-Child-LLM:评估儿童与LLM交互安全性的发展基准

Junfeng Jiao, Saleh Afroogh, Kevin Chen, Abhejay Murali, David Atkinson, Amit Dhurandhar

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Safe-Child-LLM基准,通过200个对抗性提示和伦理拒绝量表,系统评估LLM在儿童(7-12岁)和青少年(13-17岁)交互中的安全性,发现主流模型存在严重安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05364 2026-05-25 cs.SE 91%

Survey of LLM Agent Communication with MCP: A Software Design Pattern Centric Review

LLM智能体通信与MCP综述:以软件设计模式为中心的回顾

Anjana Sarkar, Soumyendu Sarkar

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文综述了经典软件设计模式如何增强基于LLM的智能体AI系统中通信的可靠性和可扩展性,重点分析了模型上下文协议(MCP),并探讨了中介者、观察者、发布-订阅和代理等模式在MCP兼容框架中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19110 2026-05-20 cs.CE 91%

IterSIMP-σ: Evaluating LLM-Assisted Spatial Interventions in Stress-Aware Topology Optimization

IterSIMP-σ:评估LLM辅助的应力感知拓扑优化中的空间干预

Shaoliang Yang, Jun Wang, Yunsheng Wang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究多模态大语言模型(LLM)是否能作为可检查的空间提案模块用于应力感知拓扑优化。IterSIMP-σ保持SIMP优化器作为最小化合规性的有限元求解器,并在其周围放置一个确定性的应力传递、门控评估器和混合LLM/规则解释器。每次求解后,密度和von Mises应力场被渲染;解释器提出排名的空间干预;确定性的安全措施接受、拒绝或停止每个动作。主要动作是软密度种子,所选元素在下一次求解前被初始化为高密度,但在最优标准更新时仍保持自由。我们评估该循环在16问题2D控制器-政策基准、6问题探索性3D扩展、被动固体和输入消融、应力阈值敏感性以及固定体积归因研究中,比较LLM提案与确定性最大应力热点种子、随机应力区域种子和基于规则的控制。2D控制器-政策基准显示保留合规性差异较小(软种子LLM的几何均值低1.9%),但此诊断不显著(W=33,双侧p=0.382)且不是固定体积可行最终比较。在固定体积研究中,LLM条件完成了44/48次尝试评估;25/44次完成评估产生了全部门通过的保留状态。与基于规则的控制的可行最终评分分为4/4/1,确定性精确热点种子仍具竞争力。接受的LLM空间动作有每步记录的平均归一化种子到热点距离为0.221。结果支持IterSIMP-σ作为可检查的LLM辅助设计自动化框架用于空间干预,但尚未作为证据表明LLM视觉推理能改进应力约束优化。

Comments 44 pages, 19 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏