arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-26 至 2026-08-26 共收录 102 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 102 篇

2608.23705 2026-08-26 cs.CL cs.AI cs.CY 新提交 93%

The Limits of Automatic Evaluation of Creativity in Large Language Models

大型语言模型创造力自动评估的局限性

Alessandro Tutone, Giorgio Franceschelli, Mirco Musolesi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,当前自动评估方法及LLM作为评判者的评估方式,与人类对LLM生成文本创造力的判断存在显著不一致,无法有效捕捉创造力的关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16478 2026-08-26 cs.IR cs.CL 版本更新 92%

Music Recommendation with Large Language Models: Challenges, Opportunities, and Evaluation

基于大语言模型的音乐推荐:挑战、机遇与评估

Elena V. Epure, Yashar Deldjoo, Bruno Sguerra, Markus Schedl, Manuel Moussallam

机构 * Deezer Research(Deezer研究机构) Johannes Kepler University Linz(约翰·凯撒大学林茨分校) Linz Institute of Technology(林茨技术研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 探讨音乐推荐系统从依赖信息检索框架向LLM驱动转变面临的挑战与机遇,通过回顾LLMs对音乐相关建模的重塑、审视自然语言处理评估实践,勾勒成功与风险维度,为音乐推荐系统评估提供跨学科视角。

Comments Accepted for publication in ACM Transactions on Recommender Systems (TORS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29717 2026-08-26 cond-mat.mtrl-sci cs.AI cs.LG 版本更新 91%

Optimizing Expert-Designed Crystal Graph Networks for Band-Gap Prediction with an Autonomous LLM Research Loop

利用自主LLM研究循环优化专家设计的晶体图网络用于带隙预测

Chenmu Zhang, Boris I. Yakobson

机构 * Department of Materials Science and NanoEngineering(材料科学与纳米工程系)

专题命中 评测与基准 :LLM(title,title_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出一个自主LLM研究循环,在MatBench带隙基准上构建了无需外部预训练的最准确模型,超越了所有17个专家设计模型,通过实现元素对特征和空间群嵌入等已知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24231 2026-08-26 cs.CL 新提交 91%

RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges

RecurSE:面向LLM规则评判器的有界递归自评估

Kaiyuan Liu, Ziyuan Zhuang, Rongxiang Weng, Jieping Ye

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Meituan LongCat Team(美团龙猫团队)

专题命中 评测与基准 :LLM(title,title_cn);post-training(abstract);分类 cs.CL

AI总结 本研究提出RecurSE,一种无需外部监督的LLM规则评判器优化方法,通过同步评判器与检查器的协同演化、接口解耦及PAV监控,在多基准上实现泛化提升,可增强下游策略对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10068 2026-08-26 cs.CR cs.AI cs.CL 版本更新 91%

ADVERSA: Measuring Multi-Turn Guardrail Degradation and Judge Reliability in Large Language Models

ADVERSA:测量大型语言模型中多轮护栏退化和裁判可靠性

Harry Owiredu-Ashley

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 ADVERSA通过连续合规轨迹评估大型语言模型在多轮对抗中的护栏退化及裁判可靠性,揭示早期轮次更易成功突破。

Comments 12 pages, 12 figures. Independent research. Code and artifacts: this https URL (https://github.com/Harry-Ashley/adversa-guardrail-degradation). Published in the 2026 IEEE/ACIS 24th International Conference on Software Engineering Research, Management and Applications (SERA), pp. 414-417. Recipient of the Best Paper Award at IEEE/ACIS SERA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24191 2026-08-26 cs.CL cs.AI 新提交 90%

'Ghaib in Translation' aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with 'Missed-in-Urdu' Scores in LLM Hate Speech Detection

《翻译中的隐秘危害:利用“乌尔语未检出”分数测量大型语言模型仇恨言论检测中的跨文字安全不一致性》

Fawzia Zehra (Fuzzy) Kara-Isitt, Sonal Khosla, Stephen Swift

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对乌尔语在LLM安全评估中的缺失问题,测试五款LLM在多类乌尔语相关数据集上的表现,发现其跨文字安全不一致性,且开放权重模型问题更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19743 2026-08-26 cs.AI cs.LG cs.MA 版本更新 90%

EngiAI: Capability-Based Evaluation of Tool-Connected LLM Agents for Engineering Design

EngiAI: 面向LLM驱动工程设计的智能体框架与基准测试套件

Gioele Molinari, Florian Felten, Soheyl Massoudi, Mark Fuge

机构 * IDEAL Chair of Artificial Intelligence in Engineering Design(人工智能与工程设计理想 chair) ETH Zurich(苏黎世联邦理工学院) Autom8.build

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出EngiAI多智能体系统框架和包含工作流、RAG、HPC三维度的基准套件,通过监督架构协调七个专业智能体,验证了LLM在工程设计中的能力与局限。

Comments 42 pages, 17 figures, 15 tables. Extended version of work presented at the ASME 2026 International Design Engineering Technical Conferences and Computers and Information in Engineering Conference (IDETC-CIE 2026), Houston, Texas, USA, August 23-26, 2026. Submitted to the ASME Journal of Mechanical Design

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24314 2026-08-26 cs.AI cs.ET 新提交 90%

Benchmarking LLM Judges for Voice-Agent Evaluation: Reliability, Calibration, and Human Oversight

用于语音智能体评估的LLM评判基准:可靠性、校准与人工监督

Anupam Purwar, Shashank Singh, Kritika Srivastava

机构 * Sprinklr AI

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究对比人工与GPT-4.1、GPT-5对电信和零售语音智能体对话的评估,发现LLM评估可靠性依赖指标与配置,可作为规模化评估组成部分,支持混合评估 pipeline。

Comments Extends LLM-as-a-Judge to voice agents across telecom and retail, testing GPT-4.1 and GPT-5 against human raters across 10 safety and efficiency metrics. A correlation-based calibration analysis reveals domain-dependent reliability and identifies Recovery Turn Count and safety-recall metrics as unreliable for fully automated judging

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16654 2026-08-26 cs.CL cs.AI cs.LG 版本更新 90%

Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models

Omanic:迈向大语言模型多跳推理的逐步评估

Xiaojie Gu, Sherry T. Tong, Aosong Feng, Sophia Simeng Han, Jinghui Lu, Yingjian Chen, Yusuke Iwasawa, Yutaka Matsuo, Chanjun Park, Rex Ying, Irene Li

机构 * The University of Tokyo(东京大学) Yale University(耶鲁大学) Stanford University(斯坦福大学) Xiaomi EV(小米EV) Soongsil University(顺天大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型在多跳问答中中间步骤推理失败难以诊断的问题,提出Omanic基准,通过分解为单跳子问题并分析步骤级错误,揭示后期跳数瓶颈、事实知识下限和错误传播,微调后提升多个推理基准性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24825 2026-08-26 cs.AI 新提交 90%

A Dual-Dimensional LLM Framework for Automated Item Incidental Content Similarity Analysis in Large-Scale Assessments

面向大规模评估中项目附带内容自动相似度分析的双维度大语言模型框架

Jing Huang, Jihong Zhang, Hua-Hua Chang

机构 * University of Arkansas(阿肯色大学) Purdue University(普渡大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出双维度LLM驱动的AISA框架,其衍生指标在心理测量学验证中表现更优,应用于CAT时可提升估计稳定性、减少偏差,优于传统度量,支持多种评估场景。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24419 2026-08-26 cs.AI 新提交 90%

A Judge Should Know What Changed:Construct Validity for LLM-as-a-Judge Evaluation

评审应知晓变化内容:LLM作为评审评估的结构效度

Jianlin Chen, Wenhui Chen, Ziyao Lin, Chi Man Vong

机构 * South China University of Technology(华南理工大学) University of Macau(澳门大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究针对LLM作为评审的评估,提出二维结构效度指标(不变性S与结构敏感性R),发现高评审一致性常伴随对结构变化的弱敏感性,建议联合报告两指标并审计验证集。

Comments 39 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24228 2026-08-26 cs.AI 新提交 90%

Evaluating Multiple LLM Generations with Validated Task Coverage

通过验证的任务覆盖度评估多个大语言模型(LLM)生成结果

Florian Le Bronnec, Rio Yokota

机构 * RIKEN Center for Computational Science(理化学研究所计算科学中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究针对多候选LLM生成的评估场景,构建了五领域基准VTC-Bench并提出核心指标VTC,发现传统评估无法识别的模型行为差异,为多候选生成评估提供了新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24156 2026-08-26 eess.SY cs.AI cs.ET 新提交 90%

LLM-Guided Contextual Action Evaluation for Operational Decisions in Industrial Processes

用于工业过程操作决策的大语言模型引导型上下文动作评估(LCAE)

Youcheng Zong, Runda Jia, Dakuo He

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出LCAE方法,用LLM标准化工业文档为关系基础,结合历史调节关系强度,让文档语义融入策略学习,以优化工业过程操作决策的动作评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24297 2026-08-26 cs.HC 新提交 89%

When AI "Works," When Does Help Begin?: Intergenerational Support Around Older Adults' LLM Usage

当AI“发挥作用”时,何时需要提供帮助?:围绕老年人使用大语言模型(LLM)的代际支持

Hyehyun Chu, Yuri Lee, Yeon Su Park, Saelyne Yang, Juho Kim

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究针对6名老年人和7名年轻人开展定性研究,发现代际LLM支持存在信号不足、知识无法复用的问题,据此提出代际LLM支持的相关设计启示。

Comments 5 pages, 1 table, Accepted by CSCW 2026 workshop Growing Up (and Old) with AI: Co-Constructing the Future for Family-Centered AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24269 2026-08-26 cs.SE cs.CR 新提交 89%

Towards LLM-Enhanced Android Taint Analysis

面向大语言模型增强的Android污点分析

Nicholas Miazzo, Marco Alecci, Jordan Samhi, Jacques Klein, Eleonora Losiouk

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文探究商用LLM能否有效推理Android应用的污点流,提出智能体交互策略,在DroidBench基准上Gemini-3 Flash的F1分数达0.96(优于FlowDroid的0.55),还能识别真实应用中FlowDroid未发现的潜在数据泄露,可补充传统静态污点分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23630 2026-08-26 cs.SE 新提交 89%

FPGAgent: An LLM-Assisted Framework for Autonomous HLS Code Generation and Verification in FPGA Environments

FPGAgent:一种用于FPGA环境中自主HLS代码生成与验证的大语言模型辅助框架

Tianyu Wang, Wenjie Wang, Jianguo Yao, Haibing Guan, Xijun Li

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 FPGAgent是首个经成熟基准验证的任务规范到可执行HLS生成的多智能体框架,可自主生成并验证FPGA的HLS代码,在HLS-Eval基准上可综合率等指标平均提升16.9%等,大幅提升了LLM生成HLS代码的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14646 2026-08-26 cs.SE cs.PL 版本更新 89%

ALT4Decompile: Inferring C-aligned Abstract Loop Tree for LLM-Based Binary Decompilation

ALT4Decompile:用于基于大语言模型的二进制反编译的C语言对齐抽象循环树推断

Yongpan Wang, Puzhuo Liu, Xin Xu, Siyuan Li, Yaowen zheng, Xiaodong Gu, Beijun Shen

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 ALT4Decompile通过构建C语言对齐的抽象循环树(ALT)弥合汇编与C的语法差距,微调适配ALT的LLM生成反编译代码,在多数据集上实现最优反编译效果,提升了测试用例通过率。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23646 2026-08-26 cs.AI cs.LG 新提交 89%

MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models

MolEmb:多模态大语言模型可作为强大的分子嵌入模型

Xinjian Zhao, Xiangru Jian, Yaoyao Xu, Xiaozhuang Song, Wei Pang, Lei Bai, Tianshu Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG;foundation model(comments)

AI总结 本文提出MolEmb框架,利用多模态大语言模型构建通用分子嵌入模型,在分子性质预测上具竞争力,还提出MolCAR基准验证上下文感知分子嵌入的特性。

Comments Presented at the 3rd Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences (FM4LS), ICML 2026. Non-archival workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05633 2026-08-26 cs.CL 版本更新 89%

CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models

CASTLE:一个评估大语言模型学生定制个性化安全性的综合基准

Rui Jia, Ruiyi Lan, Fengrui Liu, Zhongxiang Dai, Bo Jiang, Jing Shao, Jingyuan Chen, Guandong Xu, Fei Wu, Min Zhang

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Education University of Hong Kong(香港教育大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 CASTLE基准通过评估学生定制个性化安全性,揭示大语言模型在不同学生属性下的安全缺陷。

Comments Accepted to main of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13182 2026-08-26 cs.SE cs.AI 版本更新 89%

From Empirical Evaluation to Context-Aware Enhancement: Repairing Regression Errors with LLMs

从经验评估到上下文感知增强:使用LLM修复回归错误

Anh Ho, Thanh Le-Cong, Bach Le, Christine Rizkallah

机构 * The University of Melbourne(墨尔本大学) Singapore University of Technology and Design(新加坡科技与设计大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过构建回归错误基准RegressionBug4APR,评估传统APR和基于LLM的APR方法,发现上下文感知增强(引入错误诱导变更信息)使LLM-based APR修复成功率提升1.6倍。

Comments Minor revision at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15741 2026-08-26 cs.NE cs.CL cs.MA 版本更新 89%

Explainable Information Processing in Particle Swarm Optimization through Landscape and Search Behavior Analysis

基于景观与搜索行为分析的粒子群优化可解释信息处理

Nitin Gupta, Bapi Dutta, Anupam Yadav

机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系) Department of Computer Science, Universidad de Jaén(西班牙Jaén大学计算机科学系) School of Computer and Mathematical Sciences, University of Adelaide(阿德莱德大学计算机与数学科学学院) Leiden Institute of Advanced Computer Science, University Leiden(莱顿大学先进计算机科学研究所) Department of Mathematics and Computing, Dr. B. R. Ambedkar National Institute of Technology(德拉·B·R·阿姆贝卡尔国立理工学院数学与计算系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究针对粒子群优化(PSO),提出结合探索性景观分析与搜索轨迹网络的多维度可解释性框架,经24个基准函数实验确立拓扑与参数配置指南,提升了PSO的透明度与可解释性。

Comments 45 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24218 2026-08-26 cs.AI cs.CL 新提交 88%

Constraint-Guided Enterprise Data Mapping with Large Language Models

基于大语言模型的约束引导式企业数据映射

Sebastian Monka, Pramod Anantharam, Thien Vo Minh, Lavdim Halilaj

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) Robert Bosch GmbH(罗伯特·博世有限公司)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对企业数据映射的问题,提出约束引导式映射(CGM)神经符号方法,通过三阶段流程提升匹配性能,该方法成本低、可迁移且能降低专家工作量,在基准测试中表现优异。

Comments 20th International Conference on Neurosymbolic Learning and Reasoning. NeSy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19760 2026-08-26 cs.LG cs.AI cs.CL 版本更新 88%

Credit Without Ground Truth: Auditing Step-Level Credit Assignment in LLM Agents Against Executed Replay

无真实值的信用:针对执行重放的大语言模型智能体的步骤级信用分配审计

Haiyue Zhang

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对LLM智能体,在ALFWorld环境中审计步骤级信用分配,发现现有信用信号无法识别关键步骤,提出需匹配有效样本量比较信用规则。

Comments 52 pages, 6 figures. Pre-registered; frozen analysis plans and prompts included in the appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23837 2026-08-26 cs.AI 新提交 88%

SyPS: Measuring Sycophancy Prompt Sensitivity in Large Language Models

SyPS:衡量大语言模型中的谄媚提示敏感性

Lijia Huang, Yao Fu, Sihao Ren

机构 * Northeastern University(东北大学) Case Western Reserve University(凯斯西储大学) Everpure(爱惠浦)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出SyPS框架,通过构建控制变量的提示变体,引入SPSS指标,探究用户相关线索变化对LLMs谄媚行为的影响,发现寻求认可等线索会增加谄媚,反谄媚提示可减少谄媚。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11266 2026-08-26 cs.CL 版本更新 88%

The Shrinking Landscape of Linguistic Diversity in the Age of Large Language Models

大语言模型时代语言多样性的不断缩小

Zhivar Sourati, Farzan Karimi-Malekabadi, Meltem Ozcan, Colin McDaniel, Alireza Ziabari, Jackson Trager, Ala Tak, Meng Chen, Fred Morstatter, Morteza Dehghani

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究通过三项针对超88万篇文本的研究,发现广泛使用大语言模型作为写作助手会降低语言多样性,使写作风格同质化、复杂性方差下降21%-50%,对多领域存在潜在影响。

Comments Published in Nature Human Behaviour

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19435 2026-08-26 cs.GT cs.AI cs.CL 版本更新 88%

Ad Insertion in LLM-Generated Responses

在大语言模型生成响应中插入广告

Shengwei Xu, Zhaohua Chen, Xiaotie Deng, Zhiyi Huang, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了解耦广告插入与响应生成、以及竞价与用户查询的框架,通过基于类型拍卖机制实现近最优的社会福利,同时提高计算效率和上下文一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24509 2026-08-26 cs.AI cs.SE 新提交 87%

PeakBench: Benchmarking Resource-Aware Tool Invocation in LLM Agents

PeakBench:面向大语言模型智能体的资源感知工具调用基准测试

Zhi-Kai Chen, Xu-Xiang Zhong, Song-Yan Li, De-Chuan Zhan, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Nanjing University(南京大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 PeakBench是面向LLM智能体的资源感知工具调用基准,通过两部分评估框架解耦逻辑规划与物理调度,实验表明资源信息可减少溢出、提升利用率,为相关研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24252 2026-08-26 cs.AI cs.SE 新提交 87%

SA-Bench: Evaluating Semantic Alignment in LLM-Based Paper Reproduction

SA-Bench:评估基于大语言模型的论文复现中的语义对齐

Xue Hu, Zewei Pan, Zeli Su, Zhou Liu, Wentao Zhang

机构 * Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学) Minzu University of China(中央民族大学) Peking University(北京大学) Zhongguancun Academy(中关村科学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究推出SA-Bench基准,评估LLM复现论文时的语义对齐,发现现有模型复现准确率低,需优化脚手架以提升语义规范验证能力。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24017 2026-08-26 cs.CR cs.AI 新提交 87%

WebMCP-Phalanx: Enforcing and Characterizing Trust Boundaries for Browser-Integrated LLM Agents

WebMCP-Phalanx:为浏览器集成的大语言模型智能体实施并刻画信任边界

Lin-Fa Lee, YI-YU Chang, Kuo-Hui Yeh

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对浏览器集成 LLM 智能体的安全风险,提出 WebMCP-Phalanx 双层架构,验证其可降低攻击成功率、阻断多数提示注入,仅少量工具返回攻击成功,任务效用未受明显影响。

Comments 8 pages, 1 figure, AAAI2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23601 2026-08-26 cs.AR cs.LG cs.MA 新提交 87%

StateTune: Transforming LLM-Assisted EDA Flow Tuning into a Stateful, Closed-Loop Process

StateTune:将大语言模型辅助的EDA流程调优转化为有状态的闭环过程

Kunlong Li, Shangshang Yao, Su Zheng, Lingli Wang

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.LG

AI总结 StateTune将LLM辅助的EDA调优改为有状态闭环过程,以持久优化记忆为核心,结合EHVI引导的提升策略,在六个基准模块上性能优于多个基线,验证了设计有效性。

Comments Accepted to the 2026 IEEE/ACM International Conference on Computer-Aided Design (ICCAD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏