arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1423 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1423 篇

2509.06774 2026-07-07 cs.SE 版本更新 86%

OpenCoderRank: Personalized Technical Assessments with Generative AI

OpenCoderRank: 基于生成式AI的个性化技术评估

Hridoy Sankar Dutta, Sana Ansari, Swati Kumari, Shounak Ravi Bhalerao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 OpenCoderRank是一种轻量级自托管平台,通过模拟真实世界限时技术评估,为资源受限环境提供定制化评估解决方案,结合BERTScore和LLM评估方法验证其有效性。

Comments Accepted to SynthIR Workshop (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11599 2026-07-03 econ.GN q-fin.EC 版本更新 86%

Can LLMs Credibly Transform the Creation of Panel Data from Diverse Historical Tables?

LLM能否可信地转换来自不同历史表格的面板数据?

Verónica Bäcker-Peral, Vitaly Meursault, Christopher Severen

专题命中 评测与基准 :LLM(title_cn,summary_cn)

AI总结 提出基于多模态LLM的管道,以低成本从历史表格中提取面板数据,在车辆登记数据上达到95.4%精确匹配率,成本仅为传统方法的1/50。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14189 2026-06-23 cs.CY 版本更新 86%

AI and the Future of Academic Peer Review

人工智能与学术同行评审的未来

Sebastian Porsdam Mann, Mateo Aboy, Joel Jiehao Seah, Zhicheng Lin, Xufei Luo, Daniel Rodger, Hazem Zohny, Timo Minssen, Julian Savulescu, Brian D. Earp

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文分析同行评审的缺陷,探讨大型语言模型(LLM)如何通过监督辅助提升评审质量、减少偏见,并强调治理选择对AI辅助评审合法性的关键作用。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19218 2026-06-10 cs.SE cs.MA 版本更新 86%

Gecko: A Simulation Environment with Stateful Feedback for Refining Agent Tool Calls

Gecko: 一种具有状态反馈的仿真环境,用于优化智能体工具调用

Zeyu Zhang, Guohao Li, Zhenchang Xing, Alexandros Apostolopoulos, Yu Lin Lee, Liang Zheng

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出Gecko仿真环境,通过规则与LLM结合提供工具名称/参数验证、模式一致响应合成和任务完成判断三类反馈,形成GATS方法,在BFCLv3和τ²-bench上显著提升LLM工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05031 2026-08-14 cs.SE cs.AI 版本更新 85%

LLM-Based Test Oracles: Source-of-Authority Taxonomy -- A Systematic Literature Review

基于大语言模型的测试预言机:权威来源分类法——一项系统文献综述

Ali Hassaan Mughal, Muhammad Bilal

机构 * Independent Researcher, USA(美国独立研究员) Technical University of Munich, Germany(德国技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过系统文献综述,沿权威来源、形式及裁决机制三轴分析相关研究,刻画领域、语言等情况,指出规范衍生权威最常见但仅占约一半研究,还报告了评估及失败情况并提出研究议程。

Comments 21 pages, 10 figures, 11 tables. Systematic literature review of 83 studies, reported under PRISMA 2020. Submitted to IEEE Access. Replication package: https://doi.org/10.5281/zenodo.21194940

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01910 2026-08-14 cs.AI 版本更新 85%

DomusFM: A Foundation Model for Event-Based Behavioral Monitoring in Smart-Homes

DomusFM: 一个面向智能家居传感器数据的基础模型

Michele Fiori, Gabriele Civitarese, Flora D. Salim, Claudio Bettini

机构 * University of Milan(米兰大学) University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract_cn);language model(abstract);分类 cs.AI

AI总结 DomusFM是首个专为智能家居传感器数据设计的基础模型,通过自监督双对比学习范式实现语义和时间依赖性的建模,有效提升活动识别任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09900 2026-08-13 cs.CL 版本更新 85%

Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness

解码层面禁忌:大语言模型鲁棒性的诊断压力测试

Tadanobu Chuyo Kamijo, Ori Rottenstreich, Javier Conde, Gonzalo Martínez, Pedro Reviriego

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出Decoding-Level Taboo这一零提示诊断压力测试,通过干预logit空间迫使大语言模型偏离标称路径,评估发现其鲁棒性与参数规模、指令对齐正相关,该测试还可用于生成合成数据集等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05353 2026-08-12 cs.CL 版本更新 85%

Evidence Lock Before Commitment: A Frozen Interface Degrades LLM-as-Judge Evaluation

提交前的证据锁定:冻结界面会降低“大模型作为评判者”的评估效果

Divyansh Singh

机构 * University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究测试了证据锁定等不同LLM-as-Judge评估方案,发现证据锁定会降低与人类偏好的一致性、增加答案顺序不一致性,而结构化证据引出效果接近标准评判,持久化证据可支持审计但不应替代源答案。

Comments Withdrawn due to an error identified in the code during debugging. The error affects the reported results

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12843 2026-08-11 cs.CL 版本更新 85%

Growing Pains: Extensible and Efficient LLM Benchmarking Via Fixed Parameter Calibration

成长之痛:通过固定参数校准实现可扩展且高效的LLM基准测试

Eliya Habba, Itay Itzhak, Asaf Yehudai, Yotam Perlitz, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(海法大学) IBM Research(IBM研究院) MIT(麻省理工学院) Technion(技术学院) Allen Institute for AI(人工智能研究院)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 本文提出基于多维项目反应理论的框架,利用锚定项目校准新基准,保持原有参数固定,实现随时间扩展基准测试的同时保持评分可比性,且评估成本恒定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18852 2026-08-11 cs.CL 版本更新 85%

FanarGuard: A Culturally-Aware Moderation Filter for Arabic Language Models

FanarGuard: 一种文化感知的阿拉伯语言模型审查过滤器

Masoomali Fatehkia, Enes Altinisik, Husrev Taha Sencar

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 FanarGuard是一种双语审查过滤器,通过评估阿拉伯语和英语中的安全性和文化对齐性,提升内容审查的准确性与文化敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28956 2026-08-05 cs.AI 版本更新 85%

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

MerchantBench:面向电商运营中长期一致性的大语言模型智能体基准测试

Qiming Shi, Yulong Tao, Linbo Jin, Zhaolu Kang, Yibo Dou, Jiawen Zhu, Tianjun Pan, Shaokang Fu, Chengyu Wang, Siyue Li, Yaping Cheng, Di Weng, Chengfu Huo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究推出MerchantBench电商运营基准测试,通过365天订单级模拟评估大语言模型智能体的中长期一致性,发现其与人类参与者存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02277 2026-08-04 cs.CR cs.AI 版本更新 85%

Quantifying Frontier LLM Capabilities for Container Sandbox Escape

量化前沿大语言模型突破容器沙盒的能力

Rahul Marchand, Art O Cathain, Jerome Wynne, Philippos Maximos Giavridis, Stuart Jennings, Freddy Tuxworth, Tolga H. Dur, Sam Deverett, John Wilkinson, Jason Gwartz, Harry Coppock

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型突破容器沙盒的能力,通过引入SANDBOXESCAPEBENCH基准,利用嵌套沙盒架构和CTF评估,涵盖多种逃逸机制,发现添加漏洞时大语言模型能识别利用,证明此类评估对保障沙盒封装高性能模型的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03711 2026-08-04 cs.AR cs.LG 版本更新 85%

A Survey of Circuit Foundation Model: Foundation AI Models for VLSI Circuit Design and EDA

电路基础模型综述:用于VLSI电路设计和EDA的基础AI模型

Wenji Fang, Jing Wang, Yao Lu, Shang Liu, Yuchao Wu, Yuzhe Ma, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文综述电路基础模型(CFMs),涵盖130余篇2022年后工作,分为编码器(预测任务)和解码器(生成任务)两类,讨论其输入模态、架构、预训练策略及下游应用。

Comments Published in ACM TODAES

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24649 2026-08-03 cs.AI 版本更新 85%

Reason-Mediated Behavioral Models for Auditing LLM Social Simulators

用于审计大语言模型社会模拟器的基于推理的行为模型

Atharva Pandey, Gautam Jajoo

机构 * Kairosity

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型作为社会模拟器的评估问题,通过防晒霜概念测试将人类理由映射到推理状态Z,发现人类理由能提升购买意图预测,大语言模型模拟理由较脆弱,贡献了社会模拟器评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08334 2026-07-30 cs.CL 版本更新 85%

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

SalesSim:多模态语言模型作为零售用户模拟器的基准测试与对齐

Yada Pruksachatkun, Yixin Wan, Xingrun Chen, Kai-Wei Chang, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

AI总结 SalesSim通过多轮多模态对话评估多模态大语言模型在模拟真实用户行为中的能力,发现模型在词汇多样性及决策一致性方面存在不足,并提出UserGRPO方法提升对话流畅度与决策对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16617 2026-07-27 cs.SE cs.AI 版本更新 85%

DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

DataFlow-Harness:用于构建可编辑大语言模型数据管道的基础代码代理平台

Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen, Xiaochen Ma, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型数据处理工作流中编码代理脚本无法自动转化为可编辑工件的问题,提出DataFlow-Harness平台,通过类型化增量突变引导构建DAG,结合多种技术,在数据工程基准测试中取得高通过率,降低成本和延迟。

Comments 13 pages, 2 figures, and 5 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28965 2026-07-22 cs.AI 版本更新 85%

Frontier LLM-based agents can overcome the ontology curation bottleneck for natural phenotypes

基于前沿LLM的智能体可以克服自然表型的本体策展瓶颈

James P. Balhoff, Hilmar Lapp

机构 * Renaissance Computing Institute, University of North Carolina(北卡罗来纳大学雷丁计算研究所) Neuromatch, USA(美国Neuromatch)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文使用前沿大型语言模型作为智能体策展人,在自包含工作空间中利用本体和注释指南进行表型注释,其性能达到人类策展人之间的变异性范围,显著优于传统NLP工具。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01549 2026-07-21 cs.CL cs.SE 版本更新 85%

Octopus: On-device language model for function calling of software APIs

章鱼:用于软件API函数调用的设备端语言模型

Wei Chen, Zhiyuan Li, Mingyuan Ma

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 研究利用设备端大语言模型调用软件API,通过编译数据集微调不同参数模型,提升其API交互能力,提出条件掩码技术和新基准,经微调的Octopus模型在API调用上性能超GPT-4,推动自动化软件开发和API集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17930 2026-07-17 cs.AI 版本更新 85%

How Inference Compute Shapes Frontier LLM Evaluation

推理计算如何塑造前沿LLM评估

Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 通过控制推理计算量(如token预算、上下文压缩和重复提交)评估12个前沿语言模型,发现更大计算量显著提升性能,固定预算评估低估模型能力,且不同基准对推理扩展方法敏感。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17331 2026-07-07 cs.HC cs.AI 版本更新 85%

Exploring Context-aware and LLM-driven Locomotion for Immersive Virtual Reality

探索用于沉浸式虚拟现实的上下文感知和大语言模型驱动的移动

Suleyman Ozdel, Kadir Burak Buldu, Enkelejda Kasneci, Efe Bozkir

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Human-Centered Technologies for Learning(以人为本的学习技术)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出由大语言模型驱动的移动技术,让用户用自然语言在虚拟环境中导航。通过评估三种移动方法,结合眼动追踪数据分析和标准化问卷,发现该方法有潜力成为可行的免手持替代方案,能促进虚拟空间免手持移动。

Comments 28 pages. To appear in the Proceedings of the ACM on Human-Computer Interaction (PACM HCI), Vol. 10, No. 5; presented at the 28th ACM International Conference on Mobile Human-Computer Interaction (MobileHCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15476 2026-07-07 cs.CR cs.AI 版本更新 85%

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses

知识梳理:系统化大语言模型提示安全:分类法、数据集以及攻击与防御的统一评估

Hanbin Hong, Shuang Wu, Shuya Feng, Nima Naderloui, Shenao Yan, Jingyu Zhang, Ali Arastehfard, Heqing Huang, Yuan Hong

机构 * University of Connecticut(康涅狄格大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Independent(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型提示安全问题,提出相关分类法,形式化评估元数据,发布模块化平台,通过匹配评估揭示多种因素对安全结论有重大影响,支持可重复、成本感知且基于分类法的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17442 2026-07-01 cs.CV cs.AI 版本更新 85%

REMSA: Foundation Model Selection for Remote Sensing via a Constraint-Aware Agent

REMSA:通过约束感知代理进行遥感基础模型选择

Binger Chen, Tacettin Emre Bök, Behnood Rasti, Volker Markl, Begüm Demir

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) U AI(5U AI) Technische Universität Berlin & BIFOLD(柏林工业大学 & BIFOLD)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出REMSA,一种基于结构化数据库RS-FMD的约束感知代理,通过自然语言查询自动选择遥感基础模型,结合元数据检索与上下文学习,在专家评估基准中优于多种基线。

Comments Code and data available at https://github.com/be-chen/REMSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12966 2026-06-10 cs.CL cs.SE 版本更新 85%

ProbeLLM: Automating Principled Diagnosis of LLM Failures

ProbeLLM:自动化的大语言模型故障原则性诊断

Yue Huang, Zhengzhe Jiang, Yuchen Ma, Yu Jiang, Xiangqi Wang, Yujun Zhou, Yuexing Hao, Kehan Guo, Pin-Yu Chen, Stefan Feuerriegel, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) LMU Munich(慕尼黑大学) Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ProbeLLM框架,通过分层蒙特卡洛树搜索在全局探索与局部细化间分配预算,结合工具增强生成与验证,将故障发现从孤立案例提升为结构化故障模式,揭示更广泛、清晰、细粒度的故障景观。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17379 2026-08-21 cs.CL cs.AI 版本更新 85%

PTXBench: Benchmark and Adapt LLMs for GPU Kernel Optimization with Architecture-specific PTX

PTXBench:用于结合架构特定PTX优化GPU内核的大型语言模型基准测试与适配

Genghan Zhang, Yixin Dong, Chengze Fan, Zhichen Zeng, Yueming Yuan, Shaowei Zhu, Kunle Olukotun

机构 * Carnegie Mellon University(卡内基梅隆大学) RadixArk Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究提出PTXBench基准测试,评估LLM结合架构特定PTX优化GPU内核的能力,发现现有模型能力不均衡,经微调Qwen3.6-27B可改善部分任务但泛化仍不均,该基准为相关研究提供可审计测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06039 2026-08-18 cs.CL cs.AI 版本更新 85%

A Large-Scale Chinese Knowledge Graph-Text Alignment Dataset for Benchmarking Knowledge-Grounded LLMs

用于评估知识增强型大语言模型的大规模中文知识图谱-文本对齐数据集

Chengwei Wu, Xingrui Zhuo, Mingyang Gao, Xinghe Cheng, Zhichao Yan, Jiapu Wang

机构 * Nanjing University of Science and Techonolgy(南京理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Science and Technology Beijing(北京科技大学) Hefei University of Technology(合肥工业大学) Beijing University of Chemical Technology(北京化工大学) Renmin University of China(中国人民大学) Beihang University(北航) Beijing University of Posts and Telecommunications(北京邮电大学) Griffith University, Australia(澳大利亚格里菲斯大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出大规模中文知识图谱-文本对齐数据集CDTP,支持三项中文知识密集型任务的评估,经实验验证其可提升LLM的领域性能与分布外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22888 2026-07-30 cs.CL cs.AI 版本更新 85%

DialectLLM: A Dialect-Aware Dialog[ue] Generation Framework Beyond Standard American English

DialectLLM:一种超越标准美式英语的方言感知对话生成框架

Jio Oh, Paul Vicinanza, Thomas Butler, Steven Euijong Whang, Dezhi Hong, Amani Namboori

机构 * KAIST(韩国科学技术院) Amazon(亚马逊)

专题命中 评测与基准 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 DialectLLM通过生成多方言对话数据,解决LLM对非标准方言识别不足的问题,验证了方言特征对生成质量的影响,展示了其在对话生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02951 2026-07-14 cs.CL cs.AI 版本更新 85%

How Annotation Trains Annotators: Competence Development in Social Influence Recognition

标注如何训练标注者:社会影响识别中的能力发展

Maciej Markiewicz, Beata Bajcar, Wiktoria Mieleszczenko-Kowszewicz, Aleksander Szczęsny, Tomasz Adamczyk, Grzegorz Chodak, Karolina Ostrowska, Aleksandra Sawczuk, Jolanta Babiak, Jagoda Szklarczyk, Przemysław Kazienko

机构 * Wrocław University of Science and Technology(弗罗茨瓦夫科技大学) University of Silesia in Katowice(卡托维兹西里西亚大学) SWPS University(SWPS大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了标注过程中标注者能力的变化,通过分析25名标注者对1021条对话的标注,发现标注者自我感知能力提升,专家组效果更显著,影响了基于其标注数据训练的LLM性能。

Comments Accepted to AIED 2026 (27th Conference on Artificial Intelligence in Education)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04484 2026-07-03 cs.CL cs.AI 版本更新 85%

Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness

LLMs中的心理引导:有效性与可信度评估

Amin Banayeeanzade, Ala N. Tak, Fatemeh Bahrani, Anahita Bolourani, Leonardo Blas, Emilio Ferrara, Jonathan Gratch, Sai Praneeth Karimireddy

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出PsySET基准,评估提示、微调和表示工程等策略在控制LLM情绪和人格方面的效果与可信度,发现提示有效但强度控制有限,向量注入控制更精细但输出质量略降,且情绪引导可能产生副作用。

Comments Accepted at ACL 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27914 2026-06-10 cs.CL cs.AI 版本更新 85%

Does Capability Transfer to Subjective Behavior -- and Would Our Instruments Tell Us? A Self-Evolving, Trust-by-Construction Evaluation Paradigm

让结果说话:LLM行为基准测试的复制优先范式

Yuming, Huang, Yao Liu, Pengjie Ding, Lei Wang, Junchen Wan

机构 * Cylingo team(Cylingo团队)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 提出复制优先范式,通过可靠性、跨仪器复制、历史足迹校准和预注册预测四个正交属性验证LLM行为评估工具,并在情感陪伴任务中测试,发现聚合分数掩盖的模型退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04123 2026-06-08 cs.CY cs.AI cs.LG cs.SE 版本更新 85%

Measuring Agents in Production

生产环境中的智能体测量

Melissa Z. Pan, Negar Arabzadeh, Riccardo Cogo, Yuxuan Zhu, Alexander Xiong, Lakshya A Agrawal, Huanzhi Mao, Emma Shen, Sid Pallerla, Liana Patel, Shu Liu, Tianneng Shi, Xiaoyuan Liu, Jared Quincy Davis, Emmanuele Lacavalla, Alessandro Basile, Shuyi Yang, Paul Castro, Daniel Kang, Koushik Sen, Dawn Song, Joseph E. Gonzalez, Ion Stoica, Matei Zaharia, Marquita Ellis

机构 * University of California at Berkeley(加州大学伯克利分校) IBM Research(IBM研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 通过对86个已部署系统的调查和20个案例研究,发现生产环境中的LLM智能体主要采用简单可控的方法,可靠性是首要挑战,并依赖系统级设计和人工评估。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026) as Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏