arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1423 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1423 篇

2607.25199 2026-07-31 q-fin.CP cs.AI 版本更新 83%

RIDGE: An Autonomous Framework for Validation and Method Discovery in LLM-Generated Option Pricing

RIDGE:一个用于验证和发现大语言模型生成的期权定价方法的自主框架

Liexin Cheng, Xue Cheng, Shuaiqiang Liu, Cornelis W. Oosterlee

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型生成的期权定价实现,介绍自主验证框架RIDGE,通过多种测试和检查优化定价实现与验证方法,应用于五个随机波动率模型,消除缺陷并带来新定价方法。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15684 2026-07-30 cs.CR cs.AI 版本更新 83%

State-Dependent Safety Failures in Multi-Turn Language Model Interaction

多轮语言模型交互中的状态依赖性安全故障

Pengcheng Li, Jie Zhang, Tianwei Zhang, Han Qiu, Zhang kejun, Weiming Zhang, Nenghai Yu, Wenbo Zhou

机构 * School of Cyber Science and Technology, University of Science and Technology of China, China(中国科学技术大学信息科学与技术学院) Nanyang Technological University, Singapore(南洋理工大学) Tsinghua University, Beijing, China(清华大学) Beijing Electronic Science and Technology Institute, Beijing, China(北京电子科技研究所)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文从状态空间视角研究多轮交互中的安全故障,提出STAR框架分析对话历史作为状态转移操作,揭示对齐模型在多轮交互中安全边界穿越的机制。

Comments 9 pages, accepted at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16111 2026-07-30 stat.AP cs.AI 版本更新 83%

Calibrate Globally, Measure Everywhere: Scaling LLM-Based Prevalence Measurement Across A/B Experiments

基于代理的大规模A/B测试预估测量

Zehao Xu, Tony Paek, Kevin O'Sullivan, Attila Dobi

机构 * Pinterest, Inc.(Pinterest公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于代理的普及率测量框架,通过离线校准和日志数据实现大规模A/B测试中的高效普及率估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19190 2026-07-27 cs.RO cs.AI 版本更新 83%

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

智能体真实到模拟:使用视觉语言智能体进行基于物理的世界建模

Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng Zhang, Kunyi Wang, Weijia Zeng, Yunuo Chen, Pengzhi Yang, Ziqiu Zeng, Siyuan Luo, Huamin Wang, Chao Liu, Alan Yuille, Fan Shi, Changxi Zheng, Yunzhu Li, Chenfanfu Jiang, Peter Yichen Chen

机构 * University of British Columbia(英属哥伦比亚大学) Johns Hopkins University(约翰·霍普金斯大学) National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Style3D(无合适对应中文名)

专题命中 评测与基准 :language agent(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 研究针对机器人与物体交互的真实到模拟转换难题,提出智能体真实到模拟框架,利用视觉语言智能体进行广义物理世界建模,能转换真实记录为可模拟孪生体,在多场景评估效果良好,成本低,可用于下游机器人任务。

Comments Authorship change

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26548 2026-07-21 cs.CR cs.LG 版本更新 83%

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

SEC-bench Pro:语言模型能解决长周期软件安全任务吗?

Hwiwon Lee, Jiawei Liu, Dongjun Kim, Wubing Xia, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12339 2026-07-15 cs.HC cs.AI 版本更新 83%

SheetMind: An End-to-End LLM-Powered Multi-Agent Framework for Spreadsheet Automation

SheetMind:一个由端到端大语言模型驱动的用于电子表格自动化的多智能体框架

Xi Cheng, Ruiyan Zhu, Ke Liu, Rakesh Chowdary Machineni, Lyuhao Chen, Brian Zhu, Daniel Jin, Zheng Qi, Neeraj Parihar, Zhoutian Xu, Oliver Gao

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology (GZ)(香港科学与技术大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 介绍由大语言模型驱动的多智能体框架SheetMind用于电子表格自动化,其分层系统含三个智能体,经评估在SheetCopilot基准测试中执行成功率达100%、功能正确性54.8%超对手,消融研究验证配置优势,还集成到谷歌表格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21433 2026-07-09 cs.AI 版本更新 83%

Framing Instability in LLM Ethical Stance: Auditing Negation Sensitivity in Moral Dilemmas

框架对大语言模型伦理立场的不稳定性影响:道德困境中否定敏感性的审计

Katherine Elkins, Jon Chun

机构 * Kenyon College(肯尼恩学院)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型在伦理问题上因框架改变导致立场不稳定的问题,通过极性配对提议审计16个模型,发现小型模型波动大,商业模型也有变化,提出否定敏感性指数来衡量立场稳定性,指出立场易翻转的模型在高风险决策中不可靠。

Comments 16 pages, 5 figures (added gold labeled human datasets and additional statistical tests)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22851 2026-07-08 cs.CV cs.CL cs.RO 版本更新 83%

EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving

EgoDyn-Bench:评估面向自动驾驶的视觉中心基础模型中的自我运动理解

Finn Rasmus Schäfer, Yuan Gao, Dingrui Wang, Thomas Stauner, Stephan Günnemann, Mattia Piccinini, Sebastian Schmidt, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, Technical University of Munich, Munich, Germany(自动驾驶车辆系统教授职位,慕尼黑技术大学,德国慕尼黑) Bayerische Motoren Werke AG, Munich, Germany(巴伐利亚发动机有限公司,德国慕尼黑) Data Analytics and Machine Learning Group, Technical University of Munich, Munich, Germany(数据分析与机器学习小组,慕尼黑技术大学,德国慕尼黑)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EgoDyn-Bench基准,用于评估视觉中心基础模型的自我运动理解能力,发现模型在将物理逻辑与视觉感知结合时存在结构性缺陷,通过显式轨迹编码可恢复物理一致性。

Comments 36 Pages, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25533 2026-07-07 cs.CV cs.AI 版本更新 83%

VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models

VISOR++:基于通用视觉输入的大型视觉语言模型转向

Ravikumar Balakrishnan, Mansi Phute

机构 * HiddenLayer, USA(HiddenLayer美国分校) Georgia Institute of Technology, USA(佐治亚理工学院)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究视觉语言模型行为控制,针对现有方法局限,提出VISOR++,通过优化视觉输入实现行为控制,无需运行时访问模型内部,在多模型上验证有效性且能保持无关任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08660 2026-06-26 cs.CL 版本更新 83%

A Systematic Survey of Semantic Role Labeling in the Era of Pretrained Language Models

预训练语言模型时代语义角色标注的系统综述

Huiyao Chen, Meishan Zhang, Jing Li, Lilja Øvrelid, Jan Hajič, Hao Fei, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute (SLAI)(深圳南山区研究院) University of Oslo(奥斯陆大学) Charles University(查尔斯大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 提出四维分类法系统综述SRL研究,分析句法特征的作用条件,首次系统处理大语言模型时代的SRL,并扩展至多模态设置。

Comments 54 pages, 9 figures, 9 tables. Accepted at Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09416 2026-06-23 cs.CL cs.CY 版本更新 83%

Are Language Models Sensitive to Morally Irrelevant Distractors?

语言模型对道德无关干扰因素敏感吗?

Andrew Shaw, Christina Hahn, Catherine Rasgaitis, Yash Mishra, Alisa Liu, Natasha Jaques, Yulia Tsvetkov, Amy X. Zhang

机构 * University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究借鉴道德心理学中的“情境主义”观点,通过构建包含60种道德无关干扰因素的多模态数据集,发现这些干扰因素能使大语言模型的道德判断偏移超过30%,揭示了其道德判断的不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09370 2026-06-16 cs.DC cs.AI 版本更新 83%

From Detection to Recovery: Operational Analysis on LLM Pre-training with 504 GPUs

从检测到恢复:504 GPU上LLM预训练的运营分析

Daemyung Kang, Eunjin Hwang, Hanjeong Lee, HyeokJin Kim, Hyunhoi Koo, Jeongkyu Shin, Jeongseok Kang, Jihyun Kang, Jinho Heo, Joongi Kim, Junbum Lee, Jungseung Yang, Kyujin Cho, Youngsook Song

机构 * Lablup Inc.(Lablup公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过分析一个63节点NVIDIA B200生产集群(504 GPU)55天的Prometheus时间序列数据和73天的运营日志,提出了三项定量分析,揭示了多信号检测策略、存储I/O瓶颈和自动重试恢复机制的有效性。

Comments 42 pages, 19 figures, 16 tables. Lablup Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02318 2026-06-15 cs.CR cs.AI 版本更新 83%

COGNITION: From Evaluation to Defense against Multimodal LLM CAPTCHA Solvers

认知:从评估到对抗多模态大语言模型CAPTCHA求解器

Junyu Wang, Changjia Zhu, Yuanbo Zhou, Lingyao Li, Xu He, Mingkui Wei, Junjie Xiong

机构 * Missouri University of Science and Technology(密苏里科技大学) University of South Florida(佛罗里达州立大学) Visa Inc.(Visa公司) George Mason University(乔治·马歇尔大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究多模态大语言模型如何削弱视觉CAPTCHA的安全性,评估7种主流MLLM在18种CAPTCHA任务中的表现,揭示其解决能力及防御策略。

Comments Accepted by USENIX Sec'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23955 2026-08-21 cs.AI cs.DC cs.LG cs.SI q-fin.CP 版本更新 82%

From Accuracy to Auditability: A Survey of Determinism in Financial AI Systems

从准确性到可审计性:金融AI系统中的确定性综述

Ruizhe Zhou, Xiaoyang Liu, Gaoyuan Du, Yi Zheng, Shouxi Ren, Deepayan Chakrabarti, Dengdu Jiang

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文从系统视角综述了金融AI中表格模型、图网络和基于LLM的智能体工作流三种模态的不可重现性问题,通过实验量化了确定性指标并提出了分层评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28969 2026-08-21 cs.CL cs.AI cs.HC 版本更新 82%

Beyond Recall: Behavioral Specification as an Interpretive Layer for AI Personalization

超越回忆:行为规范作为AI个性化的解释层

Aarik Gulaya

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出行为规范作为解释层,通过压缩用户数据为解释性模式,显著提升AI代理对用户意图的表示准确性,减少模型规避,并在解释型问题上优于原始语料和商业记忆系统。

Comments 142 pages, 4 figures. Code, data, judge prompts, and reproduction instructions: github.com/agulaya24/beyond-recall 8/19 Replacement: Pages updated to 142 from 134. Added Table of Contents. Updated table/graph formatting. Updated Section 8: Data, Code, and Reproducibility to include updated links, corrected author names

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00547 2026-08-19 cs.AI cs.LG 版本更新 82%

Does Unification Come at a Cost? Uni-SafeBench: A Safety Benchmark for Unified Multimodal Large Models

统一是否带来代价?Uni-SafeBench:一种用于统一多模态大模型的安全基准

Zixiang Peng, Yongxiu Xu, Qin-Yi Zhang, Jiexun Shen, Yi-Fan Zhang, Hongbo Xu, Yubin Wang, Gaopeng Gou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Uni-SafeBench,用于评估统一多模态大模型的安全性,发现统一过程虽提升能力但显著降低基础LLM的安全性,开源资源以促进更安全的AGI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04074 2026-08-18 cs.AI cs.LG 版本更新 82%

FactReview: Evidence-Grounded Peer Review with Execution-Based Claim Verification

FactReview:基于执行式声明验证的证据驱动同行评审

Ling Yue, Chaoqian Ouyang, Hang Xu, Ruijun Huang, Yuchen Liu, Libin Zheng, Wei Liu, Shaowu Pan, Shimin Di, Min-Ling Zhang

机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) Sun Yat-sen University(中山大学) Southeast University(东南大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出FactReview系统,通过提取与评审相关的声明、将其与相关工作关联,并在代码可用时在固定修复预算下执行发布工件来审计经验声明,覆盖84%的声明,将评审质量提升至4.86/5,并将评审时间减少58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20253 2026-08-18 physics.comp-ph cs.AI cs.DC cs.LG 版本更新 82%

SimulCost: A Cost-Aware Benchmark and Toolkit for Automating Physics Simulations with LLMs

SimulCost: 一个用于自动化物理模拟的代价感知基准与工具包

Yadi Cao, Sicheng Lai, Jiahe Huang, Yang Zhang, Zach Lawrence, Rohan Bhakta, Izzy F. Thomas, Mingyun Cao, Chung-Hao Tsai, Zihao Zhou, Yidong Zhao, Hao Liu, Alessandro Marinoni, Alexey Arefiev, Rose Yu

机构 * University of California San Diego(加州大学圣地亚哥分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) California Institute of Technology(加州理工学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 针对现有LLM评估忽略工具使用代价的问题,提出SimulCost基准,通过单轮和多轮参数调优任务比较LLM与传统扫描方法在准确性和计算代价上的表现,发现LLM在高精度任务中初始猜测不可靠且多轮模式效率更低。

Comments post conference revision version at ICML; update: removed CGYRO due to bug in cases search. Will add back soon; Make the title consistent w/ pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14501 2026-08-14 cs.SE cs.AI cs.CL 版本更新 82%

CangjieBench: Benchmarking LLMs on a Low-Resource General-Purpose Programming Language

仓颉基准:在低资源通用编程语言上评估大语言模型

Junhang Cheng, Fang Liu, Jia Li, Chengru Wu, Nanxiang Jiang, Li Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CangjieBench,用于评估大语言模型在低资源通用编程语言上的表现,通过248个高质量样本覆盖文本到代码和代码到代码任务,发现语法受限生成在准确性和计算成本之间取得最佳平衡。

Comments Accepted by ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06331 2026-08-14 cs.CL cs.AI cs.IR 版本更新 82%

How Significant Are the Real Performance Gains? An Unbiased Evaluation Framework for GraphRAG

实际性能提升有多显著?GraphRAG的无偏评估框架

Qiming Zeng, Hao Luo, Yuhao Lin, Yicheng Jin, Yuxiang Wang, Fangcheng Fu, Xiao Yan, Jiawei Jiang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Peking University(北京大学计算机学院) Centre for Perceptual and Interactive Intelligence (CPII)(感知与交互智能中心) OceanBase

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对GraphRAG现有评估框架的不相关问题与评估偏差缺陷,提出无偏评估框架并发现代表性GraphRAG方法的性能提升远小于此前报告结果,呼吁开展科学评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03859 2026-08-13 cs.CL cs.AI 版本更新 82%

Beyond Representational Similarity: Source-Conditioned Description-Length Gain for Generative Plagiarism Detection and Candidate Source Reranking

超越表征相似性:面向生成式剽窃检测与候选源重排序的源条件描述长度增益

Peijia Guo, Wenxuan Xie, ZiGuang Li, Ming Li

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对生成式剽窃检测难题,提出源条件描述长度增益(SCDG)框架,在PAN基准等测试中优于现有基线,可有效检测大量改写后的源复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03685 2026-08-11 cs.LG cs.AI stat.ML 版本更新 82%

Universal One-third Time Scaling in Learning Peaked Distributions

学习尖峰分布中的普适三分之一时间缩放

Yizhou Liu, Ziming Liu, Cengiz Pehlevan, Jeff Gore

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过理论分析和实验验证,揭示了使用softmax和交叉熵学习尖峰分布时,损失和梯度呈幂律衰减,导致损失时间缩放指数为1/3的普适瓶颈,为神经缩放现象提供了机理解释。

Comments Camera-ready version, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00025 2026-08-07 q-bio.NC cs.CL cs.HC cs.LG eess.AS 版本更新 82%

MoDAl: Self-Supervised Neural Modality Discovery via Decorrelation for Speech Neuroprosthesis

MoDAl: 基于去相关的自监督神经模态发现用于语音神经假体

Yuanhao Chen, Peter Chin

机构 * Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出MoDAl框架,通过对比学习和对齐损失与去相关损失之间的协同作用,从多脑区发现互补神经模态,在Brain-to-Text Benchmark '24上将词错误率从26.3%降至21.6%。

Comments Accepted at ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03722 2026-08-06 cs.AI cs.CL 版本更新 82%

When Outputs Disperse, Does Epistemic Revision Follow? A Black-Box Diagnostic for Machine Collectives

当输出分散时,认知修正会随之而来吗?面向机器集体的黑盒耦合诊断方法

Molood Arman

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出黑盒耦合诊断方法,评估LLM集体输出分散度干预与认知立场修正的关联,发现不同模型的错误前提恢复效应存在显著差异,建议报告立场转变及保留前提率。

Comments Reviewed at Collective Intelligence 2026 (CI 2026) Conference. Revised version incorporating reviewer feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22660 2026-08-04 cs.CL cs.AI 版本更新 82%

Moral Semantics Survive Machine Translation: Cross-Lingual Evidence from Moral Foundations Corpora

道德语义在机器翻译中得以保留:来自道德基础语料库的跨语言证据

Maciej Skorski

机构 * University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了基于LLM的翻译是否能弥合道德价值观分类中语言特定标注语料库的差距,通过波兰语案例展示直接翻译能有效保留微妙的道德线索,为资源匮乏语言的道德研究提供了可行路径。

Comments Accepted to GoodIT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27816 2026-08-03 cs.CL cs.AI 版本更新 82%

Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation

超越借用的历史:用于交互式角色扮演评估的人物对齐用户模拟

Yuhang Zhu, Mingxuan Du, Benfeng Xu, Jie Gao, Lingyun Yu, Hongtao Xie

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对现有RPA评估基准的局限,提出基于用户模拟器的PALATE基准,通过个性化评分标准和多轮自由对话评估,生成针对特定用户-RPA对的可解释评估。

Comments 29 pages, 3 figures, including supplementary material. Resources: https://github.com/Zhuyh1139/PALATE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22657 2026-08-03 cs.CL cs.AI 版本更新 82%

Between Suppression and Collapse: Evaluating Narrative Unlearning with LENS

在抑制与崩溃之间:用LENS评估叙事去学习

Viktoriia Makovska, George Fletcher

机构 * Ukrainian Catholic University(乌克兰天主教大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型再现虚假叙事问题,引入LENS评估协议,通过实验评估两个叙事,涵盖四个模型,用SCE分数评估,发现选定检查点可减少叙事再现,有实体恢复副作用,证明LENS是成功的诊断协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-08-03 cs.CL cs.AI 版本更新 82%

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01527 2026-07-30 cs.SE cs.AI cs.LG 版本更新 82%

REAP: Automatic Curation of Coding Agent Benchmarks from Interactive Production Usage

REAP:从交互生产使用自动整理编码代理基准

Smriti Jha, Matteo Paltenghi, Chandra Maddila, Vijayaraghavan Murali, Shubham Ugare, Satish Chandra

机构 * Meta, USA(Meta公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 REAP通过自动化流程从真实开发者与代理交互中构建生产基准,解决评估信号不可靠问题,通过LLM分类和多轮稳定性检查确保基准可信。

Comments Accepted at ASE 2026 Industry Showcase

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18443 2026-07-28 cs.HC cs.AI cs.CL cs.CY 版本更新 82%

From "Help" to Helpful: A Hierarchical Assessment of LLMs in Mental e-Health Applications

从‘帮助’到‘有用’:对LLMs在心理健康电子服务中的分层评估

Philipp Steigerwald, Jens Albrecht

机构 * Technische Hochschule Nürnberg – Georg Simon Ohm(纽伦堡技术大学——格奥尔格·西蒙·欧姆学院)

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了11种LLM在生成德国咨询邮件主题行中的表现,发现德国微调能提升性能,同时探讨了心理健康AI部署中的隐私、偏见和问责制等伦理问题。

Comments Accepted for the Springer CCIS post-proceedings of ICT4AWE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏