arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-24 至 2026-08-24 共收录 92 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 92 篇

2608.20421 2026-08-24 cs.CY cs.AI 新提交 92%

Six misconceptions about large language models: A minimal model and diagnostic taxonomy

大型语言模型的六大误解:一个极简模型与诊断分类法

Zhicheng Lin

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 该研究提出以四组区分为核心的LLM极简模型,诊断六大误解,应用于出版商AI政策案例,为纠正民间理论错误提供诊断工具。

Comments 20 pages, 1 figure, 2 tables, and 2 boxes. Published in PNAS Nexus

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21242 2026-08-24 cs.CL 新提交 92%

Affective Context Amplifies Sycophancy in LLM Responses

情感语境会放大大型语言模型(LLM)回复中的奉承行为

Jiayi Li, Sanjana Menon, Brett Frischmann, Shomir Wilson, Sarah Rajtmajer

机构 * Penn State University(宾夕法尼亚州立大学) Villanova University(维拉诺瓦大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究发现,在主观评价互动中,7个LLM在两个Reddit数据集上的奉承偏差会被用户的负面情绪(尤其是孤独、痛苦)放大,模型会通过回避型奉承抑制关键反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20518 2026-08-24 cs.AI 新提交 92%

FL-MAESTRO: Multi-Agent LLM Orchestration for Resource-Constrained Federated Learning

FL-MAESTRO:面向资源受限联邦学习的多智能体大语言模型编排框架

Jiajun Wu, Zirui Wang, Jiayu Zhou, Qiang Ye, Steve Drew

机构 * University of Calgary(卡尔加里大学) University of Michigan(密歇根大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 FL-MAESTRO是面向资源受限联邦学习的多智能体LLM编排框架,通过三个专业LLM智能体联合决策,在非IID CIFAR-10基准上,准确率与最强能量感知基线相当,浪费轮次能量从超三分之一降至近零。

Comments Accepted at IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18300 2026-08-24 cs.AI 版本更新 92%

The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

用于大规模推荐解释的LLM评判模型的生命周期

Emma Yanyang Kong, JJ Tan, Ishan Gupta, Lars Olds, Claire Campbell, David Fagnan, Ratna Kavuri, Veli Balin, Rohan Gosain, Louis Garcia, Minsu Jang

机构 * Netflix(网飞公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22202 2026-08-24 cs.SE cs.CL 版本更新 92%

Library Hallucinations in LLM-Generated Code: A Risk Analysis Grounded in Developer Queries

LLM生成代码中的库幻觉:基于开发者查询的风险分析

Lukas Twist, Mark Harman, Helen Yannakoudakis, Jie M. Zhang

机构 * King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了LLM生成代码中库幻觉的风险,通过分析用户提示变化对库幻觉的影响,揭示了系统性漏洞,并提出了LibHalluBench基准测试以评估这些幻觉。

Comments 28 pages, 1 figure, 13 tables. Accepted to Proceedings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16222 2026-08-24 cs.CL cs.SE 版本更新 92%

Don't Judge Code by Its Cover: Exploring Biases in LLM Judges for Code Evaluation

不要以封面判断代码:探索LLM评委在代码评估中的偏见

Jiwon Moon, Yerin Hwang, Dongryeol Lee, Taegwan Kang, Yongil Kim, Kyomin Jung

机构 * IPAI, Seoul National University(IPAI,首尔国立大学) Dept. of ECE, Seoul National University(电子工程系,首尔国立大学) LG AI Research(LG人工智能研究)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了LLM评委在评估代码时存在的偏见问题,揭示了其在处理语义等价但表面不同的代码时的不稳定性,并指出需要更稳健的评估方法。

Comments Accepted to EACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10903 2026-08-24 cs.CL 版本更新 92%

Beyond Gold Standards: Epistemic Ensemble of LLM Judges for Formal Mathematical Reasoning

超越黄金标准:用于形式化数学推理的LLM评判者的认知集成

Lan Zhang, Marco Valentino, Jordan Meadows, Andre Freitas

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出基于LLM评判者的认知与形式化基础集成(EFG),用于系统自动评估形式化数学推理中的语句自动形式化任务,实验证实其比粗粒度模型更具适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21126 2026-08-24 cs.CR 新提交 91%

TraceGrant: A Contract-Governed Security Framework for the Task-Effect Lifecycle of Networked LLM Agents

TraceGrant:一种用于联网LLM智能体任务-效应生命周期的合约治理安全框架

Bohao Liao, Jingchao Wang, Qipeng Song, Jin Cao, Jieling Wang, Boyu Deng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 TraceGrant是通过显式合约治理联网LLM智能体任务-效应生命周期的安全框架,在两类基准攻击案例中未出现攻击成功,且能关联用户意图、执行与任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21036 2026-08-24 cs.AI 新提交 91%

Evaluating Large Language Model Performance on International Maritime Dangerous Goods Code Compliance

评估大型语言模型在国际海运危险货物规则合规性上的性能

Alexander Thomas, Hubert P. H. Shum, Darren Nellis, Manli Zhu, Phatpicha Yochum, William Bartle, Daniel Wrightson

机构 * NCB Hazcheck Limited(NCB Hazcheck有限公司) Durham University(杜伦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究构建首个IMDG规则合规性基准DGEval,评估13个LLM的性能,发现其在积载等安全关键领域表现弱,仅可辅助结构化查询,需人工监督。

Comments 28 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20355 2026-08-24 cs.CL cs.AI 新提交 91%

ExpertIVS: Sociological Expert Driven Individual Value Simulation in Large Language Models

ExpertIVS:大型语言模型中由社会学专家驱动的个体价值观模拟

Zhen Wang, Yuqi Ren, Yuehan Cui, Hongxiang Wang, Jianxiang Peng, Zhaoxia Zhang, Bingkun Zhu, Tongxuan Zhang, Dezhi Tong, Deyi Xiong

机构 * The International Joint Institute of Tianjin University(天津大学国际联合研究院) Tianjin University(天津大学) TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) National Governance Institute, Tianjin Normal University(天津师范大学国家治理研究院) College of Computer and Information Engineering, Tianjin Normal University(天津师范大学计算机与信息工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究针对大型语言模型社会模拟中个体价值观建模的不足,提出ExpertIVS框架,通过14个社会学专家智能体重构个体画像,经多国家多人群实验验证其在价值观还原、泛化等方面性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26101 2026-08-24 cs.CL cs.AI 版本更新 91%

Know2Guess: A Contamination-Aware Multi-Zone Benchmark for Knowledge-Boundary Evaluation in Large Language Models

Know2Guess: 一种面向大型语言模型知识边界评估的污染感知多区域基准

Renwei Meng, Bowen Zhang, Jian Wang, Xican Wang, Haoyi Wu, Xuanyan Qiu, Shengan Yang

机构 * Anhui University(安徽大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一种污染感知多区域基准,通过冻结构建时标签测量从可回答知识到应弃权未知的转变,评估模型在回答与弃权间的可靠性。

Comments 28 pages, 11 figures, Accepted as a regular paper at the International Conference on Neural Information Processing (ICONIP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21008 2026-08-24 cs.CL cs.AI cs.LG 版本更新 90%

The Metanym Game: An LLM Benchmark Without Ground Truth That Rises With the Models It Measures

Metanym游戏:一种自包含、自洽的LLM同行社区结构智能基准

David Nordfors

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Metanym游戏作为LLM结构智能基准,通过同行互评和奇异值分解实现无黄金标准的客观评估,事实评分与GPQA Diamond相关性达0.92,发现评判能力比生成能力更稀缺。

Comments 69 pages (main text + four appendices: A. Mathematical Theory and Derivations B. generation/evaluation prompts, C. council-evaluation excerpt D. Auditing the Metanym Game-GPQA correlation: No Leaks Found), 3 figures, 19 tables. Github repo with pages/figures/tables/code and data for reproducing results: this https URL (https://github.com/dnordfors/metanym-game-paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21074 2026-08-24 cs.CL cs.AI cs.HC cs.SE 新提交 90%

PromptResponse: Optimizing Prompts for LLM Coding Tasks

PromptResponse:优化大语言模型编码任务的提示词

Erik Thureck, Robert Kühnen, Tim Jacobowitz

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) HU Berlin(柏林洪堡大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出PromptResponse,通过对HumanEval数据集的5种变体让GPT-4o执行8200次编码任务,发现统一格式(尤其JSON)可提升代码效率与稳定性,LLM调优提示词会降低性能,还发布了相关数据集与评估流程。

Comments 22 pages, 7 figures, 10 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21021 2026-08-24 cs.CL cs.AI cs.NI 新提交 90%

Free-Text Evaluation of LLMs for 5G Domain Knowledge and Fault Analysis using LLM-as-Judge

基于LLM作为评判者的5G领域知识与故障分析大模型自由文本评估

Rishiraj Sengupta, Sotiris Chatzimiltis, Mohammad Shojafar, Xiatian Zhu

机构 * Surrey Institute for People-Centered Artificial Intelligence(萨里以人为本人工智能研究院) Google(谷歌)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文以自由文本格式评估Claude-Haiku-4.5等三个轻量型LLM的5G领域知识与故障分析能力,发现其故障诊断准确率超90%但规范召回不足,Gemini-3.1-Flash-Lite效率最优适合生产部署。

Comments 6pages, 4figures. Accepted for presentation in IEEE CSCN conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20432 2026-08-24 cs.LO cs.AI cs.CL 新提交 90%

ProofJudge: Tool-Grounded LLM Evaluation of Formal Proof Quality in Mathlib

ProofJudge:基于工具的大语言模型(LLM)对Mathlib中形式化证明质量的评估工具

Shane Caldwell

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究提出ProofJudge系统,通过智能体式LLM从五个维度评估Mathlib形式化证明质量,在218个声明数据集上验证其与人类偏好对齐度,发布开源制品支持相关研究。

Comments 4 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02368 2026-08-24 stat.ML cs.AI cs.LG math.DG 版本更新 90%

The Dual Nature of LLM Persona: Aggregated Tendencies and Frame-Dependent Geometry

LLM人格的双重性质:聚合倾向与框架依赖的几何结构

Yuan Yuan

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 通过心理测量问卷评估LLM人格时,发现人格表达包含聚合特征(大五人格分数)和几何特征(SPD流形)两种可分离成分,其中几何特征并非内在属性,而是框架依赖的协调模式,揭示了LLM人格的双重性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01341 2026-08-24 cs.SI 版本更新 90%

Structural Hallucination in Large Language Models: A Network-Based Evaluation of Knowledge Organization and Citation Integrity

大语言模型中的结构幻觉:基于网络的对知识组织与引用完整性的评估

Moses Boudourides

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出基于网络的结构幻觉压力测试,评估大语言模型在知识组织与引用完整性方面的表现,发现其在不同领域存在显著的结构偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21317 2026-08-24 cs.AI 新提交 90%

From Regulation to Implementation: A Critical Evaluation of LLM-Assisted Regulatory Compliance in Industry

从法规到实施:对工业中大型语言模型(LLM)辅助法规合规性的批判性评估

Adriana Watson, Marco Bücheler, Grant Richards

机构 * School of Engineering Technology, Purdue University(普渡大学工程技术学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究针对工业中LLM辅助法规合规性的研究缺口,探索数据提取指令和法规模糊性对LLM生成合规文档质量与一致性的影响,发现不同严格程度的法规指南对LLM输出的一致性和幻觉情况有不同影响。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21101 2026-08-24 cs.CR cs.AI 新提交 90%

ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents

ClawSentry:一种用于保护自主大语言模型智能体的渐进式多层安全监控器

Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ClawSentry是一种开源、与框架无关的智能体运行时安全监控网关,通过渐进式多层机制防护自主LLM智能体,可大幅降低攻击成功率,同时保持较高的任务安全率。

Comments 35 pages, 14 figures. Code: this https URL (https://github.com/Elroyper/ClawSentry)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21057 2026-08-24 cs.LG 新提交 90%

Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment

通过人类对齐设计用于药物发现中智能体AI的鲁棒性大语言模型评估系统

Emma Granqvist, Rocío Mercado, Samuel Genheden

机构 * AstraZeneca(阿斯利康) Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) Science for Life Laboratory (SciLifeLab)(生命科学实验室)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究针对药物发现智能体AI,提出人类对齐的LLM作为评判者评估框架,优化后对齐度达0.86,为科学领域智能体系统评估提供可复用模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20918 2026-08-24 cs.AI 新提交 90%

UpgradeBench: A Decision-Centric Benchmark for Upgrading Fine-Tuned LLM Specialists

UpgradeBench:面向微调LLM专用模型升级的决策导向基准

Ye Chen, Weining Zhang

机构 * Alibaba Group(阿里巴巴集团) Cheung Kong Graduate School of Business(长江商学院)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 该研究提出UpgradeBench基准,针对LLM专用模型升级的决策问题,在多模型序列与任务上验证了适配器迁移等策略的效果,实现低成本高效升级。

Comments 23 pages, 12 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20554 2026-08-24 cs.CR cs.LG 新提交 90%

aiXamine: Unified Black-Box Evaluation of Cross-Dimensional Trade-offs in LLM Safety, Security, and Privacy

aiXamine:针对大语言模型安全、安全与隐私的跨维度权衡的统一黑盒评估

Fatih Deniz, Yazan Boshmaf, Dorde Popovic, Issa Khalil

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究推出aiXamine统一黑盒平台,对超120个LLM开展大规模联合评估,发现安全、隐私等跨维度权衡现象,揭示当前对齐方法将多维度可信性视为单一目标的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08881 2026-08-24 cs.CY cs.AI 版本更新 90%

Can We Trust AI Agents? A Case Study of an LLM-Based Multi-Agent System for Ethical AI

我们能信任智能体吗?基于大语言模型的多智能体系统用于伦理AI的案例研究

José Antonio Siqueira de Cerqueira, Mamia Agbese, Rebekah Rousi, Nannan Xi, Juho Hamari, Pekka Abrahamsson

机构 * Tampere University(塔尔皮奥大学) University of Jyväskylä(耶夫斯克耶拉大学) University of Vaasa(瓦萨大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过设计LLM-MAS多智能体原型,评估其在处理AI伦理问题时的代码生成能力,发现其能生成大量相关代码,但存在源代码集成等实际挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21165 2026-08-24 cs.HC cs.CY 新提交 89%

Distilling Black-Box Machine Learning into a Small, Self-Explaining Language Model for Learning Analytics

将黑盒机器学习模型蒸馏为用于学习分析的小型自解释语言模型

Chenguang Pan, Airui Meng, Youmi Suk

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 本研究提出两阶段微调流水线,将黑盒ML模型蒸馏为小型自解释LLM,可在普通设备上离线预测解释,在教育数据集上表现良好且数据不外泄。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22820 2026-08-24 cs.MA cs.AI 版本更新 89%

Complete Cyclic Subtask Graphs for Tool-Using LLM Agents: Flexibility, Cost, and Bottlenecks in Long-Horizon Workflows

完全循环子任务图用于工具使用LLM代理:多代理工作流程中的灵活性、成本和瓶颈

Luay Gharzeddine, Samer Saab Jr

机构 * Lebanese American University(黎巴嫩美国大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了完全循环子任务图,通过分析不同基准测试发现,多代理工作流程中灵活性可能带来协调成本和推理成本,而外部任务瓶颈可能主导性能。

Comments 37 pages, 8 figures. Published in Transactions on Machine Learning Research (TMLR), 2026. Supplementary material included as ancillary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21206 2026-08-24 cs.CL cs.AI cs.LG 新提交 88%

No PUN Intended: Plausible Unknown Names for Person-Centred LLM Evaluation

并非双关:面向以人为中心的大语言模型评估的合理未知姓名(PUN)

Dimitri Staufer, David Hartmann, Ibrahim Baroud

机构 * Technische Universität Berlin(柏林工业大学) Weizenbaum Institute for the Networked Society(魏茨曼网络社会研究所) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM评估中人名使用导致的测量混淆问题,提出PUN协议构建合理未知姓名,经204人研究验证其有效性并发布300个对照姓名。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21107 2026-08-24 cs.AI cs.SE 新提交 88%

Large Language Models at the Intersection of Software Engineering and Software Security:An Evidence-Centered Structured Survey and Research Agenda

大型语言模型在软件工程与软件安全交叉领域:一项以证据为中心的结构化调查与研究议程

Wei Lin, Tao Zhou, Zhaofei Xie, Changgui Hong

机构 * Nanjing Liancheng Intelligent Technology Group(南京连城智能科技集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究调查了LLMs在软件工程与软件安全交叉领域的进展,提出保证框架,识别有效性威胁与最低报告协议,制定研究议程,主张以任务适配证据而非单一基准评判模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20376 2026-08-24 cs.CL cs.LG 新提交 88%

TH-GNN: Heterogeneous Temporal Graph Neural Networks for LLM-Agent Shilling Attack Detection

TH-GNN:用于检测大语言模型智能体刷单攻击的异质性时序图神经网络

Shivam Swarup, Divya Prakash Shrivastava, Rakesh Thakur

机构 * JAIN (Deemed to be University)(JAIN(被认定大学)) Zayed University(扎耶德大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 本文提出TH-GNN,一种异质性时序图神经网络,联合建模时序、结构与语义信号,在5类攻击族和4个基准数据集上检测LLM智能体刷单攻击,总体平均F1值达0.870,性能优于纯文本基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20563 2026-08-24 cs.CR cs.AI 新提交 87%

Beyond End-to-End Success: Diagnosing Failures in Long-Horizon Security LLM Agents

超越端到端成功:诊断长视野安全大语言模型智能体的失败

Wei Shao, Chongzhou Fang, Zuxiong Tan, Zequan Liang, Setareh Rafatirad, Avesta Sasan, Houman Homayoun

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究针对长视野安全LLM智能体,提出带检查点的诊断方法,发现Gemini 2.5 Flash失败多因未观测到需复用状态,92种子研究显示针对性指导可提升其状态观测率至95.4%,且失败主因随模型代际变化,需诊断失败根源而非仅看总体成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20344 2026-08-24 cs.CL cs.CY 新提交 87%

Beyond Raw Transcripts: Structured Persona Extraction for LLM-Based Digital Twins

超越原始文本记录:面向基于大语言模型的数字孪生的结构化角色提取

Iris Ye, Tianze Deng, Ozan Candogan

机构 * University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究针对基于LLM的数字孪生,提出结构化角色提取方法,发现信息结构是性能关键,固定结构难通用,自动结构发现流水线可恢复性能并提升准确率。

Comments Preprint. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏