arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12169 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 12169 篇

2607.28871 2026-08-03 cs.SE cs.AI 新提交 90%

Validation Evidence in LLM Repair Agents: How Much of What Passes Actually Tests the Bug?

LLM修复智能体中的验证证据:通过的测试究竟在多大程度上能检验缺陷?

Xiaonan Xu, Wenjing Wu

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究以BSG-VA方法分析LLM修复智能体的验证证据,发现近半数阳性测试无缺陷区分信息,缺陷对比反馈可减少证据不足的部署,其效果幅度仍需进一步验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28317 2026-07-31 cs.AI 新提交 90%

One Human, $N$ Agents: Audit-Budget Allocation for LLM Agent Fleets under Miscalibrated, Correlated Confidence

一个人类,N个智能体:校准不当且相关置信度下LLM智能体集群的审计预算分配

Cesare Zavattari, Alessandro Tommasi, Giuseppe Prencipe

机构 * Università di Pisa(比萨大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 针对单人类需在有限审计预算下审计N个LLM智能体的问题,研究了置信度校准不当且存在相关性时的审计预算分配,发现校准阈值的变化规律,验证了部分大语言模型置信度的实用性,给出了无效监督的定量准则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18496 2026-07-30 cs.CR cs.AI cs.HC 版本更新 90%

Towards an Automated Test of LLM Security Knowledge

迈向大语言模型安全知识的自动化测试

Shufan Chai, Liangliang Sun, Jessica Staddon

机构 * Northeastern University(东北大学)

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在实现大语言模型安全知识自动化测试,引入利用消费者保护机构权威信息识别LLM响应不稳定性的部分自动化方法,通过对身份盗窃和冒名顶替诈骗主题及Gemini和GPT家族中5个LLMs进行测试,可区分模型安全知识充足与否。

Comments v3: fixed typos in abstract metadata; no changes to the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25068 2026-07-29 cs.AI 新提交 90%

How Often Should a Recommender Call an LLM? Value-Weighted Routing, Monitoring, and Seasonal Robustness

推荐系统应多久调用一次大语言模型?价值加权路由、监控与季节性稳健性

Bhavtosh Rath

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨推荐系统调用LLM的频率,提出价值路由器,通过合成模拟分三阶段研究,比较不同路由方式,揭示失败模式,模拟需求激增,得出成本感知路由系统设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18961 2026-07-24 cs.AI 版本更新 90%

From Dependency to Compositionality: A Neurosymbolic Lifting of LLM Outputs via Combinatory Categorial Grammar

从依存关系到组合性:通过组合范畴语法对大语言模型输出进行神经符号提升

Remo Pareschi

机构 * STAKE Lab, University of Molise(莫利塞大学STAKE实验室)

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于自回归生成与CCG增量处理模型的对齐,提出神经符号框架提升LLM输出为类型化组合推导,可扩展到多种形式语言,支持两层检查,还概述了同步LLM - CCG耦合方向。

Comments 27 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01592 2026-07-14 cs.CY cs.CL 交叉投稿 90%

Question Type, Cognitive Load, and CEFR Alignment: Evaluating LLM-Generated EFL Grammar Drill Exercises

问题类型、认知负荷与CEFR对齐:评估LLM生成的EFL语法练习

Steve Woollaston, Brendan Flanagan, Yuko Toyokawa, Hiroaki Ogata

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL

AI总结 本研究通过分析日本初中生在语法练习应用中的日志数据,评估了LLM生成的EFL学习内容的教学可行性,揭示了不同问题模态对表现的影响,并验证了CEFR-J语法框架的难度层级。

Comments Under review for the the 34th International Conference on Computers in Education (ICCE 2026). 2jun26: v2 - fixed minor typo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06223 2026-07-08 cs.AI 新提交 90%

Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents

基于信息增益的展开策略优化:一种用于多轮语言模型智能体的自适应树结构展开方法

Yijun Zhang, Fan Xu, Jiaxin Ding, Yule Xie, Shiqing Gao, Xin Ding, Haoxiang Zhang, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对LLM智能体长期搜索任务中展开预算分配不合理问题,提出基于信息增益的展开策略优化(IGRPO),通过按节点信息性分配预算进行树结构展开,并利用诱导教师分布指导策略优化,实验验证该方法在相同预算下优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31480 2026-07-08 cs.CL 版本更新 90%

Language Models Can Resolve Reference Compositionally, But It's Not Their Native Strength: The Case of the Personal Relation Task

语言模型可以组合性地解析指代,但这并非其天然优势:以个人关系任务为例

Bart Evelo, Meaghan Fowlie, Denis Paperno

专题命中 其他LLM :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 通过个人关系任务,比较人类与大型语言模型在外延任务(确定指称对象)和内涵任务(结构化表示意义)上的表现,发现人类更擅长外延任务而LLM更擅长内涵任务,表明缺乏指称基础是LLM模拟人类语言理解的关键缺失。

Comments A pre-MIT Press publication version. Paper accepted to Transactions of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28345 2026-07-07 cs.SE cs.AI 版本更新 90%

Reachability Across the NL/PL Boundary: A Taxonomy-Driven Dataflow Model for LLM-Integrated Applications

当代码遇见自然语言:基于分类法的LLM集成应用信息流分析

Zihao Xu, Xiao Cheng, Ruijie Meng, Yuekang Li

机构 * University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) National University of Singapore(新加坡国立大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种基于定量信息流理论的分类法,定义24个标签以跨越LLM调用的自然语言与编程语言边界,实现信息流分析,并在污点传播和程序切片中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08579 2026-07-07 cs.CL 版本更新 90%

LLM-based Human Simulations Have Not Yet Been Reliable

基于大语言模型的人类模拟尚不可靠

Qian Wang, Jiaying Wu, Zichen Jiang, Zhenheng Tang, Bingqiao Luo, Nuo Chen, Wei Chen, Huacan Wang, Bingsheng He

机构 * National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港理工大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究指出基于大语言模型(LLM)的人类模拟不可靠,通过系统回顾找出其在多领域模拟中的问题源于LLM局限与设计缺陷,提出强化数据、提升模型能力及稳健设计的解决框架与算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01867 2026-07-03 cs.SE cs.AI 新提交 90%

An Exploratory Study on LLM-Generated Code and Comments in Code Repositories

关于LLM生成的代码和注释在代码仓库中的探索性研究

Yongyi Ji, Jiaji Wang, Yi Zhou, Fuxiang Chen, Hongji Yang

机构 * School of Computing and Mathematical Sciences, University of Leicester(利兹大学计算与数学科学学院)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过检测工具分析2021-2025年公司和社区维护的仓库,发现LLM生成的代码随时间减少且多出现在测试用例中,注释则相对稳定;公司仓库中LLM生成内容比例更高,且仅少数人工标记的bug与LLM生成代码相关。

Comments Accepted to The Journal of Systems & Software (JSS) on 1 July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00553 2026-07-01 cs.LG 版本更新 90%

Stable-GFlowNet: Toward Diverse and Robust LLM Red-Teaming via Contrastive Trajectory Balance

Stable-GFlowNet: 通过对比轨迹平衡实现多样且鲁棒的LLM红队测试

Minchan Kwon, Sunghyun Baek, Minseo Kim, Jaemyung Yu, Dongyoon Han, Junmo Kim

机构 * Naver AI Lab(Naver AI实验室)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对大语言模型红队测试中有效性与多样性难以兼顾的问题,提出Stable-GFlowNet方法,通过消除配分函数估计和对比轨迹平衡实现稳定训练,在保持最优策略的同时提升攻击性能与多样性。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28839 2026-06-30 cs.LG 90%

The Contagion Tensor: A Framework for Measuring Output-Distribution Coupling in Multi-Agent LLM Systems -- and Auditing the Claims It Enables

传染张量:多智能体大语言模型系统中输出分布耦合的测量框架——及其支持的主张审计

Zewen Liu

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出传染张量框架量化多智能体LLM输出分布耦合,导出耦合放大因子(CAF)作为无量纲指标,通过仿真和真实API实验验证图像条件超线性效应,提供可迁移消融协议。

Comments 26 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26924 2026-06-26 cs.SE cs.AI cs.CR 新提交 90%

A Deterministic Control Plane for LLM Coding Agents

LLM编码代理的确定性控制平面

Padmaraj Madatha

机构 * Happiest Minds Technologies (AIP Centre of Excellence)(happiest minds technologies(aip中心卓越机构))

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM编码代理配置缺乏管理的问题,提出确定性控制平面Rel(AI)Build,通过内容寻址、分层权限、阶段状态机等机制确保配置安全与一致性。

Comments 45 pages, 9 figures, 13 tables. Dataset and reproduction scripts: Zenodo DOI 10.5281/zenodo.20780913. Ancillary files include report.json, organizations.txt, and figure-reproduction scripts

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26203 2026-06-26 cs.AI cs.CY cs.MA cs.SI 新提交 90%

Agentic Analysis for Agentic Infrastructure: An LLM-Powered Pipeline for Comparative Governance of DAO and Corporate AI Protocols

面向代理基础设施的代理分析:基于LLM的DAO与企业AI协议比较治理管道

Yutian Wang, Luyao Zhang

机构 * Duke Kunshan University(昆山杜克大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 提出LLM驱动的比较分析管道,结合自动标注、神经主题建模和多层网络分析,研究DAO与企业AI协议的治理结构,发现开放治理促进主题收敛但参与不平等普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13076 2026-06-25 cs.CL cs.FL cs.SE 版本更新 90%

TruncProof: A Guardrail for LLM-based JSON Generation under Token-Length Constraints

TruncProof: 一种用于在令牌长度限制下基于LLM的JSON生成的防护机制

Yoshio Kato, Shuhei Tarashima

机构 * NTT DOCOMO BUSINESS, Inc., Japan(NTT DOCOMO商务公司,日本)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出TruncProof,一种基于文法约束的生成方法,使LLM在限定令牌数下生成语法正确的JSON。实验表明其在严格令牌限制下仍能生成语法正确且语义准确的输出。

Comments Main paper (8 pages). Accepted at the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22719 2026-06-23 q-fin.ST cs.AI 新提交 90%

Leakage-Aware Benchmarking of LLM Forecasting: Real-Time Nowcasts as the Decision-Time Input for Macro Factor Ranking

泄露感知的LLM预测基准测试:实时预测作为宏观因子排序的决策时间输入

Mao Guan, Qian Chen

机构 * Independent Researcher(独立研究者)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种泄露控制的因子排序方法,使用检索增强的7B开源LLM预测器,在决策时间仅利用滞后宏观变量、近期事件摘要和实时通胀预测,实现中位数Spearman秩IC为+0.154,并验证了实时通胀信息和宏观相似检索对中位数信号的主导作用。

Comments 10 pages, 4 figures. Accepted at the ICML 2026 Workshop on AI Forecasting (Forecasting as a New Frontier of Intelligence). Non-archival. OpenReview: https://openreview.net/forum?id=mi8QiWomm3

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23664 2026-06-23 cs.LG cs.MA 新提交 90%

MAS-PromptBench: When Does Prompt Optimization Improve Multi-Agent LLM Systems?

MAS-PromptBench:提示优化何时能提升多智能体LLM系统?

Juyang Bai, Laixi Shi

机构 * Johns Hopkins University(约翰霍普金斯大学) Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.LG

AI总结 系统研究提示优化在多智能体LLM系统中的效果,发现其能显著提升性能,但收益依赖于任务、工作流和团队规模等配置。

Comments Project page: https://juyangbai.github.io/MAS-PromptBench/ ; Code: https://github.com/juyangbai/MAS-PromptBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12280 2026-06-23 cs.SE cs.AI 版本更新 90%

Iterative Audit Convergence in LLM-Managed Multi-Agent Systems: A Case Study in Prompt-Engineering Quality Assurance

迭代审计收敛于LLM管理的多智能体系统:提示工程质量保证的案例研究

Elias Calboreanu

机构 * Swift (North) AI Lab, The Swift Group, LLC, Maryland, USA(Swift(北)AI实验室,The Swift Group LLC,马里兰州,美国) Capitol Technology University, Laurel, MD 20708, USA(Capitol技术大学,Laurel,马里兰州20708,美国)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过AEGIS系统案例研究,探讨了迭代、智能体驱动的审计方法,发现7150行提示规范中存在51个一致性缺陷,提出七类缺陷分类及审计协议。

Comments 23 pages, 4 figures, 11 tables. Published in MDPI Software (Special Issue: Software Reliability, Security and Quality Assurance). Companion preprint at arXiv:2604.05000

Journal ref Software 2026, 5, 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20258 2026-06-19 cs.HC cs.AI 新提交 90%

Editorial Alignment: A Participatory Approach to Engaging Editorial Expertise in LLM-mediated Knowledge Dissemination

编辑对齐:一种参与式方法,将编辑专业知识引入LLM介导的知识传播

Simon Aagaard Enni, Malthe Stavning Erslev, Karl-Emil Kjær Bilstrup, Kristoffer Laigaard Nielbo

机构 * Aarhus University(奥胡斯大学) University of Copenhagen(哥本哈根大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出“编辑对齐”作为参与式AI设计实践,通过设计工作坊让编辑参与重新对齐LLM接口至编辑标准,以维护公共知识机构的编辑职能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15914 2026-06-16 cs.CL cs.HC 新提交 90%

Contaminated Collaboration: Measuring Gender Bias Transfer in LLM-Assisted Student Writing

污染的合作:测量LLM辅助学生写作中的性别偏见迁移

Ariyan Hossain, Kazi Kamruzzaman Rabbi, Farig Sadeque, S M Taiabul Haque

机构 * Brac University(布拉卡大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL

AI总结 通过实验发现,使用性别偏见的LLM写作助手会显著增加学生职业规划作文中的性别刻板印象,且偏见迁移不对称:女性目标作文的能动性被抑制,男性目标作文受影响较小。

Comments 18 pages, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14209 2026-06-15 cs.CL 新提交 90%

Detecting undisclosed LLM-generated content in parliamentary texts

检测议会文本中未披露的LLM生成内容

Minerva Suvanto, Andrea McGlinchey, Peter J. Barclay, Mattias Wahde

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Cambridge(剑桥大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL

AI总结 本研究训练可解释文本分类器,检测英国和瑞典议会文本中未披露的LLM使用情况,发现自2022年起两国议会中未披露的LLM使用持续增加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21594 2026-06-11 cs.LG 版本更新 90%

Visualizing LLM Latent Space Geometry Through Dimensionality Reduction

通过降维可视化LLM潜在空间几何结构

Alex Ning, Vainateya Rangaraju, Yen-Ling Kuo

机构 * Department of Computer Science, University of Virginia(计算机科学系,弗吉尼亚大学)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过PCA和UMAP降维,可视化GPT-2和LLaMa中Transformer层的潜在状态几何,发现注意力与MLP输出分离、初始位置高范数及螺旋结构等模式。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10439 2026-06-10 cs.SD cs.CL eess.AS 新提交 90%

Enhancing Multilingual LLM-based ASR with Mixture of Experts and Dynamic Downsampling

利用混合专家和动态下采样增强基于多语言大模型的语音识别

Guodong Lin, Ziqi Chen, Yuxiang Fu, Ke Li, Wei-Qiang Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于投影器的LLM-ASR框架,通过混合专家架构提升跨语言适应性,并利用连续整合-触发机制实现动态下采样和模态对齐,实验表明该方法显著超越强基线模型。

Comments Accepted by ICASSP 2026

Journal ref ICASSP (2026),18807-18811

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07874 2026-06-09 cs.AI 新提交 90%

Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators

安全是上下文相关的,而LLM评判者不是:应对评估者的刚性先验

Anissa Alloula, Federico Licini, Ava Batchkala, Seraphina Goldfarb-Tarrant

机构 * University of Oxford(牛津大学) Cohere

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 研究LLM作为安全评判者时,对上下文信息的依赖性和对不同安全定义的可引导性,发现它们难以在上下文或安全定义与自身先验矛盾时调整评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00358 2026-06-09 cs.CL cs.CV 版本更新 90%

From Backward Spreading to Forward Replay: Revisiting Target Construction in LLM Parameter Editing

从反向传播到正向回放:重新审视LLM参数编辑中的目标构造

Wei Liu, Hongkai Liu, Zhiying Deng, Yee Whye Teh, Wee Sun Lee

机构 * University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL

AI总结 本文重新审视LLM参数编辑中的目标构造,提出一种更简洁的替代方法,通过正向传播代替反向传播,提高目标隐藏状态的准确性和兼容性。

Comments ICML 2026, code: https://github.com/jugechengzi/FE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06755 2026-06-08 cs.CL cs.ET 新提交 90%

PromptPrint: Behavioral Biometrics Through Natural Language Prompting in LLMs

PromptPrint: 通过自然语言提示在LLMs中的行为生物特征

Shaiv Patel, Kartik Narayan, Vishal Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他LLM :LLM(summary_cn,abstract);prompting(title);large language model(abstract);language model(abstract)

AI总结 提出PromptPrint,研究用户与LLM交互的简短提示是否包含可识别的行为生物特征,通过词汇、句法和话语模式分析,发现词汇稳定性假设成立,但存在唯一性-一致性悖论,且身份信号对语义改写脆弱。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03032 2026-06-03 cs.CL 90%

The Deliberative Illusion: Diagnosing Factual Attrition and Stance Homogenization in Multi-Agent LLM Deliberation

深思幻觉:诊断多智能体LLM讨论中的事实损耗与立场同质化

Herun Wan, Jiaying Wu, Minnan Luo, Fanxiao Li, Ningnan Wang, Nancy F. Chen, Min-Yen Kan

机构 * Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学) Yunnan University(云南大学) Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR))

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出DelibTrace框架,通过分解原子事实并追踪其存留,发现多智能体LLM讨论中高达72%的关键事实丢失,导致立场同质化,揭示了“同意越多、知道越少”的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01490 2026-06-02 cs.SE cs.AI cs.MA 90%

LLM Consortium for Software Design Refinement: A Controlled Experiment on Multi-Agent Collaboration Topologies

LLM联盟用于软件设计精化:多智能体协作拓扑的受控实验

Nagarjuna Kanamarlapudi, Praveen K

机构 * LLM Consortium for Software Design Refinement(软件设计精炼LLM联盟)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 通过受控实验评估12种多智能体LLM协作拓扑在软件架构设计中的表现,发现结构对抗变体(v4b)和跨模型评审(v2)排名前二,并行合并因令牌饥饿和弗兰肯斯坦效应表现最差。

Comments 12 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30653 2026-06-01 cs.CL 90%

Counterfactual Graph for Multi-Agent LLM Calibration

多智能体LLM校准的反事实图

Jiatan Huang, Mingchen Li, Ziming Li, Sunjae Kwon, Hong Yu, Chuxu Zhang

机构 * University of Connecticut(康涅狄格大学) University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL

AI总结 针对多智能体LLM系统中通信导致的相关失败和虚假共识问题,提出CAGE-CAL框架,通过比较观察到的通信后图与匹配的反事实无通信图来校准置信度,提升可靠性区分和拓扑选择。

详情

展开后加载摘要…

URL PDF HTML 收藏