arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1658 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1658 篇

2607.29549 2026-08-03 cs.AI 新提交 90%

AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction

AMTFV:面向LLM自校正的智能体数学工具流验证

Rui Zou, Yutao Zhu, Mengqi Wei, Ji-Rong Wen

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对LLM数学答案验证难题,提出AMTFV方法,通过MTF接口解耦验证建模与执行,在5个数学推理数据集上较基线提升最高8.3个百分点,验证复杂度越高增益越显著。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29087 2026-08-03 cs.AI 新提交 90%

Harnessing the Wisdom of LLM Crowds through Complementarity-Driven Iterative Collaboration

通过互补驱动的迭代协作挖掘大语言模型群体的智慧

Yanbin Fang, Xuan Wei, Wei Chen

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对现有LLM组合方法忽略动态互补性的问题,提出WILC框架,通过迭代反思优化与双门互补模型选择机制,在四个基准上性能优于现有方法,成本仅为GPT-5.2的约1/7,扩展了群体智慧理论并提供多AI协调设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28947 2026-08-03 cs.LG 新提交 90%

Overcoming the Weakest-Link Effect in LLM-Driven Program Optimization via Heterogeneous Edit Recombination

通过异构编辑重组克服大语言模型驱动的程序优化中的最弱链效应

Jingwen Fu, Zhen Liu, Yuhan Liu, He Zhang, Nanning Zheng

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究针对LLM程序优化的最弱链效应,提出HERO异构编辑重组优化器,可生成多样非重叠原子编辑并结合评估器分数组合改进,在多领域实现更高分数、更快收敛与更少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28877 2026-08-03 cs.AR cs.LG cs.SE 新提交 90%

Open-Source LLM-Driven Formal Verification: A Multi-Agent Pipeline for RTL Repair

开源大语言模型驱动的形式化验证:用于RTL修复的多智能体流水线

Ha Trung Tran

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出将LLM与开源形式化后端结合的多智能体RTL修复流水线,通过反例引导迭代实现RTL修复,经ALU案例及6基准测试验证可行性并分析失效模式。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28330 2026-07-31 cs.AI 新提交 90%

Paying for Honesty Without Knowing the Truth: Reputation-Penalty Design for LLM Marketplace Agents

在未知真相的情况下为诚实付费:LLM市场智能体的声誉惩罚机制设计

Mingdai Yang, Shicheng Fan, Kejing Yu, Duohao Wang, Li Sun, Hao Peng, Philip S. Yu, Zhiwei Liu

机构 * Univ. of Illinois Chicago(伊利诺伊大学芝加哥分校) Springbrand Inc.(春品牌公司) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Hangzhou Innovation Institute of BUAA(北京航空航天大学杭州创新研究院) Microsoft(微软公司)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM智能体商家伪造属性的问题,设计无需真实情况的CARP声誉惩罚机制,搭配SPARC机制可保护消费者、提升福利,且在多模型中具有约束力。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26909 2026-07-30 cs.CL 新提交 90%

Dual-Path LLM Reasoning for Multimodal Few-Shot Knowledge Graph Completion

用于多模态少样本知识图谱补全的双路径大语言模型推理

Jinlan Liu, Zhiying Tu, Yongchao Xing, Yicheng Liu, Bolin Zhang, Dianbo Sui, Dianhui Chu, Hongliang Sun

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对多模态少样本知识图谱补全难题,提出双路径大语言模型推理框架DuPLeR,结合多模态LLM先验与事实支撑构建校准关系图,经实验验证其在数据稀缺场景下性能稳健。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26773 2026-07-30 cs.AI 新提交 90%

Do Latent Channels Actually Communicate? A Causal Audit of Latent Multi-Agent LLM

隐通道真的在通信吗?隐式多智能体大语言模型的因果审计

Huixiang Zhang, Mahzabeen Emu

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对隐式多智能体LLM提出因果审计方法,通过受控消息替换揭示隐式通信的作用机制,发现不同规模Qwen模型在不同数据集上的隐式消息效应存在差异,证明总准确率无法反映隐式消息的实际影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26120 2026-07-30 cs.AI 新提交 90%

Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

更严重的欺骗:混合动机大型语言模型多智能体系统中的目标不一致

Marylou Fauchard, Florian Carichon, Margarida Carvalho, Golnoosh Farnadi

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究以《狼人杀》为框架,分析LLM多智能体的目标不一致问题,发现其会破坏对抗环境结果且在公开行为中难察觉,凸显需缓解策略。

Comments Accepted at AIWILD@ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21187 2026-07-24 cs.LO cs.AI cs.SC 新提交 90%

Case study: proving sqrt(2) irrational with LPTP and an LLM

案例研究:使用LPTP和大语言模型证明√2是无理数

Fred Mesnard, Étienne Payet, Wim Vanhoof

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究在逻辑编程环境下,从基本谓词定义出发,借助LPTP系统,简述√2无理数的证明并与LLM交互,最终获得由LLM部分生成、LPTP完全验证的完整形式证明。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 67-80

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18310 2026-07-22 physics.soc-ph cs.AI 新提交 90%

Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling

分布优先的总体模拟:非怪异大语言模型角色建模中的崩溃、校准和召回

Gurkan Ozkan

机构 * Istanbul Technical University(伊斯坦布尔技术大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究非怪异LLM角色建模中独立代理范式的问题,提出分布优先校正方法,通过言语化采样等进行实验,发现原范式有崩溃等问题,校正方法能测量内部不一致性及校准条件。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17437 2026-07-21 cs.AI 新提交 90%

Empirical Grounding Improves the Realism of LLM Agents Simulating Human Behavior During Disruptions

经验基础提升了在干扰期间模拟人类行为的大语言模型智能体的现实性

Chen Xia, Zexi Kuang, Yuqing Hu

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨经验基础对提升LLM智能体模拟人类行为现实性的作用,开发基于经验的框架,将多项调查数据嵌入其中,通过实验验证该框架能显著提升模拟效果,使LLM智能体成为更具统计可信度的人口行为模拟器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14574 2026-07-17 cs.AI cs.SI 新提交 90%

Collaborative Spatial Learning with Multi-LLM Agents in Networked Social Experiments

网络社会实验中多语言模型智能体的协作空间学习

Hao He, Chris J. Kuhlman, Xinwei Deng

机构 * Virginia Tech(弗吉尼亚理工大学) Advanced Research Computing, Virginia Tech(弗吉尼亚理工大学高级研究计算中心)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究一组大语言模型智能体在梅森-瓦茨实验中的网络效率效应,开发机械贝叶斯优化智能体作比较。计算实验表明,指示LLM智能体随机化首轮选择有显著网络效率效应,贝叶斯优化智能体收益更高,还比较了智能体多方面行为。

Comments Accepted at ASONAM 2026; to appear in the Springer proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06461 2026-07-08 eess.AS cs.CL cs.SD 新提交 90%

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

WordVoice:基于大语言模型的文本转语音中显式且解耦的多维词级控制

Sihang Nie, Jinxin Ji, Xiaofen Xing, Deyi Tuo, Chengbin Jin, Jialong Mai, Xiangmin Xu

机构 * South China University of Technology(南方科技大学) Huya Inc.(Huya公司) Tongji University(同济大学) The Hongkong polytechnic university(香港理工大学) Foshan University(佛山大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对基于LLM的TTS系统词级控制粗糙的问题,提出统一框架。构建含五维注释的数据集,引入WordVoice将隐式生成变为显式可控范式,经实验验证其在多声学维度上实现卓越解耦控制且保持零样本合成稳定性。

Comments 10 pages, 4 figures, 6 tables; Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31158 2026-07-01 cs.RO cs.AI 新提交 90%

LLM-Powered Interactive Robotic Action Synthesis from Multimodal Speech, Gestures, and Music

基于多模态语音、手势和音乐的LLM驱动交互式机器人动作合成

Snehasis Banerjee, Ranjan Dasgupta

机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出利用大语言模型融合语音、手势和音乐节拍等多模态输入,合成复杂机器人动作序列的框架,实现更自然的人机交互。

Comments IROS 2025 Workshop on Action and Interaction: Humans and Robots in Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28011 2026-06-29 eess.SY cs.LG cs.SY 新提交 90%

From Detection to Action: Using LLM Agents for Fault-Tolerant Control

从检测到行动:使用LLM智能体进行容错控制

Javal Vyas, Milapji Singh Gill, Artan Markaj, Felix Gehlhoff, Mehmet Mercangöz

机构 * Imperial College London(帝国理工学院伦敦校区) Helmut Schmidt University(海德堡-施密特大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出基于大语言模型智能体的主动容错控制框架,通过多智能体协作、数字孪生和知识图谱增强检索,生成并验证最小风险恢复路径,在离散和连续过程控制中实现从故障检测到有效纠正行动的闭环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22375 2026-06-23 cs.AI cs.CE cs.IR 新提交 90%

ARIA: A Causal-Aware Framework for Rescuing LLM Reasoning in Trustworthy Materials Discovery

ARIA: 一种用于在可信材料发现中拯救LLM推理的因果感知框架

Yi Cao, Liaoyaqi Wang, Jieneng Chen, Benjamin Van Durme, Alan Yuille, Paulette Clancy

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ARIA框架,通过因果感知的三级级联(直接因果推理、物理类比迁移、参数回退)解决LLM在材料发现中的上下文隧道问题,提升物理可信性。

Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21740 2026-06-23 cs.AI 新提交 90%

Training the Orchestrator: A Supervised Approach to End-to-End PDDL Planning with LLM Agents

训练编排器:一种基于监督学习的端到端PDDL规划方法,使用LLM智能体

Rajesh Mangannavar, Zachary Coalson, Pranay Dugar, Prasad Tadepalli

机构 * Oregon State University(俄勒冈州立大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出HALO框架,通过监督学习训练编排器,利用验证器提供的轨迹作为监督信号,在11个PDDL领域上以极低成本实现与前沿LLM相当的成功率。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20895 2026-06-23 cs.AI 新提交 90%

Neurosymbolic Clinical Trial Matching via LLM-Driven Abduction and Logical Verification

基于LLM驱动溯因与逻辑验证的神经符号临床试验匹配

Baiyang Qu, Leonardo Ranaldi, Xi Wang, Marco Valentino

机构 * University of Leicester(莱斯特大学) University of Edinburgh(爱丁堡大学) University of Sheffield(谢菲尔德大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种结合大语言模型与逻辑验证的神经符号框架αNeSy-CTM,通过溯因推理处理噪声和不完整临床文本,在临床试验匹配中相对零样本基线提升30%准确率。

Comments 21 pages (including appendix), 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14935 2026-06-23 cs.AI 新提交 90%

PrologMCP: A Standardized Prolog Tool Interface for LLM Agents

PrologMCP:面向LLM代理的标准化Prolog工具接口

Agnieszka Mensfelt, Adarsh Prabhakaran, Adrian Haret, Vince Trencsenyi, Kostas Stathis

机构 * Royal Holloway, University of London(伦敦大学皇家霍洛威学院)

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 提出PrologMCP,一个通过模型上下文协议将Prolog暴露为状态化工具的任务无关开源服务器,使LLM代理能够通过翻译-运行-检查-修复循环稳健地委托演绎推理,在PARARULE-Plus上达到或超越推理型LLM。

Comments Accepted at Joint Workshop on Statistics and Knowledge Integration for Logic, Learning, Ethical Decisions, and LLMs, 18 July 2026, Lisbon v2: Added references to other Prolog MCP servers; fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19771 2026-06-19 cs.AI 新提交 90%

Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning

超越熵:从令牌级分布偏差中学习以增强LLM推理

Xuanzhi Feng, Zhengyang Li, Zeyu Liu, Haoxi Li, Yuming Jiang, Bing Guo, Jingcai Guo, Jie Zhang, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Sichuan University(四川大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对RLVR中令牌更新导致的熵塌陷或爆炸问题,提出ICT框架,利用JS散度识别关键令牌,通过选择性更新平衡策略集中度,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19494 2026-06-19 cs.AI 新提交 90%

Hidden Anchors in Multi-Agent LLM Deliberation

多智能体LLM协商中的隐藏锚点

Apurba Pokharel, Ram Dantu

机构 * University of North Texas(北德克萨斯大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 将多智能体LLM协商建模为闭环动力系统,每个智能体有隐藏内部信念(锚点),解释协商如何超越初始信念凸包,并通过恢复锚点预测模型行为。

Comments 13 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14517 2026-06-17 cs.CR cs.AI 新提交 90%

From Shield to Target: Denial-of-Service Attacks on LLM-Based Agent Guardrails

从盾牌到靶心:针对基于LLM的智能体护栏的拒绝服务攻击

Yuguang Zhou, Xunguang Wang, Pingchuan Ma, Zhantong Xue, Zhaoyu Wang, Shuai Wang

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文揭示基于LLM的护栏易受拒绝服务攻击,通过束搜索优化框架和机制感知结构变异生成恶意负载,导致令牌放大13-63倍、延迟放大148倍,威胁系统可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16576 2026-06-16 cs.CL 新提交 90%

Can LLM Agents Infer World Models? Evidence from Agentic Automata Learning

LLM智能体能否推断世界模型?来自智能体自动机学习的证据

Reef Menaged, Gili Lior, Shauli Ravfogel, Roee Aharoni, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(海法大学) New York University(纽约大学) Google Research(谷歌研究)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出智能体自动机学习框架,通过成员查询和等价查询评估LLM智能体发现隐藏确定性有限自动机的能力,发现性能随DFA规模增加而急剧下降,推理模型优于非推理模型但仍存在规划、整合和假设构建缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16481 2026-06-16 cs.AI 新提交 90%

Steering Emotional Dynamics for Art Therapy: Controllable Narrative Script Generation through Hierarchically Guided LLM Agents

引导艺术治疗的情感动态:通过分层引导的LLM智能体实现可控叙事脚本生成

Suqing Wang, Qinghai Miao, Chao Guo, Yisheng Lv

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出EC-Script框架,通过分层控制情感轨迹生成叙事脚本,实现情感轨迹规划、场景驱动和局部情感调节,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16478 2026-06-16 cs.AI 新提交 90%

Tensor-Coord: Algebraic Decomposition of Joint Plan Tensors for Conflict-Free Multi-Agent LLM Planning

Tensor-Coord:用于无冲突多智能体LLM规划的联合计划张量代数分解

Mudit Rastogi

机构 * University of Michigan(密歇根大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Tensor-Coord框架,将多智能体联合计划表示为三阶张量,通过CP和Tucker分解识别协调结构,计算协调复杂度并定位冲突,实现无冲突规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16328 2026-06-16 cs.AI 新提交 90%

AdaSTORM: Scaling LLM Reasoning on Dynamic Graphs via Adaptive Spatio-Temporal Multi-Agent Collaboration

AdaSTORM: 通过自适应时空多智能体协作扩展动态图上的LLM推理

Bing Hao, Ruijie Wang, Haodong Qian, Yunlong Chu, Yuhang Liu, Yumeng Lin, Minglai Shao, Jianxin Li

机构 * Tianjin University, China(天津大学,中国) Beihang University, China(北航大学,中国)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AdaSTORM框架,通过自适应分区和时空解耦的多智能体协作,将动态图推理扩展到千节点规模,准确率超90%,无需外部工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13693 2026-06-16 cs.CY cs.AI 新提交 90%

Limited Marginal Benefit of Reasoning-Heavy LLM Deployment in ESG Narrative Scoring: A 4-Model Consensus Study on Japanese Listed Firms

ESG叙述评分中重度推理LLM部署的有限边际收益:一项关于日本上市公司的4模型共识研究

Hiroyuki Kokubu

机构 * Kansai University(关西大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过4模型共识设计,研究在ESG叙述评分中,重度推理模型相比非推理模型是否带来显著收益,发现其边际收益有限且成本高昂。

Comments 12 pages. Earlier version available on SSRN, Abstract ID 6683303

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12657 2026-06-12 cs.AI cs.DB cs.RO 新提交 90%

TrajGenAgent: A Hierarchical LLM Agent for Human Mobility Trajectory Generation

TrajGenAgent: 一种用于人类移动轨迹生成的分层LLM智能体

Siyu Li, Toan Tran, Lingyi Zhao, Khurram Shafique, Li Xiong

机构 * Emory University(埃默里大学) University of Florida(佛罗里达大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出TrajGenAgent,一种无需微调的分层LLM智能体框架,通过编排器-工作者两阶段设计生成真实轨迹,在时空保真度、语义一致性和个体行为真实性上优于现有方法。

Comments 14 pages, 2 figures, 8 tables. Accepted by the 27th IEEE International Conference on Mobile Data Management (MDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10307 2026-06-10 cs.CL 新提交 90%

Early-Token Confidence Predicts Reasoning Quality in Multi-Agent LLM Debate

早期令牌置信度预测多智能体LLM辩论中的推理质量

Ali Keramati, Justin Cheok, Jacob Horne, Mark Warschauer

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 研究利用解码时令牌级对数概率作为置信度信号,预测多智能体LLM辩论中的推理质量,发现早期令牌置信度是最强预测因子。

Comments 15 pages, 8 figures, 4 tables; ACL Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10304 2026-06-10 cs.CL 新提交 90%

MIRAGE: A Polarity-Flipping Encoding Subspace in LLM Agents

MIRAGE: LLM智能体中的极性翻转编码子空间

Pratibha Revankar, Kargi Chauhan, Jihye Kim, Sadiba Nusrat Nur, Vincent Siu, Chenguang Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL

AI总结 发现LLM智能体在隐蔽编码敏感数据时,残差流中存在共享的低维编码子空间,通过逻辑回归探针可高精度检测,并构建MIRAGE实时监控器,在126个场景中AUC达0.918,远超仅输出检测。

详情

展开后加载摘要…

URL PDF HTML 收藏