arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1799 篇

2608.21100 2026-08-24 cs.AI 新提交 90%

ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models

ReFrame:多模态大语言模型中基于证据的测试时安全对齐

Wenzheng Jiang, Xuankun Rong, Yuanzhao Zhai, Dawei Feng, Huaimin Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对现有多模态安全对齐方法不适用于闭源模型的问题,提出无需训练的ReFrame框架,通过两个智能体协作实现测试时安全对齐,在提升安全性能的同时保留多模态效用。

Comments Accepted to EMNLP 2026. 22 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13472 2026-08-14 eess.SY cs.AI cs.SY 新提交 90%

AaLLM: An End-to-End Analog Circuit Design Framework from Topology Generation to Sizing Using Large Language Models

AaLLM:基于大语言模型的从拓扑生成到尺寸确定的端到端模拟电路设计框架

Mohammed Ayman Habib, Rylan Hart, Morteza Fayazi

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 本文提出AaLLM,一种端到端多智能体LLM工作流,自动完成模拟电路拓扑生成与尺寸确定,可减少SPICE调用次数和运行时间,创新拓扑性能与传统拓扑相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10339 2026-08-12 stat.ME cs.AI stat.AP 新提交 90%

Expert-Guided g-computation with Large Language Models for Estimating Causal Effects on Timings: Applications to Hospital Quality Improvement

基于大型语言模型的专家引导g计算法估计时序因果效应:在医院质量改进中的应用

Patrick Vossler, Jialin Ouyang, F. Richard Guo, Anran Huang, Ali Shojaie, Lucas Zier, Fan Xia, Jean Feng

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 本研究提出专家引导g计算法(egg-computation),结合专家判断与LLM技术,用于估计医院干预措施对平均住院时长的因果效应,在模拟和真实医院数据中表现优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08168 2026-08-11 cs.CL 新提交 90%

Thinking vs. NoThinking: Towards Interpreting Reasoning Mechanisms of Large Language Models via Sparse Autoencoders

思考与非思考:基于稀疏自编码器的大语言模型推理机制可解释性研究

Bo Cheng, Qiaolin Lu, Yi Chang, Yuan Wu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究基于稀疏自编码器分析DeepSeek-R1-Distill-Qwen-7B的推理机制,揭示思考与非思考模式的神经差异,为大语言模型推理可解释性提供新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19365 2026-07-23 cs.AI 新提交 90%

Logic-Guided Data Extraction with Answer Set Programming and Large Language Models

使用回答集编程和大语言模型进行逻辑引导的数据提取

Mario Alviano, Lorenzo Grillo, Nicola Leone, Fabrizio Lo Scudo

机构 * University of Calabria(卡拉布里亚大学) University of Campania Luigi Vanvitelli(坎帕尼亚路易吉·万维泰利大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对大语言模型用于语义数据提取时的不足,提出结合回答集编程与大语言模型的逻辑引导数据提取框架,通过交错调用与推导减少大语言模型调用次数,提高提取质量。

Comments 42nd International Conference on Logic Programming, to appear in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17331 2026-07-21 cs.AI cs.MA 新提交 90%

Agentic ERP: Multi-Agent Large Language Model Architecture for Autonomous Enterprise Resource Planning

智能企业资源规划(Agentic ERP):用于自主企业资源规划的多智能体大语言模型架构

Zhihao Liu, Tianyu Wang, Xi Vincent Wang, Lihui Wang

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Department of Production Engineering(生产工程系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 研究针对ERP系统过度依赖人类决策的问题,提出Agentic ERP架构,结合角色对齐的LLM智能体、人工参与框架和图编排器。通过特定决策问题表述、编排解耦及多层面评估,证明该方法优于基线,能让ERP主动执行决策,提供了参考架构与评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05775 2026-07-08 cs.AI 新提交 90%

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents

超越排行榜:大语言模型智能体中工具使用、规划和推理失败的综合分析

Wael Albayaydh, Rui Zhao, Ivan Flechais

机构 * University of Oxford(牛津大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文综合多篇论文形成大语言模型智能体局限性交叉分类法,识别出六个失败集群,通过迭代分组得出分类法,发现失败与任务长度非线性相关,单个子任务性能不能保证端到端成功,额外脚手架效果不佳,同时在部分任务上有进展。

Comments 16 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00048 2026-07-02 cs.SE cs.AI 新提交 90%

Comparing Large Language Models on Scrum Certification-Style Questions: Accuracy, Stability, and Error Patterns

在Scrum认证风格问题上比较大型语言模型:准确性、稳定性和错误模式

Robson Alves Vilar, Emanuel Dantas Filho, Ademar França de Sousa Neto, Mirko Perkusich, Danyllo Wagner Albuquerque, João Paiva, Kyller Gorgônio, Angelo Perkusich

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)

AI总结 评估GPT-5 mini、Gemini 3 Flash和DeepSeek Chat 3.2在993个Scrum认证问题上的表现,发现模型间差异显著,Gemini 3 Flash准确率最高,错误模式具有系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19308 2026-06-18 cs.CL cs.MA 新提交 90%

Enhancing Decision-Making with Large Language Models through Multi-Agent Fictitious Play

通过多智能体虚拟博弈增强大语言模型的决策能力

Leyang Shen, Yang Zhang, Xiaoyan Zhao, Chun Kai Ling, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对多智能体系统中决策任务因立场纠缠而难以分解的问题,提出基于虚拟博弈的多智能体虚拟博弈(MAFP)范式,通过迭代最佳响应实现均衡求解,提升决策质量和鲁棒性。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06865 2026-06-08 cs.CL 新提交 90%

Are Large Language Models Suitable for Graph Computation? Progress and Prospects

大型语言模型是否适合图计算?进展与展望

Yuting Zhang, Yi Han, Kai Wang, Wei Ni, Angela Bonifati, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Antai College of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院) Edith Cowan University(埃迪斯科文大学) Lyon 1 University(里昂第一大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL

AI总结 本文通过角色分类法综述LLM在图计算中的应用,分析作为执行者和规划者的两种范式,指出LLM适用于简单小规模任务,但在大规模和精确性要求高的任务中不可靠,并总结数据集和未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26114 2026-08-28 cs.AI cs.CL q-fin.CP 新提交 90%

CIFQA: A Deterministic Tool-Grounded Multi-Agent LLM Framework for Financial Query Answering

CIFQA:一种用于金融查询问答的确定性工具基多智能体大语言模型框架

Kunjesh Parekh, Anil Kumar Tiwari, Divya Saxena

机构 * School of Artificial Intelligence and Data Science, Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校人工智能与数据科学学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM多步骤金融计算易出错的问题,提出CIFQA多智能体框架,在定期存款查询基准上准确率达95.54%,且17B开源模型在该框架内表现优于更大前沿模型,证明架构设计对数值可靠性更关键。

Comments 16 pages, 5 figures, submitted for academic dissemination

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26036 2026-08-27 cs.AI cs.CL 新提交 90%

Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems

LLM数据智能体的追踪完整性:现实世界系统中可审计结构化推理的愿景

Srimonti Dutta, Akshata Kishore Moharir

机构 * WAI USA Research Labs(WAI美国研究实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文针对LLM数据智能体提出追踪完整性标准,结合执行契约实现,通过CAIT率实验表明需同时评估答案准确率与可审计计算,为现实系统的LLM数据智能体提供评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23622 2026-08-26 cs.AI cs.CL cs.MA cs.SE 新提交 90%

LLM Agents Perform Controlled Experiments Using Simulation Models

大语言模型智能体使用模拟模型开展对照实验

Yuchen Xia, Michael Weyrich, Nasser Jazdi, Johannes Stümpfle, Johannes Sigel, Akshay Narla, Gavin K. Reynolds, Anna Jawor-Baczynska, Pol Llopart

机构 * Institute for Industrial Automation and Software Engineering(工业自动化与软件工程研究所) University of Stuttgart(斯图加特大学) AstraZeneca(阿斯利康)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出多智能体框架,将LLM与高保真模拟模型结合,使LLM智能体可开展制药工艺设计的对照实验,生成更具体可操作的优化建议,在工业场景中表现更优。

Comments Accepted at the 31st IEEE International Conference on Emerging Technologies and Factory Automation ETFA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23047 2026-08-25 cs.CL cs.AI 新提交 90%

Beyond Verdicts: A Graph-Based Analysis of Human and LLM Reasoning in Scientific Fact-Checking

超越裁决:科学事实核查中人类与大语言模型推理的基于图的分析

Abdul Ghafoor, Muhammad Arslan Manzoor, Yufang Hou

机构 * Interdisciplinary Transformation University Austria (ITU)(奥地利跨学科转型大学(ITU))

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出类型化推理图框架,用于对比科学事实核查中人类与LLM的推理路径,基于MISSCIPLUS数据集评估GPT-5等模型,发现各模型在裁决性能与人类对齐度上存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22839 2026-08-25 cs.LG cs.AI 新提交 90%

Hierarchy-Aware Supervised Uncertainty Estimation for Black-box LLM Taxonomic Reasoning

面向黑盒大语言模型分类推理的层级感知监督式不确定性估计

Shuting Xie, Nathaniel Lesperance, Graham W. Taylor

机构 * Vector Institute for AI(向量人工智能研究所) University of Guelph(圭尔夫大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对黑盒LLM在生物多样性监测分类推理中置信度估计难的问题,提出层级感知监督估计器,提升了微AUROC,验证了层级结构对弃权规则的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21871 2026-08-25 cs.CL cs.LG 新提交 90%

The Chase Is the Curriculum, the Capture Anchors the Credit: Pursuit-Evasion Self-Play for Zero-Data LLM Reasoning

追逐即课程,捕获锚定信用:用于零数据大语言模型推理的追逃自博弈

Jing Yu, Shengchao Chen, Yiyun Tan

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出LURE框架,将零数据自博弈转化为追逃博弈,通过捕获锚定信用机制,在三类推理环境和主干模型上,实现优于先进基线的零数据LLM推理性能。

Comments 9 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18795 2026-08-20 cs.CL cs.AI 新提交 90%

Decomposing Wrong-Consensus Agreement in LLM Self-Consistency: A GPT-4.1 Case Study

分解LLM自一致性中的错误共识一致性:GPT-4.1案例研究

Lizhuo Zhang, Mengmeng Tang, Chenfeng Long, Xiaoyong Tang, Xiang Luo

机构 * College of Information and Intelligence, Hunan Agricultural University(湖南农业大学信息与智能科学学院) Yuelushan Laboratory(岳麓山实验室)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究以GPT-4.1为案例,将LLM自一致性的错误共识一致性分解为机械成分与偏好残差,发现难题上存在自一致性反效果,一致性为分级证据,未提出新投票方法。

Comments 18 pages, 2 figures, 9 tables; quantitative kappa-decomposition of agreement saturation in self-consistency;

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17644 2026-08-19 cs.AI cs.CL 新提交 90%

LLM-Derived Preference Judgments Are Not Self-Consistent

大语言模型(LLM)得出的偏好判断不具备自一致性

Matthew T. Ford, Francis Bahk, Jingjing Wang, Adam S. Jovine, Tinghan Ye, David B. Shmoys, Peter I. Frazier

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究发现,用于解读人类偏好的LLM得出的数值化偏好判断存在大量持续不一致性,无法由单一效用函数概括,打破了相关研究的自一致性假设。

Comments 16 pages, 4 figures; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13315 2026-08-14 cs.GT cs.AI cs.LG cs.SY eess.SY 新提交 90%

Keep, Customize, or Exit: Default Design and Token Pricing in LLM Reasoning Services

保留、定制还是退出:大语言模型推理服务中的默认设计与代币定价

Ahmet Bugra Gundogan, Yigit Turkmen, Melih Bastopcu

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LLM推理服务的供需交互建立Stackelberg博弈模型,推导最优解,明确默认设置的影响条件,实验验证模型并展示均衡相关因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09128 2026-08-11 cs.CL cs.AI cs.MA 新提交 90%

Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments

Social Gym与SPaRTan:通过多智能体游戏锦标赛对LLM社会推理进行基准测试与改进

Keyu He, Xuhui Zhou, Maarten Sap

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 该研究推出Social Gym多智能体社会游戏环境与SPaRTan自博弈反思迁移方法,前者可客观基准测试LLM社会推理,后者可提升GPT-5-mini的弱角色表现,为改进LLM社会推理提供了可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18767 2026-07-22 cs.CV cs.AI cs.CL 新提交 90%

Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks

使用边界框提高小语言模型在基于视觉的评分任务中的性能

Lachlan McGinness

机构 * Australian National University(澳大利亚国立大学)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究在基于视觉的简答题评分任务中,用边界框裁剪学生答案对小语言模型性能的影响,通过实验表明此方法能显著提高评分准确性并降低计算成本,是大规模视觉教育评估中部署小语言模型的关键预处理步骤。

Comments Accepted for 1st Workshop on Small Language Models for Education (SLM4ED '26) at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09600 2026-07-13 cs.AI cs.CL 新提交 90%

Agora: Enhancing LLM Agent Reasoning Via Auction-Based Task Allocation

Agora:通过基于拍卖的任务分配增强大语言模型智能体推理

Kaiji Zhou, Ales Leonardis, Yue Feng

机构 * University of Birmingham(伯明翰大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在增强LLM智能体推理能力,提出Agora框架,通过基于拍卖的机制动态分配任务,将推理步骤视为可交易项目让智能体依纠正能力投标,实验表明该框架在多基准测试中表现优且能实现成本-质量权衡。

Comments Preprint. 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07989 2026-07-10 cs.CR cs.AI cs.IR cs.LG cs.MA 新提交 90%

Who Broke the System? Failure Localization in LLM-Based Multi-Agent Systems

谁破坏了系统?基于大语言模型的多智能体系统中的故障定位

Yufei Xia, Anjun Gao, Yueyang Quan, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) University of North Texas(得克萨斯大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究基于大语言模型的多智能体系统故障定位问题,提出AgentLocate框架,结合基于LLM的判断与多视角验证,通过置信感知策略聚合评估结果并微调判断,实验表明该框架在识别责任智能体和故障步骤上优于现有方法且高效。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26103 2026-06-26 cs.CL cs.AI 新提交 90%

Investigating LLM's Problem Solving Capability -- a Study on Statics Questions

探究大语言模型的问题解决能力——基于静力学问题的研究

Tanner Culleton, Hung-Fu Chang

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过模型蒸馏方法评估LLM在静力学问题上的表现,发现引入图表和多步推理时准确率下降,主要源于多步推理和视觉信息应用困难。

Comments 9 pages, Engineering and Technology Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22388 2026-06-23 cs.AI cs.CL 新提交 90%

PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems

PlanBench-XL:评估大规模工具生态系统中LLM工具使用智能体的长时程规划能力

Jiayu Liu, Qihan Lin, Cheng Qian, Rui Wang, Emre Can Acikgoz, Xiaocheng Yang, Jiateng Liu, Zhenhailong Wang, Xiusi Chen, Heng Ji, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出PlanBench-XL基准,包含327个零售任务和1665个工具,测试LLM智能体在检索受限工具环境下的长时程规划能力,实验表明GPT-5.4在无阻塞下准确率51.90%,严重阻塞下降至11.36%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20897 2026-06-23 cs.CL cs.AI 新提交 90%

PeerCheck: Enhancing LLM-Generated Academic Reviews Towards Human-Level Quality

PeerCheck: 提升大语言模型生成的学术评审至人类水平质量

Zeyuan Chen, Ziqing Yang, Yihan Ma, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PeerCheck框架,分析LLM与人类评审差异,采用思维链和检索增强生成提升评审质量,发现思维链显著改善但RAG存在悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16811 2026-06-16 cs.AI cs.CL 新提交 90%

Scaling LLM Reasoning from Minimal Labels: A Semi-Supervised Framework with a Lightweight Verifier

从最小标签扩展LLM推理:一种带有轻量级验证器的半监督框架

Keizo Kato, Chenhui Chu, Yugo Murawaki, Sado Kurohashi

机构 * Fujitsu Limited(富士通株式会社) Kyoto University(京都大学) National Institute of Informatics(国立信息学研究所)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出半监督框架,用轻量级推理正确性分类器和熵过滤从少量标注数据生成高质量伪推理链,在数学和视觉问答任务上达到10-15倍标注数据效果。

Comments LREC 2026. Section 3.3 is updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10796 2026-06-10 cs.CL cs.AI 新提交 90%

Dep-LLM: Training-Free Depression Diagnosis via Evidence-Guided Structured Multi-factor with Reliable LLM Reasoning

Dep-LLM:基于证据引导的结构化多因素与可靠LLM推理的无训练抑郁症诊断

Yiqing Lyu, Xianbing Zhao, Buzhou Tang, Ronghuan Jiang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, Guangdong, China(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi, China(江南大学人工智能与计算机学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Pengcheng Laboratory(鹏城实验室) Chinese People’s Liberation Army General Hospital, Beijing, China(中国人民解放军总医院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出无训练框架Dep-LLM,通过思维链多因素分析、置信度调制和协作预测,在冻结LLM上实现抑郁症诊断,超越零样本和微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25992 2026-08-27 cs.AI cs.MA 新提交 90%

ProgRouter: Online Progress-Guided Orchestration for Multi-Agent LLM Workflows under Quality-Cost Tradeoffs

ProgRouter:面向质量-成本权衡的多智能体大语言模型工作流的在线进度引导编排

Songyuan Li, Ahmed M. Abdelmoniem, Shiqiang Wang

机构 * Aston University(阿斯顿大学) Queen Mary University of London(伦敦玛丽女王大学) University of Exeter(埃克塞特大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ProgRouter是一种在线进度引导路由框架,通过多视图任务进度评分器等机制,在多智能体LLM工作流中平衡任务质量与时间、成本预算,在多类任务数据集上较基线降低运营成本且保持性能。

Comments Accepted in Findings of the Association for Computational Linguistics: EMNLP 2026. Index Terms: Collaborative agentic workflows, LLM agent orchestration, Quality-cost trade-off, Task progress prediction, Online decision-making

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23611 2026-08-26 cs.SE cs.AI 新提交 90%

REFINE: A Multi-Agent LLM Approach for Evidence-Guided Code Refactoring

REFINE:一种用于证据引导代码重构的多智能体大语言模型方法

Muhammad Waseem, Aakash Ahmad, Pekka Abrahamsson

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出多智能体方法REFINE,结合静态分析、LLM等技术生成Java代码重构候选,在450个文件上使异味降低超68%,效果优于直接提示基线,但存在残留风险需人工审查。

Comments Preprint. 450 Java files from 15 open-source systems; 1,350 model-pass outputs across three LLM configurations. The accompanying replication package will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏