arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-28 至 2026-08-28 共收录 95 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2608.26166 2026-08-28 cs.HC cs.AI 新提交 88%

Improving LLM Interpretability with User-Centric Chain-of-Thought Reasoning

以用户为中心的思维链推理提升大语言模型可解释性

Philipp Schröppel

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

AI总结 本研究提出以人为本的LLM推理轨迹构建方法,采用类XML标签编码,在保持数学推理性能的同时提升可解释性,显著改善用户感知的有用性与易用性,助力高风险AI部署的人机协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27265 2026-08-28 cs.CL 新提交 87%

SCIT: Testing Causal Cache Carriers in Latent Chain-of-Thought Models

SCIT:测试潜在思维链模型中的因果缓存载体

Yi Ding, Lijun Huang, Menglin Yang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 数学推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 本研究提出SCIT因果协议,测试潜在思维链模型的缓存载体,发现反事实算术主要通过值缓存后缀轨迹传递,且载体机制随模型规模和类型存在差异。

Comments accept by emnlp2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26442 2026-08-28 cs.AI cs.CL 新提交 84%

Don't Overthink, Don't Underthink: Toward Adaptive Reasoning in Agentic AI

不要过度思考,不要思考不足:面向智能体人工智能的自适应推理

Md Jueal Mia, M. Hadi Amini

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对智能体AI中推理分配不当导致的过度/思考不足问题,在MATH-500和GAIA基准上验证相关失败模式,为自适应推理机制研究提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26950 2026-08-28 cs.AI cs.CL 新提交 73%

From Atomic to Agentic: Towards Interpretable Evaluation of LLMs' Agentic Mathematical Capabilities

从原子到智能体:迈向大语言模型智能体数学能力的可解释评估

Jiayi Kuang, Yinghui Li, Yunze Song, Keyu Chen, Zhifeng Shen, Yangning Li, Yidong Wang, Di Yin, Ruizhi Qiao, Xing Sun, Kai Jin, Ying Shen, Liang Lin, Philip S. Yu

机构 * Sun Yat-sen University(中山大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Pengcheng Laboratory(鹏城实验室)

专题命中 数学推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出过程级基准,对齐智能体行为与数学原子能力分类,评估LLMs智能体数学推理能力,发现相似端到端准确率的模型智能体能力轮廓差异显著,凸显过程级评估的重要性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27448 2026-08-28 cs.CL 新提交 57%

TTPO: Test-Time Policy Optimization

TTPO:测试时策略优化

Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun Xiao, Yueting Zhuang, Hua Yang, Qianglong Chen, Yongliang Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对大语言模型测试时训练的伪标签缺陷,提出 TTPO 方法,通过不对称目标函数与 token 级选择优化,在无标签下实现了与标签监督 OPSD 相当的性能,提升了模型数学推理能力并增强了跨任务泛化性。

Comments Project Page: this https URL (https://zju-real.github.io/TTPO) Code: this https URL (https://github.com/ZJU-REAL/TTPO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27420 2026-08-28 cs.CL 新提交 57%

Boosting LLM Exploration via Weak-Model Guidance in RLVR

通过RLVR中的弱模型引导增强大语言模型探索能力

Xingyu Shen, Huishuai Zhang, Peng Li, Yinchun Wang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) National Engineering Research Center of New Electronic Publishing Technologies(国家新型电子出版技术工程研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出弱模型引导的RLVR方法,通过弱模型的部分推理轨迹增强LLM探索,缓解熵崩溃,在数学基准上提升大k值下的推理性能与覆盖范围。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 7 篇

2608.26602 2026-08-28 cs.SE cs.CL 新提交 74%

The Thousand-Graph Hypothesis: A Testable Hypothesis of Task-Conditioned Relation Materialization in Repository-Level Code Reasoning

千图假说:仓库级代码推理中任务条件关系实例化的可检验假说

Fei Ding

专题命中 代码与定理证明 :reasoning(title);分类 cs.CL

AI总结 针对仓库级代码推理的上下文限制与关系图维护问题,该研究提出带任务条件关系实例化的仅实体外部接口,经DeepSeek-V4-Flash和SWE-bench Verified评估,双层索引方案在零预构建边时成功率达95.6%。

Comments 9 pages, 2 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26187 2026-08-28 cs.CL cs.AI cs.LG cs.LO 新提交 67%

When the Canonical Completion Is Wrong: Formalizing and Measuring the Jump in Large Language Models

当规范补全出错时:大型语言模型中跃迁的形式化与测量

Dai Shi, Xiaoyu Li, José Miguel Hernández-Lobato

机构 * University of Cambridge(剑桥大学) University of New South Wales(新南威尔士大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对大型语言模型的“跃迁”进行形式化定义与测量,发现模型在第二步会放弃默认补全完成跃迁,更高难度失败源于推理预算或约束问题,而非回归默认,为相关争论提供了新依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26176 2026-08-28 cs.AI cs.CL 新提交 62%

Knowledge Cards: Structured Knowledge for AI Systems

知识卡片:面向AI系统的结构化知识

Liliana Ferreira

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对现有AI文档制品未覆盖输入输出间知识层的问题,提出可捕获概念相关结构化知识的Knowledge Card,已在能源等领域构建原型并发布公共草案。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26310 2026-08-28 cs.AI 新提交 57%

FaithSieve: Fine-Grained Evaluation of Math Proofs with Faithful Formal Evidence

FaithSieve:基于忠实形式证据的数学证明细粒度评估

Ziyu Wang, Qiming Dai, Yishan Wu, Zaiwen Wen

机构 * Peking University(北京大学) School of Mathematical Sciences(数学科学学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出Lean辅助框架FaithSieve,通过分解数学证明为细粒度单元并结合忠实形式证据,在两个专家验证数据集上提升了首个错误定位的精确评估准确率。

Comments 32 pages, 3 figures; preprint with appendix and supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26291 2026-08-28 cs.AI q-bio.NC 新提交 57%

Assessing mentalization in humans and large language models

评估人类与大型语言模型的心智化能力

Aamir Sohail, Xintong Zhong, Arkady Konovalov, Patricia L. Lockwood, Lei Zhang

机构 * University of Birmingham(伯明翰大学) Virginia Tech(弗吉尼亚理工大学) University of Oxford(牛津大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本研究以两项经济博弈结合认知计算建模,对比测试DeepSeek等四款LLM智能体与人类参与者,发现不同LLM心智化能力有差异,GPT-5表现优于人类,证实认知计算建模可用于评估人机比较智能。

Comments 46 pages, 4 figures, 2 tables. Supplementary information available on request from the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26160 2026-08-28 cs.AI 新提交 57%

SAREF-based Ontology for Distributed AI Workflows across the Edge-Fog-Cloud Continuum

面向边-雾-云连续体的基于SAREF的分布式AI工作流本体

Viorica Rozina Chifu, Tudor Cioara, Vasile Ofrim, Liana Toderean, Ionut Anghel, Laura Daniele, Cornelis Bouter

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种符合SAREF的本体,扩展SAREF4SYST本体加入AI相关概念,经智能电网场景验证,可实现边-雾-云环境下分布式AI工作流的语义互操作,部署成功率90%-100%,平均编排决策时间低于80ms。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26108 2026-08-28 cs.SE 新提交 50%

Agentic AI Containment Architecture for Security Hardening

用于安全加固的智能体AI containment架构

Mohamed ElBendary

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 针对多智能体AI系统的安全风险,本文提出Agent Containment架构,通过六项约束实施「提议-验证-行动-验证」模型,可防御多种威胁,案例验证其能产生合规可审计结果。

Comments Accepted to IntelliSys'2026. To Appear in Springer series "Lecture Notes in Networks and Systems" in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 6 篇

2608.26836 2026-08-28 cs.AI cs.CL 新提交 91%

SymbolLKG: Towards Verifiable Logical Reasoning via Logical Knowledge Graph and Symbolic Solvers

SymbolLKG:基于逻辑知识图谱与符号求解器的可验证逻辑推理研究

Haizhao Fan, Yuchi Xiong, Jize Wang, Xinping Guan, Xinyi Le

机构 * Shanghai JiaoTong University(上海交通大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 该研究针对大型语言模型逻辑推理的缺陷,提出结合逻辑知识图谱与动态求解器路由的神经-符号架构,在基准任务上优于现有方法,实现了可验证的高准确率逻辑推理。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26329 2026-08-28 cs.CL 新提交 83%

Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification

神经符号PRM:通过结构化轨迹与符号验证增强科学推理

Yuxin Zi, Cong Xu, Suparna Bhattacharya, Martin Foltin, Amit Sheth

机构 * AI Institute of South Carolina(南卡罗来纳州人工智能研究所) HPE Labs(慧与实验室) Indian AI Research Organisation(印度人工智能研究组织)

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 该研究提出神经符号PRM框架,解耦推理为符号有效性与语义接地性,引入反事实符号扰动训练PRM,通过验证器优先搜索提升工具增强型LLM的科学推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26147 2026-08-28 cs.CL cs.CV 新提交 83%

CARE: Causally-Aligned Reasoning Exploration for Medical Large Language Models

CARE:面向医学大语言模型的因果对齐推理探索

Yucheng Zhou, Peng Luo, Qianning Wang, Chengzhong Xu, Jianbing Shen

机构 * University of Macau(澳门大学) Auckland University of Technology(奥克兰理工大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究针对医学大语言模型的推理缺陷,提出CARE框架,通过因果充分性与近端可学习性条件筛选训练经验,在医学基准上提升了推理一致性与训练稳定性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26107 2026-08-28 cs.AI 新提交 80%

EduRiskX: A Neuro-Symbolic Framework with F-Logic Reasoning for Early Academic Risk Prediction

EduRiskX:用于早期学业风险预测的神经符号框架,结合F-Logic推理

Yu Fu, Yongqi Kang, Yong Zhao, Rongfang Bie

机构 * Sichuan University(四川大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出结合F-Logic推理的神经符号框架EduRiskX,在OULAD数据集上实现了更高的早期学业风险预测性能,且可提供可解释的规则依据。

Comments Previously available on Research Square: this https URL (https://doi.org/10.21203/rs.3.rs-8877832/v1). This version presents the complete neuro-symbolic framework, EduRiskX, integrating temporal Transformers with F-Logic reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26114 2026-08-28 cs.AI cs.CL q-fin.CP 新提交 73%

CIFQA: A Deterministic Tool-Grounded Multi-Agent LLM Framework for Financial Query Answering

CIFQA:一种用于金融查询问答的确定性工具基多智能体大语言模型框架

Kunjesh Parekh, Anil Kumar Tiwari, Divya Saxena

机构 * School of Artificial Intelligence and Data Science, Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校人工智能与数据科学学院)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM多步骤金融计算易出错的问题,提出CIFQA多智能体框架,在定期存款查询基准上准确率达95.54%,且17B开源模型在该框架内表现优于更大前沿模型,证明架构设计对数值可靠性更关键。

Comments 16 pages, 5 figures, submitted for academic dissemination

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26197 2026-08-28 cs.SE 新提交 50%

Harness Engineering for Predictable Agentic Systems: An Empirical Study of Deterministic Execution Constraints

利用工程实现可预测的智能体系统:确定性执行约束的实证研究

Saransh Dhage

专题命中 逻辑推理 :planning(abstract)

AI总结 本研究通过实证探究harness工程中确定性执行约束对LLM智能体的影响,发现添加结构化规划可提升可复现性与任务成功率,但延迟存在模型依赖的成本差异。

Comments 9 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 16 篇

2608.27046 2026-08-28 cs.LG cs.AI cs.DC cs.PF 新提交 88%

Performance Foundations of Parallel & Distributed Reasoning Language Models

并行与分布式推理语言模型的性能基础

Maciej Besta, Leonard Schmidt, Lara Nonino, Robert Gerstenberger, Pierre Pang, Patrik Okanovic, Ales Kubicek, Tiancheng Chen, Baraq Lipshitz, Torsten Hoefler

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);self-correction(abstract)

AI总结 该研究针对RL-for-LLM范式,分析主流后训练算法框架,构建RLM并行策略分类体系,提炼实用指南并概述开放方向,以推动开发高性能可扩展的高性价比RLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26807 2026-08-28 cs.CL cs.AI 新提交 81%

Behavior2Trip: Towards Personalized Travel Planning via User Behavior Trajectory

Behavior2Trip:基于用户行为轨迹的个性化旅行规划

Zihao Cheng, Yingyu Shan, Hongru Wang, Zeming Liu, Xinyi Wang, Xiangrong Zhu, Yuhang Guo, Wei Lin, Yunhong Wang

机构 * Meituan Inc.(美团公司) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Beijing Institute of Technology(北京理工大学) University of Edinburgh(爱丁堡大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出行为感知旅行规划新任务,构建Behavior2Trip基准,提出B2T-Agent智能体,实验显示其在旅行规划任务上表现优于基线,凸显任务挑战性与模型泛化性。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27225 2026-08-28 cs.RO cs.AI 新提交 79%

STEP: State-Aware Task Estimation and Planning with Multi-Modal LLMs for Human-Robot Collaboration

STEP:基于多模态大语言模型的状态感知任务估计与规划,用于人机协作

Maitrey Gramopadhye, Prakash Baskaran, Xiao Liu, Songpo Li, Soshi Iba

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Honda Research Institute(本田研究所)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型用于人机协作任务规划时的状态理解缺失问题,提出STEP方法,在机器人装配模拟任务中使动作可执行性提升32.8%、最终状态误差降低14.8%。

Comments Published in IEEE International Conference on Robot and Human Interactive Communication (RO-MAN), 2026, 8 pages, 4 figuers, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26788 2026-08-28 cs.AI cs.CL cs.MA cs.RO 新提交 76%

Decoupling Planning and Control for Instructable Agents

可指令智能体的规划与控制解耦

Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

机构 * UC Berkeley(加州大学伯克利分校) UBC(不列颠哥伦比亚大学) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :planning(title);分类 cs.CL、cs.AI

AI总结 本研究提出Instruct-to-Act系统,将VLM规划器与世界模型控制器解耦,在七个具身环境中验证其性能优于仅控制器、直接VLM动作生成等基线,可替换VLM规划器且保持快速控制。

Comments Published as a conference paper at COLM 2026. Project page: this https URL (https://zinengtang.github.io/instruct-to-act/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26747 2026-08-28 cs.AI 新提交 70%

AgentFold: Closed-Loop Agentic Search for Protein Folding Model Design

AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索

Mingquan Liu, Jiangyu Chen, Hanqun Cao, Xujun Zhang, Pengsen Ma, Xiangru Tang, Shuting Jin, Zhuo Yang, Tianfan Fu, Fang Wu, Xiangxiang Zeng

机构 * Hunan University(湖南大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Wuhan University of Science and Technology(武汉科技大学) Southeast University(东南大学) Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 AgentFold是将蛋白质折叠模型开发转化为闭环搜索的多智能体框架,以ESMFold为起点,通过MCTS策略分配计算资源,在匹配预算下较Codex提案提升lDDT 7.5%,优于随机搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26706 2026-08-28 cs.CL 新提交 70%

Towards Expert Financial QA via Self-Improving RAG

面向专家级金融问答的自改进检索增强生成(RAG)

Junjie Xiong, Shawheen Ghezavat, Aum Hirpara

机构 * University of California, Berkeley(加州大学伯克利分校) California Polytechnic State University(加州州立理工大学) Hofstra University(霍夫斯特拉大学)

专题命中 规划推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 该研究针对专家级金融问答的合规与防幻觉需求,提出自改进RAG框架,通过三个专门智能体及反馈自校正实现,在FinanceBench数据集上获86%神谕引导准确率,为金融监管应用提供可解释方案。

Comments 17 pages, 2 figures. Accepted at the ICLR 2026 Workshop on Advances in Financial AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27266 2026-08-28 cs.AI cs.CL 新提交 62%

Naive Prompt Optimization: Rethinking the Need for Complex Prompt Search

朴素提示优化:重新思考复杂提示搜索的必要性

Yuan Chang, Xiaoqi Chen

机构 * Purdue University(普渡大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出轻量级朴素提示优化(NPO),发现其性能优于复杂优化器GEPA,且优化后的提示可迁移至同系列其他模型,表明简单线性提示优化可媲美复杂搜索方法。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26141 2026-08-28 cs.CL cs.LG 新提交 62%

AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking

AdaThinking-E:用于自适应思考的单token熵调控

Zining Wang, Tongkun Guan, Boming Chen, Zhentao Guo, Jianqiang Liu, Chao Jin, Chen Duan, Kai Zhou, Pengfei Yan, Wei Shen, Xiaokang Yang

机构 * Meituan(美团) MoE Key Lab of Artificial Intelligence(MoE人工智能重点实验室) AI Institute(人工智能研究院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) MAIS&NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出AdaThinking-E强化学习框架,通过单token熵调控实现自适应思考,使模型在不同复杂度文档任务中兼顾准确率与效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26991 2026-08-28 cs.AI 新提交 57%

ASIL: Replacing Screenshot-and-Click with Structured State and Semantic Actions

ASIL:用结构化状态与语义动作替代截图点击

Rui Xie, Lu Chen

机构 * Shanghai Jiao Tong University(上海交通大学) BIGAI(北京智源人工智能研究院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出ASIL智能体-软件交互层,以结构化状态与语义动作替代低效的截图点击界面,在多应用基准任务中表现优于截图点击,还可提升Qwen系列模型的性能。

Comments Accepted to Findings of EMNLP 2026. 19 pages, 7 figures: 9-page main paper followed by limitations, ethics, acknowledgments, references, and appendices A-E. Project page: this https URL (https://sharryxr.github.io/ASIL/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26990 2026-08-28 cs.AI cs.MA 新提交 57%

DSA: Evidence-Aware LLM-Agent Orchestration for Multi-Market Stock Research

DSA:面向多市场股票研究的证据感知大语言模型智能体编排框架

Linsen Zhu, Yi Shi

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出DSA框架,基于LLM智能体实现多市场股票研究的证据感知编排,通过工作流组织、配置文件差异化处理及测试验证,确保系统实现一致性。

Comments 6 pages, 2 figures, 3 tables. Code available at this https URL (https://github.com/ZhuLinsen/daily_stock_analysis)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26332 2026-08-28 cs.LG 新提交 57%

Beyond Capability Benchmarks: Learning Operational Fingerprints of LLM Cloud Services from Production Incident Metadata

超越能力基准:从生产事件元数据学习LLM云服务的操作指纹

Meiwei Zhang, Eduardo Miranda, Bruce Baynes, Suvigya Jain, Wanlong Chen, Tao He, Sergey Borodavkin

机构 * Google Cloud Platform, Google LLC(谷歌云平台,谷歌有限责任公司)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 该研究提出OpEmbed框架,利用生产支持案例元数据学习LLM云服务的操作指纹,在Google Cloud的大规模生产案例评估中表现优异,可用于模型上线、支持评估等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏