arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3046 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3046 篇

2411.19504 2026-06-09 cs.AI cs.CL cs.IR 版本更新 62%

TQA-Bench: Evaluating LLMs for Multi-Table Question Answering

TQA-Bench:评估大语言模型在多表问答中的表现

Zipeng Qiu, Chenyue Li, You Peng, Guangxin He, Binhang Yuan, Chen Wang

机构 * Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出TQA-Bench基准,通过长上下文多表问答任务评估LLM,揭示其在复杂数据驱动环境中的挑战与机遇。

Comments Accepted by IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06823 2026-06-08 cs.LG cs.AI q-fin.ST 新提交 62%

PandaAI: A Practical Agent CQ2 for Neuro-symbolic Data Analysis And Integrated Decision-Making in Quantitative Finance

PandaAI: 一种用于量化金融中神经符号数据分析与集成决策的实用智能体CQ2

Yuqi Li, Siyuan Liu, Bingjun Liu

机构 * Panda AI

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对金融数据低信噪比和非平稳性,提出PandaAI,一种结合市场状态建模与约束alpha生成的闭环神经符号LLM智能体,通过领域微调和模块化架构实现风险感知决策,在沪深300数据上Rank IC提升18.2%,最大回撤降低25.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04816 2026-06-04 cs.AI cs.LG 62%

Beyond Objective Equivalence: Constraint Injection for LLM-Based Optimization Modeling on Vehicle Routing Problems

超越目标等价性:基于LLM的车辆路径问题优化建模的约束注入

Xizi Luo, Changhong He, Dongdong Geng, Chenggong Shi, Yu Mei

机构 * Beihang University(北京航空航天大学) Baidu Inc.(百度公司)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM在约束密集的运筹问题中可能添加虚假约束或遗漏必要约束的问题,提出约束注入方法,结合差分测试形成双重验证器,并在车辆路径问题上验证其有效性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03542 2026-06-04 cs.CL cs.LG 62%

Can Large Language Models Generalize Procedures Across Representations?

大型语言模型能否跨表示泛化过程?

Fangru Lin, Valentin Hofmann, Xingchen Wan, Weixing Wang, Zifeng Ding, Anthony G. Cohn, Janet B. Pierrehumbert

机构 * Stanford University(斯坦福大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 研究大型语言模型在代码、图与自然语言等不同表示间泛化过程的能力,提出两阶段强化学习课程来弥合差距。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.10532 2026-06-04 eess.SY cs.AI cs.LG cs.SY 62%

Interpretable Apprenticeship Learning with Temporal Logic Specifications

具有时序逻辑规范的可解释模仿学习

Daniel Kasenberg, Matthias Scheutz

专题命中 逻辑推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过多目标优化从MDP中的行为轨迹推断LTL规范,采用违反成本概念设计状态和动作基于的目标函数,并通过遗传算法在简单领域验证方法有效性。

Comments Accepted to the 56th IEEE Conference on Decision and Control (CDC 2017)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03811 2026-06-03 cs.CR cs.AI cs.LG 62%

AI Agents Enable Adaptive Computer Worms

AI代理实现自适应计算机蠕虫

Jonas Guan, Tom Blanchard, Hanna Foerster, Hengrui Jia, Gabriel Huang, Nicolas Papernot

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Cambridge(剑桥大学) ServiceNow

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究展示了AI代理能够生成针对每个目标的定制攻击策略,利用被感染机器上的大语言模型自我维持并传播,形成自持的AI驱动网络威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09711 2026-06-03 cs.CL cs.AI 62%

ReaLM: Residual Quantization Bridging Knowledge Graph Embeddings and Large Language Models

ReaLM:残差量化桥接知识图谱嵌入与大型语言模型

Wenbin Guo, Xin Wang, Jiaoyan Chen, Lingbing Guo, Zhao Li, Zirui Chen

机构 * Tianjin University(天津大学) The University of Manchester(曼彻斯特大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出ReaLM框架,通过残差向量量化将知识图谱嵌入离散化为可学习标记,融入大型语言模型词汇表,结合本体约束实现结构化知识与语言模型的语义对齐,在知识图谱补全任务上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00415 2026-06-02 cs.AI cs.LG 62%

PolarMem: A Training-Free Polarized Latent Graph Memory for Verifiable Vision-Language Models

PolarMem: 一种无需训练的可验证视觉语言模型极化隐式图记忆

Zhisheng Chen, Tingyu Wu, Zijie Zhou, Zhengwei Xie, Jinhan Li, Ziyan Weng, Liang Lin, Jingwei Song, Zikai Xiao, Yingwei Zhang

机构 * ICT, CAS(中国科学院信息科技研究院) UCAS(中国科学院大学) CUPB(中国政法大学) USTC(中国科学技术大学) CityU-DG(城市大学-数据科学) HKU(香港大学) ZJU(浙江大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PolarMem,一种无需训练的极化隐式图记忆框架,通过语义一致性验证和自适应分布划分将视觉语言模型感知信号转化为HAS、NOT_HAS和Uncertain记忆状态,并采用词典逻辑感知检索协议优先保证逻辑一致性,从而提升检索密集型任务性能并减少矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23379 2026-06-02 cs.LG cs.AI cs.NE q-bio.BM 62%

Symbolic Neural Generation with Applications to Lead Discovery in Drug Design

符号神经生成及其在药物设计先导发现中的应用

Ashwin Srinivasan, Tirtharaj Dash, A Baskar, Michael Bain, Sanjay Kumar Dey, Mainak Banerjee

机构 * Dept. of Computer Science & Information Systems and APPCAIR BITS Pilani, K K Birla Goa Campus, India(计算机科学与信息系统系及APPCAIR比特纳学院,K K Birl拉果阿校区,印度) Dept. of Computer Science & Information Systems BITS Pilani, K K Birla Goa Campus, India(计算机科学与信息系统系比特纳学院,K K Birl拉果阿校区,印度) Department of Biochemistry, University of Cambridge, Cambridge, UK(生物化学系,剑桥大学,剑桥,英国) School of Computer Science and Engineering University of New South Wales, Sydney(计算机科学与工程学院新南威尔士大学,悉尼) Dr. B.R. Ambedkar Center for Biomedical Research University of Delhi, New Delhi, India(B.R.阿姆贝卡尔生物医学研究中心,德里大学,新德里,印度) Department of Chemistry BITS Pilani, K.K. Birla Goa Campus, India(化学系比特纳学院,K.K. Birl拉果阿校区,印度)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出符号神经生成器(SNG)框架,结合归纳逻辑编程与大语言模型,通过符号约束指导神经生成,在药物设计中生成满足形式规范的候选分子,性能与现有方法相当,并在探索性问题上产生与临床候选分子相当的结合亲和力。

Comments 37 pages, submitted to the Machine Learning journal; partial overlap of experimental results with https://doi.org/10.1101/2025.02.14.634875

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04424 2026-06-02 cs.AI cs.CL 62%

NSA: Neuro-symbolic ARC Challenge

NSA: 神经符号 ARC 挑战

Paweł Batorski, Jannik Brinkmann, Paul Swoboda

机构 * Heinrich Heine Universität Düsseldorf(杜伊斯堡-艾森大学) University of Mannheim(曼海姆大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出一种结合 transformer 提案生成与领域特定语言组合搜索的神经符号方法,在 ARC 评估集上超越现有最优方法 27%。

Journal ref ESANN 2026 proceedings, European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning, pp. 99-104, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31558 2026-06-01 cs.LG cs.AI 62%

Positional versus Symbolic Attention Heads: Learning Dynamics, RoPE Geometry, and Length Generalization

位置注意力头与符号注意力头:学习动态、RoPE几何和长度泛化

Felipe Urrutia, Juan José Alegría, Cinthia Sanchez Macias, Jorge Salas, Cristian B. Calderon, Cristobal Rojas

机构 * CENIA & Faculty of Mathematics UC Santiago(CENIA与圣托里尼大学数学系) IMC UC & CENIA Santiago(UC IMC与圣托里尼CENIA)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过控制实验研究Transformer注意力头在位置推理和符号推理任务中的学习动态,发现位置和符号注意力头的不同机制及其对长度泛化的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14113 2026-05-29 cs.CV cs.AI cs.LG cs.MA 62%

ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows

ProtoMedAgent: 通过隐私感知的智能体工作流实现多模态临床可解释性

Alvaro Lopez Pellicer, Plamen Angelov, Marwan Bukhari, Yi Li, Eduardo Soares, Jemma Kerns

机构 * School of Computing and Communications(计算与通信学校) Lancaster University(兰卡斯特大学) Lancaster Medical School(兰卡斯特医学院) PUC-Rio(里约热内卢联邦大学) Puc-Behring Institute for AI(人工智能皮克林研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出ProtoMedAgent框架,通过神经符号瓶颈和反射性Scribe-Critic循环约束生成过程,解决原型网络在临床报告中的语义结构缺失和检索谄媚问题,并引入k-匿名和ℓ-多样性隐私门控。

Comments CVR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29168 2026-05-29 cs.AI cs.LG 62%

Better Later Than Sooner: Neuro-Symbolic Knowledge Graph Construction via Ontology-grounded Post-extraction Correction

晚做总比早做好:基于本体后提取校正的神经符号知识图谱构建

Lorenzo Loconte, Timothy Hospedales, Cristina Cornelio

机构 * University of Edinburgh, UK(爱丁堡大学) Samsung AI Center, Cambridge, UK(三星人工智能中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出一种神经符号框架,通过后提取校正解决LLM提取知识图谱时的本体不一致问题,减少token使用并提升图谱一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04916 2026-05-29 cs.AI cs.LG cs.SC 62%

A Foundation Model for Zero-Shot Logical Rule Induction

零样本逻辑规则归纳的基础模型

Yin Jun Phua

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出神经规则归纳器(NRI),一种基于统计编码和并行槽解码的预训练模型,实现零样本逻辑规则归纳,无需重新训练即可泛化到新谓词。

Comments Camera-ready version accepted at IJCAI 2026, with full appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-05-27 cs.CL cs.AI cs.MA 62%

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20586 2026-05-27 cs.AI cs.LG 62%

PaTAS: A Framework for Trust Propagation in Neural Networks Using Subjective Logic

PaTAS:基于主观逻辑的神经网络信任传播框架

Koffi Ismael Ouattara, Ioannis Krontiris, Theo Dimitrakos, Dennis Eisermann, Houda Labiod, Frank Kargl

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PaTAS框架,利用主观逻辑在神经网络中并行传播信任,通过信任节点和信任函数量化输入、参数和激活的信任,并设计参数信任更新和推理路径信任评估方法,以在对抗或退化条件下提供可解释的信任估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01284 2026-05-26 cs.CV cs.AI cs.CL cs.IR 62%

Chain of Evidence: Pixel-Level Visual Attribution for Iterative Retrieval-Augmented Generation

证据链:面向迭代检索增强生成的像素级视觉归因

Peiyang Liu, Ziqiang Cui, Xi Wang, Di Liang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家级工程研究中心,北京大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) Tencent Technology(腾讯科技)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出Chain of Evidence (CoE)框架,利用视觉语言模型直接对检索到的文档截图进行推理,输出精确边界框以可视化完整推理链,解决迭代检索增强生成中的粗粒度归因和视觉语义丢失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05450 2026-05-26 cs.AI cs.CL 62%

Distributed Partial Information Puzzles: Examining Common Ground Construction Under Epistemic Asymmetry

分布式部分信息谜题:在认知不对称下检验共同基础的构建

Yifan Zhu, Mariah Bradford, Kenneth Lai, Timothy Obiso, Videep Venkatesha, James Pustejovsky, Nikhil Krishnaswamy

机构 * Brandeis University(布兰迪斯大学) Colorado State University(科罗拉多州立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出分布式部分信息谜题(DPIP)任务,收集多模态数据集,并评估大语言模型与动态认知逻辑方法在追踪信念状态和共同基础构建上的表现。

Comments 10 pages, 4 figures

Journal ref Proceedings of COLING-LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22217 2026-05-22 cs.LG cs.CL 62%

Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL

生存或崩溃:自我博弈强化学习中数据门控与奖励基础的不对称作用

Sophia Xiao Pu, Zhaotian Weng, Chengzhi Liu, Jayanth Srinivasa, Gaowen Liu, William Yang Wang, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) Cisco Research(思科研究)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了自我博弈强化学习中数据门控和奖励基础的不对称作用,发现数据门控是维持稳定的关键因素,而奖励信号在门控移除后无法单独保证稳定性,揭示了'基础提出者悖论'。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19077 2026-05-20 cs.CL cs.AI 62%

ReacTOD: Bounded Neuro-Symbolic Agentic NLU for Zero-Shot Dialogue State Tracking

ReacTOD:用于零样本对话状态跟踪的受限神经符号代理NLU

Yanjun Lin, Zimo Xiao, Kartik Natarajan, Mahesh Sankaranarayanan, Niraj Nawanit, Rakshit Parashar, Austin Zhang, Karthik Konaraddi, Rishita Mote, Wei Niu

机构 * Amazon(亚马逊)

专题命中 逻辑推理 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出ReacTOD,一种受限神经符号架构,通过在自我纠正的ReAct循环中将NLU重新表述为离散工具调用来解决零样本对话状态跟踪问题,其核心方法是确定性验证,主要贡献是实现了新的零样本状态-of-the-art结果。

Comments Accepted at TrustNLP Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18847 2026-05-20 cs.LG cs.AI 62%

Transformers Linearly Represent Highly Structured World Models

Transformer 通过线性方式表示高度结构化的世界模型

Roman Kniazev, Nathanaël Fijalkow

机构 * LaBRI, CNRS University of Bordeaux(LaBRI、CNRS 波尔多大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了Transformer在训练过程中是否能构建任务的内部模型,并发现其内部表示结构与领域结构相匹配,通过Sudoku求解轨迹训练的Transformer展示了其内部计算机制和稀疏可解释的决策电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16207 2026-05-18 cs.AI cs.CL 62%

Confirming Correct, Missing the Rest: LLM Tutoring Agents Struggle Where Feedback Matters Most

确认正确,遗漏其余:LLM辅导代理在反馈最关键的地方表现不佳

Tahreem Yasir, Wenbo Li, Sam Gilson, Sutapa Dey Tithi, Xiaoyi Tian, Tiffany Barnes

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM在逻辑推理中的辅导性能,发现其在区分最优解、次优解和错误解方面存在系统性偏差,影响适应性教学效果。

Comments 22 pages, 20 fgures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16052 2026-05-18 cs.AI cs.CL 62%

Reasoners or Translators? Contamination-aware Evaluation and Neuro-Symbolic Robustness in Tax Law

理由者还是翻译者?面向污染的评估与税法中的神经符号鲁棒性

Parisa Kordjamshidi, Samer Aslan, Madhavan Seshadri, Leslie Barrett, Enrico Santus

机构 * Bloomberg(彭博社) Michigan State University(密歇根州立大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了税法推理中LLM性能受数据污染影响的问题,提出神经符号框架提升法律AI的可靠性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14053 2026-05-15 cs.CL cs.AI 62%

Derivation Prompting: A Logic-Based Method for Improving Retrieval-Augmented Generation

推导提示:一种基于逻辑的方法,用于提高检索增强生成

Ignacio Sastre, Guillermo Moncecchi, Aiala Rosá

机构 * Instituto de Computación, Facultad de Ingeniería, Universidad de la República(计算研究所,工程学院,乌拉圭共和国大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出推导提示方法,通过系统应用预定义规则从初始假设推导结论,以提高检索增强生成中生成过程的可控性和准确性。

Journal ref Advances in Artificial Intelligence IBERAMIA 2024, LNCS 15277, pp. 412 423, Springer (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12718 2026-05-14 cs.AI cs.LG cs.MA 62%

CHAL: Council of Hierarchical Agentic Language

CHAL:层次代理语言委员会

Tommaso Giovannelli, Griffin D. Kent

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CHAL框架通过将辩论视为信念优化过程,改进了LLM在可反驳领域中的推理能力,通过层次代理结构和可审计的信念记录,实现了更透明和可解释的多代理辩论系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01643 2026-05-12 cs.LG cs.AI 62%

AI Alignment via Incentives and Correction

通过激励与修正实现AI对齐

Rohit Agarwal, Joshua Lin, Mark Braverman, Elad Hazan

机构 * Princeton University(普林斯顿大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文从法律经济学威慑模型视角探讨AI对齐问题,提出通过激励机制和修正过程解决AI行为与对齐目标的平衡问题,构建双代理模型分析奖励设计对求解器和审计器行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14785 2026-05-12 cs.LG cs.AI 62%

Exploring the In-Context Learning Capabilities of LLMs for Money Laundering Detection in Financial Graphs

探索LLMs在金融图谱中反洗钱检测中的情境学习能力

Erfan Pirmorad

机构 * The Vanguard Group, Inc.(先锋集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了LLMs在金融图谱中进行反洗钱检测的能力,通过提取局部子图并利用少量样本进行情境学习,展示LLMs在识别可疑行为和生成解释方面的潜力。

Comments Accepted at AI4FCF-ICDM 2025

Journal ref 2025 IEEE International Conference on Data Mining Workshops (ICDMW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09580 2026-05-12 cs.AI cs.CL 62%

GraphMERT: Efficient and Scalable Distillation of Reliable Knowledge Graphs from Unstructured Data

GraphMERT:从非结构化数据中高效可扩展地蒸馏可靠知识图谱

Margarita Belova, Jiaxin Xiao, Shikhar Tuli, Niraj K. Jha

机构 * Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GraphMERT,一种高效的图神经网络模型,通过蒸馏高质量知识图谱提升领域知识的可靠性与有效性。

Comments Camera-ready version. Published in Transactions on Machine Learning Research (TMLR), 2026. Reviewed on OpenReview: https://openreview.net/forum?id=tnXSdDhvqc

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11537 2026-05-12 cs.LG cs.AI 62%

Simulus: Combining Improvements in Sample-Efficient World Model Agents

Simulus:结合高效样本世界模型代理的改进

Lior Cohen, Kaixin Wang, Bingyi Kang, Uri Gadot, Shie Mannor

机构 * Technion(技术ion大学) Microsoft Research(微软研究院) ByteDance Seed(字节跳动种子实验室)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Simulus,一种模块化的基于标记的世界模型代理,通过整合灵活的标记化框架、内在动机、优先世界模型回放和回归-分类方法,提升了样本效率,适用于多个基准测试。

Comments Revised version: updated title, abstract, and framing to better reflect our contributions and situate the work within the literature

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06110 2026-05-11 cs.AI cs.CL 62%

On Time, Within Budget: Constraint-Driven Online Resource Allocation for Agentic Workflows

按时、在预算内:面向代理工作流的约束驱动在线资源分配

Xinglin Wang, Zishen Liu, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院) Xiaohongshu Inc(小红书公司)

专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在预算和截止时间约束下,如何通过约束驱动的在线资源分配提高代理工作流的成功概率,提出MCPP算法并在CodeFlow和ProofFlow上验证其有效性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏