arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 5118 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5118 篇

2606.06566 2026-06-08 cs.SE cs.AI 新提交 62%

NTILC: Neural Tool Invocation via Learned Compression

NTILC: 通过学习的压缩实现神经工具调用

Andrew Krikorian, Yayuan Li, Jason J. Corso

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学) Department of ECE, University of Michigan(电子工程与计算机科学系,密歇根大学)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出NTILC框架,用学习的潜在检索替代上下文工具查找,将工具选择与参数生成解耦,通过签名感知复合损失函数提升选择精度,相比基线减少95%上下文消耗和74%延迟。

Comments 10 Pages, 4 Figures, 5 Tables, 1 Algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05186 2026-06-05 cs.LG cs.CL 62%

Staged Factorial Screening for Budget-Constrained Micro-Pretraining

预算受限的微预训练中的分阶段因子筛选

Felipe Chavarro Polania

机构 * Hewlett Packard Enterprise(惠普企业)

专题命中 工具调用 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 针对预算受限的微预训练,提出分阶段分数因子设计方法,通过短时筛选识别高惩罚方向并确认有效锚点,在共享加速器上实现高效配方筛选。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04823 2026-06-04 cs.AI cs.CL cs.MA 62%

R-APS: Compositional Reasoning and In-Context Meta-Learning for Constrained Design via Reflective Adversarial Pareto Search

R-APS:基于反思性对抗帕累托搜索的组合推理与上下文元学习用于约束设计

João Pedro Gandarela, Thiago Rios, Stefan Menzel, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Honda Research Institute Europe(本田欧洲研究机构) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标志物中心)

专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出R-APS方法,通过推理模式分解、分阶段组合推理、敏感性引导对抗测试和元归纳规则提取,联合解决LLM在代理设置中的错误传播、最坏情况扰动和知识失效问题,在平面机构合成任务上实现更紧的鲁棒性证书和更快的迭代速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01708 2026-06-02 cs.LG cs.AI 62%

Two-Fidelity Best-Action Identification for Stochastic Minimax Tree

随机极小极大树的双保真度最优动作识别

Peter Chen, Xi Chen

机构 * Department of Mathematics, Columbia University(哥伦比亚大学数学系) Stern School of Business, New York University(纽约大学斯特恩商学院)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 针对随机极小极大树中的固定置信度最优动作识别问题,提出双保真度树搜索算法2FFS,结合极小极大快速扩展与MCTS随机采样,自适应选择廉价有偏评估或昂贵精确评估,理论证明固定置信度正确性、有限停止及多项式深度成本上界,实验表明比现有BAI-MCTS基线显著减少样本和计算。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24248 2026-06-02 cs.CR cs.AI cs.SE 62%

Attested Tool-Server Admission: A Security Extension to the Model Context Protocol

认证工具服务器准入:模型上下文协议的安全扩展

Alfredo Metere

机构 * Enclawed LLC(Enclawed公司)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 针对MCP协议缺乏信任机制的问题,提出mcp-attested扩展,通过离线签名的权限断言、默认拒绝的工具白名单和分级强制审计日志,实现安全服务器准入与工具边界控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03789 2026-06-02 cs.LG cs.AI 62%

Automated Conjecture Resolution with Formal Verification

自动猜想解决与形式化验证

Haocheng Ju, Guoxiong Gao, Jiedong Jiang, Bin Wu, Zeming Sun, Shurui Liu, Leheng Chen, Yutong Wang, Yuefeng Wang, Zichen Wang, Wanyi He, Peihao Wu, Liang Xiao, Ruochuan Liu, Bryan Dai, Bin Dong

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Westlake Institute for Advanced Study, Westlake University(西拉雅大学先进研究所) School of Mathematics, Tianjin University(天津大学数学学院) Research Institute for Mathematical Sciences, Kyoto University(京都大学数学研究所) Department of Mathematics, Stanford University(斯坦福大学数学系) IQuest Research(IQuest研究) New Cornerstone Science Laboratory, School of Mathematical Sciences, Peking University(北京大学数学科学学院新基石科学实验室) Beijing International Center for Mathematical Research and the New Cornerstone Science Laboratory, Peking University(北京大学国际数学研究所以及新基石科学实验室) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(大湾大学先进研究所智能计算中心) Zhongguancun Academy(中关村学院)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一个集成非形式化推理与形式化验证的自动框架,通过两个组件Rethlas和Archon解决研究级数学问题,并成功解决交换代数中的开放问题并在Lean 4中形式化验证。

Comments Code and resources are available at: Rethlas (https://github.com/frenzymath/Rethlas), Rethlas Results (https://github.com/frenzymath/Rethlas_results), Archon (https://github.com/frenzymath/Archon), and the formalization results (https://github.com/frenzymath/Anderson-Conjecture)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20333 2026-06-02 cs.AI cs.LG cs.NE 62%

NNGPT: Rethinking AutoML with Large Language Models

NNGPT: 用大型语言模型重新思考AutoML

Roman Kochnev, Waleed Khalid, Tolgay Atinc Uzun, Xi Zhang, Yashkumar Sanjaybhai Dhameliya, Furui Qin, Chandini Vysyaraju, Raghuvir Duvvuri, Avi Goyal, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出NNGPT开源框架,利用大型语言模型实现自我改进的AutoML引擎,通过生成-评估-自我改进闭环自动设计神经网络架构和超参数。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 5664-5674, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30914 2026-06-01 cs.LG cs.SE 62%

Automating Formal Verification with Reinforcement Learning and Recursive Inference

用强化学习和递归推理自动化形式验证

Max Tan

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) Massachusetts Institute of Technology(麻省理工学院)

专题命中 工具调用 :tool-use(abstract);分类 cs.LG、cs.SE

AI总结 研究通过可验证奖励的强化学习和验证器引导的推理搜索,提升大语言模型生成验证程序和证明的能力,在Dafny和Lean上取得显著进展。

Comments Master's thesis, 140 pages, 16 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30686 2026-06-01 cs.CR cs.AI cs.LG 62%

Depth-Dependent Indirect Prompt Injection in Tool-Calling ReAct Agents: Injection Depth, Payload Framing, and Turn-Budget Sensitivity

工具调用ReAct代理中深度相关的间接提示注入:注入深度、载荷框架和轮次预算敏感性

Mohammadreza Rashidi

机构 * Department of Computer Science(计算机科学系) AI and Media Analysis Lab(人工智能与媒体分析实验室) Berlin, Germany(柏林,德国)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 通过四个对照实验(共460次试验),研究在工具调用ReAct代理中,注入深度、载荷框架和轮次预算对间接提示注入攻击成功率的影响,发现注入深度是主导变量,且仅清理第一个工具观察可捕获67%的注入成功。

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26711 2026-06-01 cs.CL cs.LG 62%

The Need for an External Observer Formalizing the Sufficiency Gap: A Mathematical Extension of Mixture Identifiability and Contextual Grounding in Sequence Models

外部观察者的必要性:充分性差距的形式化——序列模型中混合可识别性与上下文基础化的数学扩展

Francesco Corielli

专题命中 工具调用 :tool use(abstract);分类 cs.CL、cs.LG

AI总结 本文通过构建二元混合过程,形式化了由未观测隐状态导致的充分性差距,并引入辅助信号建立上下文主导阈值,证明温度缩放无法弥补缺失上下文,而外部观察者或验证器在高风险领域是必要的。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05614 2026-05-29 cs.CL cs.AI 62%

GroundAct: Can LLM Agents Ground Actions in Environmental States?

GroundAct:LLM智能体能否在环境状态中实现动作落地?

Zixuan Wang, Dingming Li, Hongxing Li, Yanrui Miao, Shuo Chen, Yuchen Yan, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出GroundAct基准,通过1500个场景和16592个任务实例评估15个LLM,发现动作落地能力是多维挑战,不能仅通过模型规模解决。

Comments Project Page: https://zju-real.github.io/OmniEmbodied Code: https://github.com/ZJU-REAL/OmniEmbodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22511 2026-05-27 cs.AI cs.CL cs.IR 62%

Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning

Search-E1: 自蒸馏驱动搜索增强推理中的自我进化

Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Search-E1方法,通过交替使用普通GRPO和在线策略自蒸馏(OPSD),让搜索增强智能体无需外部监督或复杂模块即可自我进化,在七个QA基准上以3B模型超越所有开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25832 2026-05-26 cs.RO cs.AI cs.CL cs.CV 62%

When Search Becomes Memory: Turning Robot Design Trials into Transferable Skills

当搜索成为记忆:将机器人设计试验转化为可迁移技能

Yunfei Wang, Xiaohao Xu, Yang Li, Xiaonan Huang

机构 * University of Michigan(密歇根大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出Auto-Robotist,一种自进化LLM代理,通过将形态搜索轨迹提炼为自然语言技能库,实现可迁移的机器人设计知识,在EvoGym任务中提升冷启动搜索并跨设计空间迁移技能。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25749 2026-05-26 cs.IR cs.AI cs.LG 62%

DeGRe: Dense-supervised Generative Reranking for Recommendation

DeGRe: 密集监督的生成式重排序用于推荐

Chaotian Song, Jingyao Zhang, Chenghao Chen, Zisen Sang, Dehai Zhao, Guodong Cao, Boxi Wu, Deng Cai, Jia Jia

机构 * College of Software, Zhejiang University Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Beijing China State Key Lab of CAD\&CG, Zhejiang University Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Shanghai China College of Software, Zhejiang University Rajax Network Technology, Taobao Shangou of Alibaba State Key Lab of CAD\&CG, Zhejiang University

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出DeGRe框架,通过离线探索中的密集监督信号(Lookahead Evaluator)指导在线生成器(Online Generator)进行单步贪婪解码,解决重排序中的启发式标签偏差和信用分配问题。

Comments Accepted to KDD 2026 (ADS Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23655 2026-05-25 cs.CV cs.AI cs.LG cs.MM 62%

CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

CVSearch:赋予多模态大语言模型认知视觉搜索能力以感知高分辨率图像

Liupeng Li, Haoqian Kang, Zhenyu Lu, Jinpeng Wang, Bin Chen, Ke Chen, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出CVSearch,一种无需训练的自适应框架,通过评估-搜索工作流动态调度视觉搜索策略,解决高分辨率图像感知中覆盖与效率的权衡问题。

Comments Accepted by ICML 2026. 22 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22880 2026-05-25 cs.CL cs.AI cs.CY 62%

How Far Will They Go? Red-Teaming Online Influence with Large Language Models

它们会走多远?使用大型语言模型对在线影响力进行红队测试

Daniel C. Ruiz, Anna Serbina, Ashwin Rao, Emilio Ferrara, Luca Luceri

机构 * Information Sciences Institute University of Southern California(信息科学研究所 乌德穆尔特国立大学)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个红队测试框架,通过测量大型语言模型在争议话题上的政治观点表达范围(Overton Window),并量化简单自然语言越狱如何扩展该范围,发现开源LLM在政治表达上存在系统性不对称,且越狱效果因模型系列而异。

Comments 30 pages, 8 figures, submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22733 2026-05-22 cs.AI cs.SE 62%

HarnessAPI: A Skill-First Framework for Unified Streaming APIs and MCP Tools

HarnessAPI: 一种以技能为中心的统一流式API和MCP工具框架

Edwin Jose

机构 * Department of Computer Science(计算机科学系)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出HarnessAPI,一种以技能为中心的框架,通过将类型化的技能文件夹作为单一真相源,消除了流式API和MCP工具之间的重复代码,减少了74%的框架层面的样板代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21405 2026-05-21 cs.SE cs.AI cs.PL 62%

Stdlib or Third-Party? Empirical Performance and Correctness of LLM-Assisted Zero-Dependency Python Libraries

标准库还是第三方?LLM辅助零依赖Python库的实证性能和正确性

Peng Ding, Rick Stevens

机构 * University of Chicago(芝加哥大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文通过零依赖项目探讨了仅使用Python标准库能否替代第三方库,并评估了LLM在严格约束下生成正确且高性能代码的能力。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16609 2026-05-19 cs.LG cs.AI cs.CC cs.DS 62%

Prior Knowledge Makes It Possible: From Sublinear Graph Algorithms to LLM Test-Time Methods

先验知识使其成为可能:从次线性图算法到LLM测试时方法

Avrim Blum, Daniel Hsu, Cyrus Rashtchian, Donya Saless

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Columbia University(哥伦比亚大学) Google Research(谷歌研究)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了测试时增强方法中先验知识与外部信息交互的理论基础,通过将多步推理建模为知识图中的s-t连通性问题,揭示了在部分先验知识下,测试时增强步骤数量与图结构之间的关系,发现当知识图中存在小组件时,增强步骤数呈平方根增长,而当知识密度超过阈值形成大组件时,增强步骤数趋于常数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17162 2026-05-19 cs.AI cs.LG 62%

From Imitation to Interaction: Mastering Game of Schnapsen with Shallow Reinforcement Learning

从模仿到交互:利用浅层强化学习掌握斯纳普森游戏

Ján Klačan, Sizhong Zhang

机构 * Vrije Universiteit Amsterdam(弗里兹大学阿姆斯特丹)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究浅层神经网络代理是否能掌握纸牌游戏斯纳普森,并挑战使用蒙特卡洛采样和前瞻搜索的强搜索基线RdeepBot。通过逐步更复杂的实验设计,首先评估了基于回放数据训练的监督学习代理(MLPBot)以及通过异步蒙特卡洛更新和经验回放训练的强化学习代理(RLBot)。结果表明,监督模仿不足以击败强RdeepBot对手,而强化学习产生了更强的代理。在聚焦RdeepBot深度参数的设置中,最佳性能是在学习的价值函数与游戏过程中更深层次的前瞻搜索结合时实现的,使RLBot在最强的RdeepBot基线下实现了统计显著更高的胜率。在基于样本的设置中,收益更具条件性:最强性能出现在相对较低的训练num_samples参数下,而不是随着更强采样均匀增加。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00712 2026-05-19 cs.LG cs.AI 62%

JSON-Bag: A generic game trajectory representation

JSON-Bag:一种通用的游戏轨迹表示方法

Dien Nguyen, Diego Perez-Liebana, Simon Lucas

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出JSON-Bag模型,通过分词JSON描述并使用Jensen-Shannon距离衡量游戏轨迹,验证了其在六个桌面游戏中对玩家、参数和种子分类的有效性,优于基线方法并提升了准确性。

Comments 8 pages, 3 figures, 6 tables, published in IEEE Conference on Games 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01242 2026-05-14 cs.CV cs.AI cs.CL 62%

When Diffusion Breaks Constraints: Sequential Autoregressive Generation with RL and MCTS

当扩散模型失效约束:通过强化学习和MCTS的序列自回归生成

Zirui Zhao, Boye Niu, Harold Soh, David Hsu, Wee Sun Lee

机构 * Salesforce AI Research(Salesforce人工智能研究) University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了扩散模型在约束生成任务中的失效模式,通过拼图生成和简化矩形组合任务,发现扩散模型难以满足约束,提出基于自回归序列生成的约束意识生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09168 2026-05-12 cs.AI cs.LG 62%

CIVeX: Causal Intervention Verification for Language Agents

CIVeX:语言代理的因果干预验证

Fabio Rovai

机构 * The Tesseract Academy(泰塞克特学院)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 CIVeX通过结构因果查询验证语言代理的干预行动,解决因果效应识别问题,实验显示其在对抗性混淆下具有高准确性和可靠性。

Comments 16 pages, 3 figures. Includes Causal-ToolBench, IHDP, ZOZO Open Bandit, and LaLonde NSW evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08887 2026-05-12 cs.AI cs.CL 62%

Ace-Skill: Bootstrapping Multimodal Agents with Prioritized and Clustered Evolution

Ace-Skill:通过优先级和聚类进化提升多模态智能体

Feng Xiong, Zengbin Wang, Yong Wang, Xuecai Hu, Jinghan He, Liang Lin, Yuan Liu, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP) CASIA BNU(北华大学)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 Ace-Skill通过优先级采样和聚类组织优化多模态智能体的自我进化过程,提升信息获取效率和知识检索可靠性,实现自我强化的良性循环,提升多模态工具使用任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08368 2026-05-12 cs.AI cond-mat.stat-mech cs.LG 62%

On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective

在训练后区分能力激发与能力创造:从自由能视角出发

Yuhao Li, Shengchao Liu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.LG

AI总结 本文从自由能视角出发,区分训练后的能力激发与能力创造,通过引入可及支持的概念,探讨训练过程对行为概率和可达行为空间的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10880 2026-05-11 cs.CR cs.AI cs.CL 62%

Searching for Privacy Risks in LLM Agents via Simulation

通过模拟搜索LLM代理中的隐私风险

Yanzhe Zhang, Diyi Yang

机构 * Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过模拟搜索改进攻击与防御策略,发现攻击策略从直接请求演变为伪装和伪造同意等复杂手段,防御策略从规则约束升级为身份验证状态机,为隐私安全代理发展提供洞察。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07462 2026-05-11 cs.CL cs.AI 62%

The Moltbook Files: A Harmless Slopocalypse or Humanity's Last Experiment

Moltbook Files:一场无害的混乱还是人类的最后实验

William Brach, Federico Torrielli, Stine Lyngsø Beltoft, Annemette Brok Pirchert, Peter Schneider-Kamp, Lukas Galke Poech

机构 * Slovak University of Technology(斯洛伐克技术大学) University of Turin(都灵大学) University of Southern Denmark(南部丹麦大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究Moltbook平台上的群体行为,通过分析232k篇帖子和2.2M条评论,发现其数据对语言模型的影响,发现微调后真实性下降,但Reddit数据集也产生类似效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15189 2026-05-11 cs.IR cs.AI cs.CL 62%

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

ScrapeGraphAI-100k:用于模式约束LLM生成的数据集

William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

机构 * Slovak University of Technology(斯洛伐克技术大学) ScrapeGraphAI

专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ScrapeGraphAI-100k数据集,包含93695个模式约束提取事件,通过真实用户数据和结构化标注,用于评估LLM在模式约束下的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02805 2026-05-11 cs.CL cs.AI 62%

MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning

MemSearcher:通过端到端强化学习训练LLM进行推理、搜索和管理内存

Qianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen, Yaojie Lu, Hongyu Lin, Le Sun, Debing Zhang, Xianpei Han

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Xiaohongshu Inc(小红书公司)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 MemSearcher通过端到端强化学习训练LLM进行推理、搜索和内存管理,通过维护紧凑的记忆在多轮交互中保持上下文长度稳定,优于基于历史拼接的基线方法。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27685 2026-05-01 cond-mat.mtrl-sci cs.AI cs.LG physics.comp-ph 62%

VibroML: an automated toolkit for high-throughput vibrational analysis and dynamic instability remediation of crystalline materials using machine-learned potentials

VibroML:一种用于晶体材料高通量振动分析及动态不稳定性修复的自动化工具包

Rogério Almeida Gouvêa, Gian-Marco Rignanese

机构 * WEL Research Institute(WEL研究机构)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 VibroML通过机器学习势能函数自动修复晶体材料的动态不稳定性,结合遗传算法和分子动力学模拟,发现多种动态稳定的多形体,并利用ProtoCSP预测稳定晶体结构。

详情

展开后加载摘要…

URL PDF HTML 收藏