arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 93944 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5130 篇

2412.15606 2025-02-04 cs.AI cs.CV 80%

Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage

Zhi Gao, Bofei Zhang, Pengxiang Li, Xiaojian Ma, Tao Yuan, Yue Fan, Yuwei Wu, Yunde Jia, Song-Chun Zhu, Qing Li

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence, BIGAI(BIGAI通用人工智能国家重点实验室) Beijing Key Laboratory of Intelligent Information Technology, Beijing Institute of Technology(北京理工大学智能信息技术北京市重点实验室) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(深圳北理莫斯科大学广东机器感知与智能计算实验室) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

Comments ICLR 2025, https://mat-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23993 2026-08-04 cs.CL cs.AI cs.DB cs.LG cs.MA 80%

EPM-RL: Reinforcement Learning for On-Premise Product Mapping in E-Commerce

EPM-RL:电商产品映射的强化学习方法

Minhyeong Yu, Wonduk Seo

机构 * AI Research, Enhans(AI研究,Enhans)

专题命中 工具调用 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出EPM-RL框架,通过强化学习提升电商产品映射的准确性和效率,解决传统方法依赖外部API和高成本的问题,实现私有部署和低成本运营。

Comments preprint

Journal ref Proceedings of the AAAI Symposium Series, vol. 9, no. 1, p. 227, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28055 2026-07-31 cs.IR 新提交 80%

VIG-RL: Learning to Search and Insert for Verified Image Grounding

VIG-RL:学习搜索与插入以实现可验证的图像定位

Qinhan Yu, Jun Guang, Chong Chen, Wentao Zhang

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);workflow(abstract);agentic(abstract)

AI总结 本文针对现有检索增强框架无法动态推理视觉证据插入时机与位置的问题,提出自主智能体框架VIG-RL,将相关工作流建模为主动决策过程,经强化学习优化后实现SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14029 2026-07-30 cs.CV 版本更新 80%

POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management

POINTS-Seeker:从零开始训练多模态代理搜索模型

Yikun Liu, Yuan Liu, Haicheng Wang, Zhongyin Zhao, Le Tian, Xiao Zhou, Jiangchao Yao, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) CMIC, Shanghai Jiao Tong University(上海交通大学CMIC) WeChat AI, Tencent(腾讯WeChat AI)

专题命中 工具调用 :agent(abstract);tool-use(abstract);planning(abstract);agentic(abstract)

AI总结 本文提出POINTS-Seeker模型,通过引入代理播种机制和V-Fold压缩方案,解决长周期交互中的证据检索问题,并在六个基准测试中超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17172 2026-05-19 cs.LG cs.AI cs.CL 80%

OpenJarvis: Personal AI, On Personal Devices

OpenJarvis: 个人AI,本地设备上

Jon Saad-Falcon, Avanika Narayan, Robby Manihani, Tanvir Bhathal, Herumb Shandilya, Hakki Orhun Akengin, Gabriel Bo, Andrew Park, Matthew Hart, Caia Costello, Chuan Li, Christopher Ré, Azalia Mirhoseini

机构 * OpenClaw Hermes Agent PinchBench GAIA

专题命中 工具调用 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出OpenJarvis,一种分解的个人AI堆栈,通过在本地设备上优化五个基本组件(智能、引擎、代理、工具与记忆、学习)来缩小本地与云端之间的性能差距,同时保持本地模型的特性。

Comments Code: https://github.com/openjarvis/openjarvis Website: https://open-jarvis.github.io/OpenJarvis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22836 2026-04-28 cs.CV 80%

AgentRVOS for MeViS-Text Track of 5th PVUW Challenge: 3rd Method

AgentRVOS用于5th PVUW挑战赛MeViS-Text跟踪的第三种方法:Ref-VOS管道

Deshui Miao, Chao Yang, Chao Tian, Guoqing Zhu, Kai Yang, Zhifan Mo, Xin Li

机构 * Pengcheng Laboratory(鹏城实验室) Wuhan Textile University(武汉纺织大学) Yixiang Innovation Technology (Shenzhen)(曦昂创新技术(深圳))

专题命中 工具调用 :agent(summary_cn,abstract)

AI总结 本文提出基于Sa2VA的Ref-VOS管道,通过明确的agent角色实现密集语义理解与时间搜索,核心方法包括agent循环决策与多agent协作,主要贡献是提升视频跟踪的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23752 2026-04-03 cs.CV 80%

ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks

ThinkGeo: 评估用于遥感任务的工具增强代理

Akashah Shabbir, Muhammad Akhtar Munir, Akshay Dudhane, Muhammad Umer Sheikh, Muhammad Haris Khan, Paolo Fraccaro, Juan Bernabe Moreno, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) IBM Research(IBM研究院) Linköping University(林雪平大学) Australian National University(澳大利亚国立大学)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);planning(abstract);agentic(abstract)

AI总结 ThinkGeo是一个针对遥感任务设计的代理基准,评估LLM驱动代理在结构化工具使用和多步骤规划中的能力,通过人类 curated 查询和专家验证的推理步骤测试不同模型的工具准确性和规划一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01476 2026-02-10 cs.AI cs.CL cs.LG 80%

Tree Search for Language Model Agents

语言模型代理的树搜索

Jing Yu Koh, Stephen McAleer, Daniel Fried, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出一种树搜索算法,用于提升语言模型代理在现实网页任务中的表现,实验显示其在成功率上显著优于基线方法。

Comments 13 pages. Models and code available at https://jykoh.com/search-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12871 2024-10-10 cs.CL cs.AI cs.LG 80%

MetaTool: Facilitating Large Language Models to Master Tools with Meta-task Augmentation

Xiaohan Wang, Dian Li, Yilin Zhao, Sinbadliu, Hui Wang

专题命中 工具调用 :AI agent(abstract);tool use(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19228 2024-06-28 cs.CL cs.AI cs.LG 80%

Tools Fail: Detecting Silent Errors in Faulty Tools

Jimin Sun, So Yeon Min, Yingshan Chang, Yonatan Bisk

专题命中 工具调用 :agent(abstract);tool-use(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13227 2023-10-23 cs.CL cs.AI cs.LG 80%

ToolChain*: Efficient Action Space Navigation in Large Language Models with A* Search

Yuchen Zhuang, Xiang Chen, Tong Yu, Saayan Mitra, Victor Bursztyn, Ryan A. Rossi, Somdeb Sarkhel, Chao Zhang

专题命中 工具调用 :autonomous agent(abstract);tool-use(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03605 2026-08-28 cs.CL 版本更新 79%

AEScorer: An Agentic Evidence-Grounded Framework for Graded Factuality Verification

DiVA: 基于代理-判别验证器的细粒度事实性验证

Hui Huang, Muyun Yang, Yuki Arase

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Science Tokyo(东京科学研究所)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。

Comments Accepted by Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27309 2026-08-27 cs.SE 版本更新 79%

SIGIL: Compiling Agent Skills into Typed Harnesses

SIGIL:将智能体技能编译为类型化工具框架

Jayanaka Dantanarayana, Savini Kashmira, Lingjia Tang, Jason Mars

专题命中 工具调用 :agent(title,abstract);分类 cs.SE

AI总结 SIGIL通过Skill Compilation将散文式智能体技能编译为类型化工具框架,提升了智能体执行技能要求步骤的比例、完整过程的频率并减少token使用,且效果与模型无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27140 2026-08-27 cs.AI 版本更新 79%

StepOPSD: Step-Aware Online Preference Self-Distillation for Agent Reinforcement Learning

StepOPSD: 面向智能体强化学习的步骤感知在线偏好蒸馏

Yanfei Zhang, Xu Lin, Chenglin Wu

机构 * Independent Researcher(独立研究者) Tencent(腾讯) DeepWisdom(深智沃)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 提出StepOPSD框架,以智能体步骤为信用分配单元,通过事后增强教师上下文重新评分步骤段,并在GRPO更新前进行归一化每步信用预算的优势塑造,解决多轮智能体强化学习中的信用分配不匹配问题。

Comments Already been accepted as an EMNLP2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02595 2026-08-26 cs.SE cs.PL 版本更新 79%

Attributing Structured-Output Gains in Function Calling: Interface Alignment versus Procedural Transfer

函数调用中结构化输出增益的归因:接口对齐与过程转移

Wanyi Chen, Daoyuan Chen, Fang Kong

专题命中 工具调用 :function calling(title,abstract);分类 cs.SE

AI总结 研究结构化输出基准中提示诱导函数调用增益的归因,介绍四层增益归因协议,应用于相关数据集得出部分增益源于接口对齐而非过程转移的结论,并发布相关资源。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21808 2026-08-25 cs.CL 新提交 79%

MCite-RL: Towards Reliable Multimodal RAG via Citation-enhanced Agentic Reinforcement Learning

MCite-RL:基于引用增强型智能体强化学习的可靠多模态检索增强生成

Suifeng Zhao, Zida Liu, Xinyu Lei, Lei Sun, Jun Gao, Sujian Li

机构 * Peking University(北京大学) Panasonic Connect Co., Ltd.(松下连接株式会社)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 针对现有多模态RAG存在的视觉引用不准或与答案脱节问题,本文提出MCite-RL框架,通过智能体优化模块和引用增强型奖励机制实现引用精度与答案质量的联合优化,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18633 2026-08-25 cs.MA econ.EM q-fin.RM 79%

Modelling Cascading Physical Climate Risk in Supply Chains with Adaptive Firms: A Spatial Agent-Based Framework

基于适应性企业的供应链中物理气候风险 cascading 的建模:一种空间 agent-based 框架

Yara Mohajerani

机构 * Quantile Labs

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文提出一个开源 Python 框架,用于建模供应链经济中的 cascading 物理气候风险,通过整合地理洪水风险与企业家庭 agent-based 模型,模拟直接资产损失和间接中断。企业通过资本硬化和备用供应商搜索适应,减少损失和中断,强调间接级联效应的重要性。

Comments V1 presented at NeurIPS 2025 Tackling Climate Change with Machine Learning workshop. V4 replaces evolutionary learning with explicit firm continuity adaptation, adds stock-flow consistency, matched-seed ensembles, cascade diagnostics, and internal validations. Code: https://github.com/yaramohajerani/spatial-climate-ABM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20844 2026-08-24 cs.AI 新提交 79%

TRACE: Agentic Catalog Enrichment with Multi-source Evidence Grounding

TRACE:基于多源证据锚定的智能体式商品目录丰富

Rohan Kumar, Steven Xu, Kyle MacDonald, Matthew Long, Bernice Chow, Mac VanRenterghem, Sudeep Das

机构 * DoorDash(多闸道科技(DoorDash))

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 针对电商商品目录属性稀疏问题,提出基于LLM的TRACE框架,经离线评估、生产部署及在线实验验证,可高效提升目录属性丰富的准确率、覆盖率及结账转化率。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15877 2026-08-18 cs.AI 新提交 79%

Dear Algo: A Precision-First Agentic Intent Layer for Unified Search and Recommendation

Dear Algo:面向统一搜索与推荐的精准优先智能体意图层

Rui Wang, Jiazhou Wang, Zheng Wei, Chenglin Lu, Fangcheng Sun, Ivy Sun, Jin Sun, Hui Geng, Lillian Zhang, Chao Yang, Lei Chen, Shahin Sefati, Reem Helou, Joe Zhou, Babak Shakibi, Yiyi Pan, Bi Xue, Hong Yan, Shujian Bu

机构 * Meta Platforms Inc.(元平台公司) Google DeepMind(谷歌DeepMind)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 该研究提出面向统一搜索与推荐的精准优先智能体意图层Dear Algo,将多类型意图编译为可执行计划,实验显示其在精度、候选数量及用户相关性上均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18245 2026-08-18 cs.SE cs.CR 版本更新 79%

Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety

谁测试测试者?LLM代理工具调用安全的系统枚举与覆盖审计

Xuan Chen, Lu Yan, Ruqi Zhang, Xiangyu Zhang

专题命中 工具调用 :agent(title,abstract);分类 cs.SE

AI总结 本文提出SafeAudit框架,通过系统生成测试用例和规则阻力指标,发现现有测试未覆盖的20%不安全行为,揭示当前安全评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23955 2026-08-12 cs.AI 版本更新 79%

EviBack: Search-Agent Reinforcement Learning via Evidence-Constrained Teacher Backoff

EviBack:通过证据约束的教师退避进行搜索智能体强化学习

Xiao Ma, Zhiquan Hu, Yi Wei, Chenchen Zhao, Yijun Chen, Jicheng Zhao, Yuming Li, Chuang Dai

专题命中 工具调用 :agent(title);agentic(abstract);分类 cs.AI

AI总结 研究针对智能体RAG系统中全零展开组问题,提出EviBack方法,通过证据约束教师退避提供辅助监督。利用全自动管道生成两阶段教师,提升了下游F1等指标,在多个问答基准上取得更好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11611 2026-08-12 cs.AI 版本更新 79%

CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG

CuSearch:通过搜索深度进行课程展开采样以实现代理RAG

Jianghan Shen, Siqi Luo, Xinyu Cheng, Jing Xiong, Yue Li, Jiyao Liu, Jiashi Lin, Yirong Chen, Junjun He

机构 * Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) University of Hong Kong(香港大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出CuSearch,通过搜索深度贪心分配策略改进代理RAG训练,提升检索监督密度,实验显示在ZeroSearch上性能提升达11.8个精确匹配点。

Comments The paper has been accepted by COLM 2026. Code: https://github.com/MrToser/CuSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09622 2026-08-11 cs.AI cs.SY eess.SY 新提交 79%

Adaptive Sequential Test Planning for Multi-Mechanism Reliability Qualification via Bayesian Monte Carlo Tree Search

基于贝叶斯蒙特卡洛树搜索的多机制可靠性鉴定自适应序贯测试规划

Youssef A. Elhagrasy, Ian Hill, André Ivanov

机构 * University of British Columbia(英属哥伦比亚大学)

专题命中 工具调用 :planning(title,abstract);分类 cs.AI

AI总结 该研究针对多机制半导体可靠性鉴定,提出结合MCTS-SA与EKF的闭环自适应序贯测试规划框架,实验显示其表征良率较非自适应策略大幅提升。

Comments Accepted to IEEE Transactions on Reliability

Journal ref IEEE Transactions on Reliability, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09577 2026-08-11 cs.AI 新提交 79%

ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger-Rule Optimization

ElasticBack:通过耦合触发-规则优化实现LLM智能体技能中的隐蔽条件后门

Hao Sui, Simeng Qin, Jie Liao, Xiaojun Jia, Bing Chen, Yang Liu

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本研究提出ElasticBack,通过耦合触发-规则优化在LLM智能体技能中植入条件性单技能后门,实验显示其攻击性能优异且隐蔽性强,可推动技能供应链的防御研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08700 2026-08-11 cs.AI 新提交 79%

PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

PluginEval:用于函数调用细粒度错误归因的诊断基准

Dongjie Xu, Julius, Hanchi Dong, Minghua Tang, Yuxuan Sun, Ziwei Nie, Zicheng Liu, Dujun Qing, Jiajie Xu

专题命中 工具调用 :function calling(title);autonomous agent(abstract);分类 cs.AI

AI总结 PluginEval是缓解现有函数调用基准局限的两阶段诊断基准,可细粒度归因错误,评估显示不同模型在难度级别和错误类别中存在性能差异,且其LLM判断器与人类标注一致性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07925 2026-08-11 cs.AI 新提交 79%

ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration

ZhuLong:基于执行的大语言模型智能体,用于结合离线API自探索的EDA脚本编写

Yang Liu, Shiwei Hou, Xiyuan Chen, Yu Wang, Sen Yuan, Qirui Gan, Shao You, Feifan Chen, Wencheng Li, Shuyang Hu, Yongzhou Liu, Emma Xia, Xiaojing Lu, Hao Wang, Fan Xu, Yanfeng Li

机构 * Changxin Memory Technologies, Inc.(长鑫存储技术有限公司)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 本文提出基于执行的LLM智能体ZhuLong,结合API检索、沙箱执行与离线API自探索机制,在EDA脚本任务基准测试中性能远超纯LLM基线,为EDA脚本编写提供了有效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06790 2026-08-10 cs.SE 新提交 79%

AgentChaos: Chaos Engineering for Agent Systems via Programmatic Fault Injection

AgentChaos:通过可编程故障注入实现智能体系统的混沌工程

Gou Tan, Zhensu Sun, Jieke Shi, Ting Zhang, Zilong He, Qingfu Wu, Shuai Liang, Weifeng Sun, Junda He, Pengfei Chen, Chuanfu Zhang, Lwin Khin Shar, David Lo

专题命中 工具调用 :agent(title,abstract);分类 cs.SE

AI总结 提出AgentChaos框架,在不修改源代码的情况下于LLM API共享层注入故障,评估显示智能体系统鲁棒性取决于自身实现,现有故障诊断方法仍有提升空间。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06057 2026-08-07 cs.AI 新提交 79%

When History Lies: Evaluating and Improving Tool Use under Misleading Multi-Turn Histories

当历史失效:在误导性多轮历史下评估与改进工具使用

Xiaoqing Wu, Xingyu Fan, Feifei Li, Wenhui Que

专题命中 工具调用 :tool use(title);tool-use(abstract);分类 cs.AI

AI总结 该研究针对多轮历史误导导致的工具调用智能体决策问题,提出可靠状态策略迁移方法,构建配对基准bench,在Qwen3模型上实现了优于多种基线的工具使用准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05628 2026-08-07 cs.AI 新提交 79%

SkillHEX: Improving Agent Skills via Hypothesis-Driven Autonomous Exploration and Exploitation

SkillHEX:通过假设驱动的自主探索与利用提升智能体技能

Yuru Feng, Yaoqi Chen, Beidi Zhao, Qianxi Zhang, Xinjiang Wang, Jianan Lu, Zhirui Wang, Shusen Xu, Zengzhong Li, Qi Chen

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 SkillHEX是结合假设驱动自验证与证据引导树搜索的闭环框架,在SkillsBench87个任务上,5次迭代预算下用GPT-5.3-Codex和Claude Opus 4.7分别获55.9%、57.9%平均通过率,优于现有自演化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06835 2026-08-06 cs.CL 版本更新 79%

Translate-R1: Cost-Aware Translation Tool Use via Reinforcement Learning

Translate-R1:通过强化学习实现成本感知的翻译工具使用

Pratik Jayarao, Chaitanya Dwivedi, Himanshu Gupta, Neeraj Varshney, Adithya M Devraj, Meet Vadera, Priyanka Nigam, Bing Yin

机构 * Amazon Stores Foundation AI(亚马逊商店基金会人工智能)

专题命中 工具调用 :tool use(title,abstract);分类 cs.CL

AI总结 提出一种基于强化学习的门控策略,让LLM自主评估理解能力,仅在必要时调用翻译工具,在22种语言上提升奖励并降低翻译成本。

Comments 14 pages main text plus appendix, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏