arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-09-01 至 2026-09-01 共收录 275 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 26 篇

2608.29397 2026-09-01 cs.CL 新提交 87%

AlgoWorlds: Benchmarking Tool Use for Global Optimization in Algorithmic Worlds

AlgoWorlds:用于算法世界中全局优化的工具使用基准

Zixiang Xu, Jiaan Wang, Fandong Meng

机构 * Weixin AI, Tencent(腾讯微信AI) University of Southern California(南加州大学)

专题命中 工具调用 :tool use(title);agent(abstract);tool-use(abstract);planning(abstract)

AI总结 本研究推出AlgoWorlds基准,评估大语言模型在算法世界中利用工具将信息转化为全局最优决策的能力,实验显示领先模型仅38.61%案例能达精确最优。

Comments Homepage: this https URL (https://xzx34.github.io/AlgoWorlds/) Code: this https URL (https://github.com/xzx34/AlgoWorlds)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30685 2026-09-01 cs.AI 新提交 85%

ATLAS: Dual-Horizon Diagnostic Evaluation for Industrial Tool-Use Agents

ATLAS:面向工业工具使用智能体的双视角诊断评估框架

Wei Chen, Peilun Zhou, Zhaoyu Hu, Jiajun Chai, Zhongni Hou, Yufei Zhang, Derong Xu, Guojun Yin, Wei Lin, Zhi Zheng, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 工具调用 :tool-use(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文针对工业工具使用LLM智能体的评估缺陷,提出双视角诊断评估框架ATLAS,经美团小团生产流量验证,可提升服务质量并优化策略。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29063 2026-09-01 cs.AI 新提交 83%

Agent2UCB: Agentic System for Generative Engine Optimization

Agent2UCB:用于生成式引擎优化的智能系统

Sheldon Yu, Rui Wang, Tong Yu, Sungchul Kim, Doga Dogan, Junda Wu, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(奥多比研究院)

专题命中 工具调用 :agentic(title,abstract);workflow(abstract);分类 cs.AI

AI总结 该研究提出智能GEO系统Agent2UCB,通过评估9种策略并结合多臂老虎机策略优化内容,在GEO-Bench实验中实现可见性提升且保留SEO质量,还提供SEO评估与演示功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29309 2026-09-01 cond-mat.mtrl-sci cs.AI physics.app-ph 新提交 83%

Evaluating LLM-based AI agents integrated with materials synthesis tools: the case of atomic layer deposition

评估集成了材料合成工具的基于大语言模型(LLM)的智能体:以原子层沉积为例

Angel Yanguas-Gil

专题命中 工具调用 :AI agent(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 本研究以原子层沉积为案例,提出了评估集成材料合成工具的基于LLM的AI智能体的实用框架,涵盖多类基准并可推广至其他材料合成技术。

Comments Invited prospective paper submitted to MRS Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30952 2026-09-01 cs.LG cs.CL 新提交 81%

One Policy Is Enough: Single-Agent Reinforcement Learning Outperforms Tree Search for Chemistry Tool Learning

一个策略就足够:单智能体强化学习在化学工具学习中优于树搜索

Armin Dariani, Sifan Wu, Bang Liu, Entao Yang

机构 * DIRO, Université de Montréal(蒙特利尔大学DIRO学院) Mila - Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) Air Liquide(液化空气集团)

专题命中 工具调用 :agent(title);tool use(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出单智能体强化学习模型,在ChemToolBench多工具化学任务上,相较CheMatAgent的树搜索方法,在Qwen-2.5-7B和Llama-3.1-8B上提升了工具F1、返回F1及答案通过率,且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29096 2026-09-01 cs.LG cs.AI 新提交 81%

Development of an Autonomous AI Coding Agent using Monte Carlo Tree Search (MCTS) and Gemini LLM Frameworks

基于蒙特卡洛树搜索(MCTS)和Gemini大语言模型框架的自主AI编码智能体开发

Pravin Game, Vipin Ramakrishnan, Prathamesh Wagh

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究开发了一种结合Gemini LLM与定制MCTS的自主AI编码智能体,通过自评判系统优化代码生成,在复杂逻辑任务上成功率达92%,性能优于零样本生成模型。

Comments 10 PAGES WITH PLAGIARISM REPORT ON 10TH PAGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30091 2026-09-01 cs.AI 新提交 79%

VERA: Authority-Preserving Edge Revocation for Federated AI-Agent Workflows

VERA:联邦AI智能体工作流中保留权限的边撤销机制

Lifei Liu, Haoran Yu, Xiaochong Jiang

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 针对联邦AI智能体工作流的权限一致性问题,提出VERA可验证边撤销机制,解决树级联过度撤销与部署者级联欠撤销问题,在LangGraph等框架中验证了其有效性与模式可移植性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30702 2026-09-01 cs.CL cs.AI cs.LG 新提交 78%

An Agentic Retrobiosynthesis Framework with Learned Frontier Selection

一种基于学习的前沿选择的智能体逆生物合成框架

Philippe Meyer, Guillaume Gricourt, Thomas Duigou, Joan Hérisson, Jean-Loup Faulon

机构 * Université Paris-Saclay(巴黎萨克雷大学) INRAE(法国国家农业食品与环境研究院) AgroParisTech(巴黎高科农业学院)

专题命中 工具调用 :agentic(title);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究提出基于学习前沿选择的智能体逆生物合成框架,经微调的Qwen2.5-7B策略在多个基准上优于MCTS等方法,可提升预算内逆合成搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30268 2026-09-01 cs.AR 新提交 78%

FABO: Agent-Guided Discovery of Joint Breakpoint Optimization for Timing-Driven Routing Trees

FABO:智能体引导的时序驱动布线树联合断点优化发现

Shang Liu, Wenji Fang, Jing Wang, Hongxin Kong, Yao Lu, Zhiyao Xie

专题命中 工具调用 :agent(title,abstract)

AI总结 针对布线树优化问题,本研究开发智能体框架发现SALT的结构局限,提出FABO算法,在129万个ICCAD15网络上实现导线长度降低,FABO-FAST可高效优化多数网络。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28695 2026-09-01 cs.CV cs.IR 新提交 78%

Weaving Visual Narratives: Agentic Image Bundle Composition Beyond Atomic Visual Matching

编织视觉叙事:超越原子视觉匹配的智能体图像束合成

Rong Shan, Tianyi Xu, Congmin Zheng, Wenteng Chen, Jiachen Zhu, Junjie Wu, Teng Wang, Weiwen Liu, Changwang Zhang, Weinan Zhang, Jun Wang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) OPPO(OPPO(广东欧珀移动通信有限公司))

专题命中 工具调用 :agentic(title,abstract)

AI总结 针对传统图像检索原子匹配范式无法捕捉用户视觉搜索意图的问题,提出BundleWeaver智能体框架,构建IBCBench数据集,实现图像束合成并取得显著性能提升。

Comments Accepted by EMNLP'26 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29357 2026-09-01 cs.AI 新提交 77%

LiteSearch-VL: Small Multimodal Search Agents via Trajectory Distillation and Synthetic Step-DPO

LiteSearch-VL:通过轨迹蒸馏和合成步级DPO实现的小型多模态搜索智能体

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能) Ohio State University(俄亥俄州立大学)

专题命中 工具调用 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究提出LiteSearch-VL方案,通过轨迹蒸馏和合成步级DPO,在单节点预算下将多模态搜索智能体能力迁移至Qwen3-VL-2B等小型模型,使其在多模态视觉问答任务上取得接近4B模型的性能,明确小型多模态智能体的下一瓶颈是答案验证而非搜索深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29942 2026-09-01 cs.CR cs.AI 新提交 74%

Influence Is Not Authority: When Causal Guardrail Signals Make Legitimate Tool Use Look Like an Attack in Tool-Using LLM Agents

影响并非权威:在使用工具的大语言模型智能体中,因果护栏信号为何会让合法工具使用看起来像攻击

Tanzim Ahad, Ismail Hossain, Md Jahangir Alam, Sai Puppala, Syed Bahauddin Alam, Sajedul Talukder

专题命中 工具调用 :tool use(title);分类 cs.AI

AI总结 该研究指出基于影响的大语言模型智能体护栏无法可靠区分合法与恶意工具操作,经多组实验验证了该局限,并测试了语义监控器、影子护栏等方案的表现,为安全决策提供了参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30147 2026-09-01 cs.CL 新提交 70%

CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

CAST:用于训练可靠长程工具调用智能体的批判感知监督

Amir Saeidi, Zehua Zhang, Rishitosh Singh, Naman Ahuja, Vivek Gupta, Ali Payani, Gaowen Liu, Jayanth Srinivasa, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Cisco Research(思科研究院)

专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出批判感知训练框架CAST,通过分析智能体轨迹生成结构化批判,优化Qwen3模型,在零售、远程医疗等动态工具调用任务上提升可靠性,性能优于GPT-OSS-120B。

Comments Accepted to EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29128 2026-09-01 cs.AI cs.LG cs.SE 新提交 67%

APIFlow-Bench: Measuring Whether Agents Survive Long, Dependent API Workflows

APIFlow-Bench:评估智能体能否完成长时程、存在依赖关系的API工作流

Zelin Wan, Arash Nourian, Xiaoxiao Li, Nihar Nandan, Kamalakannan Nandagopal

机构 * Postman, Inc.(波斯特曼公司)

专题命中 工具调用 :workflow(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 该研究推出APIFlow-Bench基准,评估智能体完成长时程依赖API工作流的能力,实验发现依赖链长度、模型可靠性影响成功率,复合故障不符合独立误差假设。

Comments 15 pages, 8 figures. Under review at the NeurIPS 2026 Workshop on Evaluation of Interactive Agents (IAEval). Harness, frozen task bank, and 44,362 execution transcripts: this https URL (https://github.com/postmanlabs/APIFlow-Bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30092 2026-09-01 cs.CL cs.AI 新提交 62%

Arkios: An Open Bilingual English-Nepali Language Model Trained From Scratch, with a Devanagari-Aware Tokenizer

Arkios:从零训练的开放英尼双语语言模型,带有天城文感知分词器

Sajal Regmi, Siddhartha Pudasaini, Chetan Phakami Pun

机构 * Karela Technologies Inc.(卡雷拉科技公司)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出从零训练的10.4亿参数英尼双语语言模型Arkios,其在ARC数据集上表现优于同规模模型,揭示了低资源语言模型评估的格式偏差问题,并开源了模型权重。

Comments 7 pages, 6 tables. Companion paper (tokenizer): arXiv:2608.26449 (https://arxiv.org/abs/2608.26449)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29197 2026-09-01 cs.LG cs.AI cs.GT 新提交 62%

PokaiTrainer: Scaling Belief-State Search to Competitive Pokémon VGC

PokaiTrainer:将信念状态搜索扩展至具备竞争力的宝可梦电子竞技游戏(VGC)

Max Yu

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG

AI总结 PokaiTrainer将Student of Games算法适配至自主开发的Rust战斗引擎PokaiEngine,构建出击败多数人类玩家、峰值进入宝可梦VGC天梯前500的竞技智能体。

Comments 22 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30959 2026-09-01 cs.CV cs.AI 新提交 57%

LOCI: A Locator-Critic with Refinement Loop

LOCI:带精化循环的定位器-评判器

Walid Bousselham, Mathilde Caron, Arsha Nagrani, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对视觉语言模型无法定位图像关键细节的问题,提出无需训练的LOCI框架,通过定位器与评判器的迭代精化循环实现自修正,在多个复杂视觉基准上取得当前最优结果,显著提升了开源与专有VLMs的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30426 2026-09-01 cs.CL 新提交 57%

Learning to Reason and Use Tools through Unsupervised Fine-Tuning in Task-Oriented Dialog Systems

面向任务的对话系统中通过无监督微调学习推理与使用工具

Markel Ferro, Oier Lopez de Lacalle

机构 * HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克大学UPV/EHU HiTZ中心 - Ixa)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 本研究针对任务导向对话系统的动态信息检索缺陷,提出适配ReAct框架的无监督微调方法,使LLMs可访问外部知识,其微调后的8B模型性能超越70B上下文系统,在SIMMC数据集上表现优异。

Comments Accepted to SEPLN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30352 2026-09-01 cs.AI cs.HC 新提交 57%

Co-Annotator: Expert-Distilled ViT and VLM for Visual and Documentation Guidance in Age-Related Macular Degeneration

Co-Annotator:用于年龄相关性黄斑变性视觉与文档指导的专家蒸馏ViT及VLM

Ziheng "Leo" Li, Benjamin Freeman, Akshay Raman, Kavin Aravindhan Rajkumar, Xinxin Fang, Rishabh Srivastava, Steven Feiner, Kaveri A. Thakoor

机构 * Columbia University(哥伦比亚大学)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 本研究提出Co-Annotator,将专家注视与口述提炼为AOI指导的ViT和生物标志物预填充的VLM,在AMD诊断中联合应用可显著提升效率且不降低准确率。

Comments 23 pages, 11 figures. To appear in UIST '26: Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology, November 02-05, 2026, Detroit, MI, USA. DOI: https://doi.org/10.1145/3830398.3830722

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30303 2026-09-01 cs.CL 新提交 57%

Lazy Grounding: Attacking Search Agents with Factual Evidence

惰性接地:用事实证据攻击搜索智能体

Yulin Zhang, Yukun Huang, Sanxing Chen, Tianyi Lin, Ziang Yang, Xunjian Yin, Bhuwan Dhingra

机构 * Duke University(杜克大学)

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 该研究提出惰性接地攻击,即搜索智能体被邻近问题的事实证据误导,实验显示其可降低准确率最高17.3个百分点,表明需防御事实证据的误用。

Comments Accepted to EMNLP 2026 (Main Conference). Code: this https URL (https://github.com/frankyzha/lazy-grounding)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30162 2026-09-01 cs.LG 新提交 57%

Reinforcement Learning for Symbolic Equation Solving

用于符号方程求解的强化学习

Kevin P O Keeffe

机构 * Starling Research Institute(斯塔林研究所)

专题命中 工具调用 :agent(abstract);分类 cs.LG

AI总结 该研究提出一种强化学习智能体,将代数建模为带动态动作空间的MDP,在符号方程求解任务上优于非学习型搜索方法,尤其在指数方程上表现突出,但仅针对四类受控开式方程有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28638 2026-09-01 cs.AI 新提交 57%

Self-Evolving Skills via Surrogate-Guided Solve-and-Reproduce

基于代理引导的求解与复现的自进化技能

Jiale Liu, Pinze Ren, Yuqi Xia, Huan Wang, Zhenlin Zhao, Siming Dong

机构 * Cleer Science(克利尔科学公司) The University of Edinburgh(爱丁堡大学) Tsinghua University(清华大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 该研究针对智能体自进化技能的缺陷,提出reSolve框架,通过求解与复现协议、代理验证器增强奖励及束搜索,使廉价模型技能性能超人工策划基线,且在自然科学任务上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30705 2026-09-01 cs.CV 新提交 50%

VisLens: Single-Pass Interpretable Visual Search for Multimodal LLMs

VisLens:面向多模态大语言模型的单次可解释视觉搜索方法

Jingyi He, Sanghwan Kim, Zeynep Akata

机构 * Technical University of Munich(慕尼黑工业大学) Helmholtz Munich(慕尼黑亥姆霍兹中心) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 工具调用 :tool-use(abstract)

AI总结 该研究针对多模态大语言模型的细粒度视觉搜索问题,提出VisLens方法,通过单次前向传播实现可解释的视觉搜索,性能优于或相当现有方法且推理速度大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30673 2026-09-01 cs.RO 新提交 50%

CIG-RL: Curiosity-Driven Information-Guided Reinforcement Learning for Source Term Estimation in Uncertain Environments

CIG-RL:面向不确定环境下源项估计的好奇心驱动信息引导强化学习

Junhee Lee, Seunghwan Kim, Hongro Jang, Hyungjin Kim, Hyoungho Park, Changseung Kim, Hyondong Oh

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST)) Ulsan National Institute of Science and Technology (UNIST)(蔚山国家科学技术研究院(UNIST))

专题命中 工具调用 :agent(abstract)

AI总结 针对不确定环境下源项估计的问题,提出CIG-RL方法,通过好奇心驱动的信息引导强化学习,结合不确定性自适应主动感知奖励提升鲁棒性,经模拟与真实实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30288 2026-09-01 cs.CR 新提交 50%

Extracting Knowledge from Tools in LLM Agents

从大语言模型智能体中的工具提取知识

Chuanchao Zang, Jianing Wang, Wenyu Chen, Xiangtao Meng, Li Wang, Xinyu Gao, Yingkai Dong, Zheng Li, Shanqing Guo

专题命中 工具调用 :agent(abstract)

AI总结 本文针对LLM智能体中工具介导的知识提取风险,提出仅基于查询的提取攻击ToolSiphon,通过工具对比分析与证据链式反馈两个信号,在多工具、多数据集上实现了较高的源记录恢复率,且对防御措施和现实平台有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29800 2026-09-01 cs.CV 新提交 50%

Source-Dependent Deference in Medical Imaging Agents Under Falsified Findings: A Pilot Audit

伪造结果下医学影像智能体中依赖来源的顺从性:一项试点审计

Ridam Roy, Md Shahriar Rashid, Md. Rajib Mia

机构 * Daffodil International University(水仙花国际大学) Boise State University(博伊西州立大学)

专题命中 工具调用 :agent(abstract)

AI总结 本研究通过试点审计发现,ReAct风格的医学影像工具调用智能体在散文标注的伪造结果下更易修改自身正确答案,顺从性远高于工具返回的伪造结果,该结果来自未达停止规则的小规模研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 62 篇

2608.30924 2026-09-01 cs.CL 新提交 91%

TRIPPULSE: Multi-Agent Travel Planning with Review-Grounded Reasoning

TRIPPULSE:基于评论推理的多智能体旅行规划

Priyanshu Karmakar, Borru Vijay Sai, Shubhojit Mallick, Abhik Jana, Shreya Ghosh, Manish Gupta

机构 * Microsoft(微软公司) IIT Bhubaneswar(布巴内斯瓦尔印度理工学院)

专题命中 规划决策 :agent(title,abstract);planning(title,abstract);multi-agent(title);分类 cs.CL

AI总结 TRIPPULSE是基于评论推理的多智能体旅行规划框架,分解行程生成任务为多智能体并结合10万+评论与RGPA指标,可兼顾约束满足与个性化体验。

Comments 31 pages, EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30441 2026-09-01 cs.CR 新提交 87%

ECLIPSE: Self-Evolving Stealthy Prompt Injection Attack against Long-Horizon Agentic Systems

ECLIPSE:针对长视程智能体系统的自演化隐蔽提示注入攻击

Shiqian Zhao, Yangfan Zhou, Xinfeng Li, Runyi Hu, Yechao Zhang, Yi Xie, Tianwei Zhang, Luu Anh Tuan

专题命中 规划决策 :agentic(title,abstract);agent(abstract);planning(abstract);workflow(abstract)

AI总结 本研究提出ECLIPSE框架,结合隐蔽攻击轨迹合成与工具链引导,在LASE-Bench上实现高攻击成功率,现有安全措施难以可靠防御,凸显需开发更有效防御手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29596 2026-09-01 cs.AI cs.LG cs.MA 新提交 84%

Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security

面向智能体技能的系统基础:架构、生命周期与安全性

Sanket Badhe, Deep Shah, Priyanka Tiwari, Nehal Kathrotia

机构 * Google LLC(谷歌有限责任公司) Purdue University(普渡大学)

专题命中 规划决策 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文为智能体技能生态建立统一系统基础与参考架构,界定其九阶段生命周期,探讨安全威胁与防御机制,分类多领域系统实现,确立智能体技能为自主语言智能体的基础范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30165 2026-09-01 q-bio.QM cs.AI 新提交 84%

Science sandboxes measure the scientific capability of AI agents

科学沙箱可衡量AI智能体的科学能力

Arya S. Rao, Rodrigo I. Castro, Sager J. Gosai, Kenneth B. Hsu, Yasha Ektefaie, Shantanu Singh, Sangeeta N. Bhatia, Steven K. Reilly, Ryan Tewhey, Eric S. Lander, Pardis C. Sabeti

专题命中 规划决策 :AI agent(title,abstract);agent(abstract,comments);分类 cs.AI

AI总结 研究人员提出科学沙箱框架,在调控基因组学和蛋白质适应性预测场景中评估前沿AI智能体的科学能力,发现其常不理解系统规则却能优化指标,该框架可衡量科学能力前沿并提供研究环境。

Comments 72 pages, 5 main figures, 3 tables, and 5 supplementary figures; includes supplementary agent instructions and harness

详情

展开后加载摘要…

URL PDF HTML 收藏