arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 257 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 257 篇

2602.10230 2026-07-24 cs.LG cs.SD eess.AS 版本更新 79%

Encode Once, Decode Never: Reusing Audio LM Internals for Efficient Temporal Localization

帧级内部工具使用用于音频语言模型中的时序定位

Joseph An, Phillip Keung, Jiaqi Wang, Orevaoghene Ahia, Noah A. Smith

专题命中 工具调用 :tool use(title,abstract);分类 cs.LG

AI总结 本文提出帧级内部工具使用方法,通过二元分类器和IHP损失提升音频语言模型的时序定位能力,实现50倍加速和鲁棒长度泛化。

Comments To appear in COLM 2026. Refer to https://github.com/inkitori/taudio/ for the codebase

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18939 2026-07-15 cs.CL 版本更新 79%

Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search

迷失在迷宫中:克服长期智能体搜索中的上下文限制

Howard Yen, Yoonsang Lee, Ashwin Paranjape, Mengzhou Xia, Thejas Venkatesh, Jack Hessel, Danqi Chen, Yuhao Zhang

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 研究长期智能体搜索中因上下文限制难以扩展的问题,提出SLIM框架,该框架分离检索工具并定期总结轨迹,在多任务中以低成本和少调用实现可比性能,还减少幻觉,为未来长期智能体提供参考。

Comments COLM 2026; Code and data are available here: https://github.com/howard-yen/SLIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17848 2026-07-14 cs.CR cs.SE 版本更新 79%

RISKTAGGER: Evidence-Guided LLM Agent for Post-Incident Forensic Analysis of Money Laundering in Web3

RISKTAGGER:用于Web3中洗钱事件后法医分析的证据引导大语言模型智能体

Dan Lin, Yanli Ding, Weipeng Zou, Jiajing Wu, Zhiyin Wu, Jiachi Chen, Xiapu Luo, Zibin Zheng

专题命中 工具调用 :agent(title,abstract);分类 cs.SE

AI总结 针对Web3加密货币洗钱法医分析面临的挑战,提出RISKTAGGER,将大语言模型作为证据约束决策组件,从公共事件材料提取线索,递归扩展资金流图并生成报告。经多案例评估,能恢复资金路径、识别风险账户,组织证据成可验证报告。

Comments 11 pages(main text), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11430 2026-07-02 cs.CR cs.AI cs.CY 版本更新 79%

Hardening x402: PII-Safe Agentic Payments via Pre-Execution Metadata Filtering

x402协议的强化:通过预执行元数据过滤实现隐私信息安全的代理支付

Vladimir Stantchev

机构 * SRH University Heidelberg(SRH海德堡大学) PRESIDIO Group(PRESIDIO集团)

专题命中 工具调用 :agentic(title);AI agent(abstract);分类 cs.AI

AI总结 本文提出presidio-hardened-x402,通过拦截x402支付请求检测并屏蔽个人身份信息,同时执行支出政策和阻止重复支付。实验表明其在精度和召回率上表现优异,且延迟符合预算要求。

Comments 2: corrected NLP-mode precision/recall after a recogniser fix that lifts the US_SSN and PHONE detection v1 understated, and revised the recommended threshold to min_score=0.5 (the curve is flat, not peaked). Section 5 tables, the threshold analysis, and Figures 1-2 are updated; headline micro-F1 = 0.898

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18897 2026-06-17 cs.DC cs.AI 版本更新 79%

Parallelizing Tool Execution and LLM Generation for Low-Latency Agent Serving

并行化工具执行与LLM生成以实现低延迟代理服务

Yifan Sui, Han Zhao, Rui Ma, Zhiyuan He, Hao Wang, Jianxun Li, Kaiqiang Xu, Kai Chen, Yuqing Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Microsoft Research(微软研究院) Stevens Institute of Technology(Stevens 工程学院) Google(谷歌) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 工具调用 :agent(title,abstract);分类 cs.AI

AI总结 提出PASTE系统,通过预测性执行未来工具调用与LLM生成并行,减少任务完成时间43.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03505 2026-06-16 cs.SE 版本更新 79%

LATS-RCA: Language Agent Tree Search for Root Cause Analysis in Microservices

LATS-RCA:面向微服务根因分析的语言智能体树搜索

Alexander Naakka, Yuqing Wang, Mika V Mäntylä

专题命中 工具调用 :agent(title,abstract);分类 cs.SE

AI总结 提出LATS-RCA方法,将根因分析建模为反射引导的树结构搜索,通过多智能体迭代分析日志和指标,在微服务系统中实现91.3%的诊断准确率,并验证了模型无关性。

Comments Accepted at the 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17431 2026-06-16 cs.CL 版本更新 79%

Agentic Reinforcement Learning for Search Misaligns Instruction-Tuning

用于搜索的智能体强化学习使指令微调对齐失效

Yushi Yang, Shreyansh Padarha, Sarah Ball, Andrew Lee, Adam Mahdi

机构 * University of Oxford(牛津大学) Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) Harvard University(哈佛大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.CL

AI总结 研究智能体强化学习(RL)对指令微调模型对齐的影响,发现RL训练使模型将有害请求转化为良性搜索查询,但在触发条件下产生多步不安全搜索行为,并提出了基于表示引导的RL训练方法恢复对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05860 2026-06-12 cs.LG 版本更新 79%

GenAutoML: An Agentic Framework for Dynamic Architecture Generation and Optimization in Time-Series Analysis

GenAutoML: 面向时间序列分析的动态架构生成与优化的智能体框架

Oleeviya Babu Poikarayil, Cédric Schockaert, Abdulrahman Nahhas, Christian Daase, Mursal Dawodi, Jawid Ahmad Baktash

机构 * Paul Wurth S.A.(保罗·沃思公司) Otto-von-Guericke University(奥托·冯·格里克大学) Technical University of Munich(慕尼黑技术大学)

专题命中 工具调用 :agentic(title,abstract);分类 cs.LG

AI总结 提出GenAutoML框架,利用大语言模型作为神经架构师,通过沙盒反射循环和签名感知运行时自动生成并优化时间序列预测与异常检测的神经网络架构,引入动态可逆实例归一化提升非平稳条件下的鲁棒性。

Comments 26 pages, 17 figures, 12 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14893 2026-07-16 cs.RO 版本更新 78%

STITCHER: Constrained Trajectory Planning in Complex Environments with Real-Time Motion Primitive Search

STITCHER:通过实时运动原语搜索在复杂环境中进行约束轨迹规划

Helene J. Levy, Brett T. Lopez

机构 * VECTR Laboratory, University of California, Los Angeles(VECTR实验室,加州大学洛杉矶分校)

专题命中 工具调用 :planning(title,abstract)

AI总结 研究针对自主高速穿越复杂环境的轨迹规划问题,提出无优化规划框架STITCHER,通过拼接短轨迹段和图搜索实时计算轨迹,经模拟与硬件测试验证其性能优越,能满足多种约束并高速实时规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14215 2026-07-09 cs.CY 版本更新 78%

Safety Degradation in AI Agents

人工智能代理中的安全退化

Cheng Yu, Benedikt Stroebl, Diyi Yang, Orestis Papakyriakopoulos

专题命中 工具调用 :AI agent(title,abstract)

AI总结 研究人工智能代理安全问题,通过对审查和未审查的语言模型及人工智能代理广泛基准测试,发现随着检索访问扩展,模型出现安全退化现象,基于对齐语言模型构建的支持检索的代理更不安全,强调需缓解策略确保其公平性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18414 2026-08-11 cs.CR cs.AI 版本更新 77%

Prompts Don't Protect: Architectural Enforcement via MCP Proxy for LLM Tool Access Control

提示不保护:通过MCP代理实现的架构强制以实现LLM工具访问控制

Rohith Uppala

机构 * Independent Researcher(独立研究员)

专题命中 工具调用 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种受控的MCP代理,通过在工具发现和工具调用两个阶段实施基于属性的访问控制(ABAC),有效阻止了未经授权的工具调用,而提示基于的限制仅能减少11-18个百分点的未授权调用率,证明了架构强制在部署的智能体系统中实现可靠工具访问控制的必要性。

Comments 7 pages, 4 tables, 2 figures. Revised version with 200 adversarial tasks and expanded limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07223 2026-08-11 cs.CR cs.AI cs.CL cs.LG cs.SE 版本更新 77%

TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories

TraceSafe: 对LLM在多步骤工具调用轨迹上的安全护栏的系统评估

Yen-Shan Chen, Sian-Yao Huang, Cheng-Lin Yang, Yun-Nung Chen

机构 * CyCraft AI Lab, Taiwan(CyCraft AI实验室(台湾)) National Taiwan University(国立台湾大学)

专题命中 工具调用 :autonomous agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出TraceSafe-Bench,首个评估中间轨迹安全的综合基准,发现安全护栏效果更依赖结构数据能力而非语义安全对齐,通用模型在轨迹分析中表现更优,且准确性随执行步骤增加而提升。

Comments Accepted to Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00737 2026-08-07 cs.AI 版本更新 77%

To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling

调用还是不调用:评估和优化LLM工具调用的框架

Qinyuan Wu, Soumi Das, Mahsa Amani, Arijit Nag, Seungeon Lee, Krishna P. Gummadi, Abhilasha Ravichander, Muhammad Bilal Zafar

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Ruhr University Bochum(博德姆鲁尔大学) UAR RC Trust(UAR RC信托)

专题命中 工具调用 :tool use(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 提出一个基于决策理论的框架,从必要性、效用和可负担性三个关键因素评估LLM的网页搜索工具调用决策,并训练轻量级估计器优化调用,提升任务性能。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09421 2026-07-20 cs.CL 版本更新 77%

What Should a Skill Remember? Quality--Cost Trade-offs in Cost-Aware Skill Rewriting for Language Model Agents

技能应记住什么?语言模型代理中成本感知技能重写的质量-成本权衡

Qinghua Xing, Yinda Chen, Yaping Jin, Zhenhe Wu, Bohan Lin, Hang Zhou, Xinghao Chen, Hanting Chen, Zhiwei Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies(华为技术有限公司) Tianjin University(天津大学)

专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract);分类 cs.CL

AI总结 研究语言模型代理中技能重写的质量-成本权衡,提出信息保留策略,在SkillsBench上实现成本降低7%-14.7%且保持验证质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01143 2026-07-14 cs.AI 版本更新 77%

A Low-Latency Fraud Detection Layer for Detecting Adversarial Interaction Patterns in LLM-Powered Agents

面向LLM代理的低延迟欺诈检测层:用于检测对抗性交互模式

Sheldon Yu, Yingcheng Sun, Hanqing Guo, Qianqian Tong

机构 * University of California, San Diego(加州大学圣地亚哥分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 工具调用 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出一种低延迟欺诈检测机制,通过交互轨迹的结构化运行时特征检测对抗性交互模式,采用轻量模型实现实时部署,实验表明交互层面行为检测应成为LLM代理部署时的核心防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23132 2026-06-25 cs.CR cs.AI 版本更新 77%

Verifiable Manifest Signing and Transparency Enforcement for Secure MCP-Based LLM Pipelines

可验证的清单签名与透明度强制:面向基于MCP的安全LLM流水线

Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel, Foutse Khomh, Mohammad Hamdaqa

机构 * SWAT Laboratory, Polytechnique Montréal(SWAT实验室,蒙特利尔理工学院) SæT Laboratory, Polytechnique Montréal(SæT实验室,蒙特利尔理工学院)

专题命中 工具调用 :agent(abstract);tool-use(abstract);multi-agent(abstract);分类 cs.AI

AI总结 针对MCP协议缺乏工具清单认证的问题,提出清单级强制层,通过策略验证、新鲜度检查、数字签名、执行前验证和Merkle透明度日志,实现低开销、可追溯的LLM工具调用安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00135 2026-08-12 cs.LG cs.AI 版本更新 76%

On Effectiveness and Efficiency of Agentic Tool-calling and RL Training

论智能体工具调用与强化学习训练的有效性与效率

Tong Liu, Cheng Qian, Matej Cief, Yuan He, Daniele Dan, Nikolaos Aletras, Gabriella Kazai

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 工具调用 :agentic(title);分类 cs.AI、cs.LG

AI总结 本文系统分析工具调用评估中的实现选择对结果敏感性的影响,并针对强化学习训练中的计算浪费提出两种加速技术。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01549 2026-07-21 cs.CL cs.SE 版本更新 76%

Octopus: On-device language model for function calling of software APIs

章鱼:用于软件API函数调用的设备端语言模型

Wei Chen, Zhiyuan Li, Mingyuan Ma

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 工具调用 :function calling(title);分类 cs.CL、cs.SE

AI总结 研究利用设备端大语言模型调用软件API,通过编译数据集微调不同参数模型,提升其API交互能力,提出条件掩码技术和新基准,经微调的Octopus模型在API调用上性能超GPT-4,推动自动化软件开发和API集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13653 2026-07-28 cs.CV cs.RO 版本更新 75%

Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation

探索性、交流性和可部署性:用于开放世界移动操作的视觉驱动具身智能体

Boyu Mi, Mengchen Ma, Yifei Yao, Xing Gao, Junting Chen, Yangzi Li, Zihou Zhu, Guohao Li, Zhenfei Yin, Tai Wang, Yao Mu, Jiangmiao Pang, Hanqing Wang

专题命中 工具调用 :agent(abstract);tool-use(abstract);agentic(abstract)

AI总结 研究针对具身智能体现实部署难题,提出REAL框架,通过建立一致环境API、设计任务组合优化性能,引入REAL - Bench评估。实验显示其智能体在交互式任务中表现出色,在物理机器人上也实现高成功率,弥合现实差距。

Comments Accepted to ECCV 2026. 57 pages. Code available at https://github.com/InternRobotics/REAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20755 2026-06-12 eess.AS 版本更新 75%

DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action

DuplexSLA: 一种具备同步语音、语言和动作的全双工语音语言模型

Haoyang Zhang, Jun Chen, Donghang Wu, Yuxin Li, Yuxin Zhang, Xiangyu Tony Zhang, Che Liu, Qingjian Lin, Yizhou Peng, Hexin Liu, Eng Siong Chng, Chao Yan, Boyong Wu, Yechang Huang, Xuerui Yang, Fei Tian

专题命中 工具调用 :tool use(abstract);planning(abstract);agentic(abstract)

AI总结 本研究提出DuplexSLA,一种全双工语音语言模型,通过共享160ms时间线解码助理音频和结构化动作流,实现了同步语音、语言和动作的处理,解决了现有全双工模型在对话中规划和工具调用方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00225 2026-06-08 cs.LG cs.AI cs.CL 版本更新 75%

Should You Use Your Large Language Model to Explore or Exploit?

你应该使用你的大语言模型进行探索还是利用?

Keegan Harris, Aleksandrs Slivkins

机构 * UC Berkeley(伯克利大学) Microsoft Research(微软研究院)

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究当前大语言模型在探索-利用权衡中的决策能力,通过分离探索和利用任务评估其表现,发现推理模型在利用任务上最有潜力但成本高,非推理模型通过工具使用和上下文总结可提升中等难度任务性能,但在所有任务中均不如简单线性回归,然而LLM在具有语义的大动作空间探索中有帮助。

Comments Accepted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02376 2026-08-07 cs.DB cs.CL cs.IR 版本更新 74%

Token-Native Storage: Read and Write in your Agent's Language

令牌原生存储:以智能体的语言进行读写

Kumar Shivendu

专题命中 工具调用 :agent(title);分类 cs.CL

AI总结 本文提出令牌原生存储思路,将文本以模型的BPE令牌ID保存,压缩比和读写速度均优于UTF-8等字节编码,呼吁AI实验室标准化令牌化器以推进该方案。

Comments 12 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24636 2026-07-02 cs.CL 版本更新 74%

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

OpenReward: 通过强化学习学习奖励长形式智能体任务

Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

机构 * Leiden University(莱顿大学) Shandong University(山东大学) Tsinghua University(清华大学)

专题命中 工具调用 :agentic(title);分类 cs.CL

AI总结 提出OpenRM,一种工具增强的长形式奖励模型,通过GRPO训练联合监督工具使用和结果准确性,在长形式任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19218 2026-06-10 cs.SE cs.MA 版本更新 74%

Gecko: A Simulation Environment with Stateful Feedback for Refining Agent Tool Calls

Gecko: 一种具有状态反馈的仿真环境,用于优化智能体工具调用

Zeyu Zhang, Guohao Li, Zhenchang Xing, Alexandros Apostolopoulos, Yu Lin Lee, Liang Zheng

专题命中 工具调用 :agent(title);分类 cs.SE

AI总结 提出Gecko仿真环境,通过规则与LLM结合提供工具名称/参数验证、模式一致响应合成和任务完成判断三类反馈,形成GATS方法,在BFCLv3和τ²-bench上显著提升LLM工具调用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16399 2026-08-14 cs.SE cs.AI 版本更新 73%

IACDM: Interactive Adversarial Convergence Development Methodology -- A Structured Framework for AI-Assisted Software Development

IACDM:交互对抗收敛开发方法论——面向AI辅助软件开发的结构化框架

Jasmine Moreira

专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI、cs.SE

AI总结 本文提出IACDM方法论,通过外部验证代理解决AI生成应用中的验证缺口问题,强调通过层次语义分析、知识管理及系统对抗批评提升软件开发质量。

Comments 37 pages, 7 tables. Technical Foundation Document. v3 adds a pre-registered experiment testing lens non-redundancy over 12 projects, and withdraws the retrospective analysis of v1-v2 (defective instrument). Data: https://doi.org/10.5281/zenodo.21908908 Repo: https://github.com/jasminemoreira/Versus

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22651 2026-08-14 cs.LG cs.AI cs.CE cs.MA 版本更新 73%

Automated Design Optimization via Strategic Search with Large Language Models

通过大语言模型的战略搜索实现自动化设计优化

Anthony Carreon, Vansh Sharma, Venkat Raman

专题命中 工具调用 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出AUTO框架,利用大语言模型的战略搜索实现GPU代码优化,提升搜索效率并降低成本。

Comments 16 pages, 4 tables, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02751 2026-08-06 cs.IR cs.AI cs.CL 版本更新 73%

Search, Inspect, Fetch: Exploiting Structure-Aware Boolean Retrieval for Deep-Research Agents

搜索、检查、获取:利用布尔检索构建深度研究智能体

Shuai Wang, Haodong Chen, Yu Yin, Shengyao Zhuang, Bevan Koopman, Guido Zuccon

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对现有深度研究智能体的缺陷,提出基于BQL的SIEVE接口,在三个问答数据集上实现更高准确率且token用量显著减少,验证了BQL过滤的有效性。

Comments added statistical test, restructure appendix etc

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10226 2026-08-04 cs.LG cs.AI 版本更新 73%

Self-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM Agents

自进化推荐系统:基于LLM代理的端到端自主模型优化

Haochen Wang, Yi Wu, Daryl Chang, Li Wei, Lukasz Heldt

机构 * Google Inc(谷歌公司)

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于LLM代理的自进化推荐系统,通过端到端自动化流程自主优化模型,提升开发效率和性能。

Comments RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16387 2026-07-30 cs.SE cs.AI 版本更新 73%

Fantastic Adaptive Taxonomies and How to Use Them

奇妙的自适应分类法及其使用方法

Mert Cemri, Andrei Cojocaru, Melissa Pan, Shu Liu, Shubham Agarwal, Alexander Krentsel, Jay Tang, Kannan Ramchandran, Joseph E. Gonzalez, Matei Zaharia, Alex Dimakis, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) Apple(苹果公司) Bespoke Labs(Bespoke实验室)

专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究智能体系统失败反馈问题,提出AdaMAST方法将轨迹转换为自适应失败分类法,该分类法能作为共享反馈接口,在智能体系统搜索、运行时及轨迹选择等方面改进智能体,提升准确率和分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24743 2026-07-29 cs.CV cs.AI cs.CL 版本更新 73%

ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding

ClinFusion:用于整体医学理解的以视觉为中心的多模态大语言模型系统

Hangjie Yuan, Yichen Qian, Zhiwei Tang, Xianzhe Xu, Lirong Wu, Sicheng Yang, Jinwang Wang, Pengju Wang, Zhitao Zeng, Yizeng Han, Yan Xing, Shengxuan Luo, Tao Feng, Qing Xie, Weigen Yao, Yi Yang, Zuozhu Liu, Jiasheng Tang, Shaocheng Wang, Jitao Wang, Jiahong Dong, Weihua Chen, Feng Xu, Fan Wang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Laboratory(湖畔实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Radiology, The Affiliated Yangming Hospital of Ningbo University(宁波大学附属阳明医院放射科) Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University(浙江大学伊利诺伊大学厄巴纳香槟校区联合学院,浙江大学) Hepato-Pancreato-Biliary Center, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua Medicine, Tsinghua University(清华长庚医院肝胆胰中心,清华大学临床医学院,清华医学,清华大学) School of Software, Tsinghua University(清华大学软件学院) Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究针对多模态大语言模型在医学领域部署的挑战,提出ClinFusion,采用组合级联视觉编码器架构和视觉基础评估框架,在多模态医学基准测试中表现优异,超越开源和专有模型,经专家盲评验证效果良好。

Comments Code: https://github.com/alibaba-damo-academy/ClinFusion Models: https://huggingface.co/collections/Alibaba-DAMO-Academy/clinfusion

详情

展开后加载摘要…

URL PDF HTML 收藏