arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6842 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1187 篇

2607.27556 2026-07-31 cs.AI cs.MA 新提交 87%

Evaluating Agentic Bioinformatics through Function, Evidence, and Validation

通过功能、证据和验证评估智能体生物信息学

Phuc Pham, Truong-Son Hy

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);workflow(abstract)

AI总结 该研究提出FEV框架评估智能体生物信息学,梳理多领域128篇文献后发现规划等进展快于科学验证相关环节,主张应基于工作流正确性评估这类系统

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04240 2026-07-07 cs.AI q-bio.CB 新提交 87%

Biological Motifs for Agentic Control

用于智能体控制的生物基序

Bogdan Banu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 研究大语言模型向自主智能体转变带来的可靠性等挑战,通过基因调控网络与智能体软件系统的类型化接口对应,映射生物基序到软件设计模式,给出智能体操作数等核心贡献并具实践可行性。

Comments 80 pages. Preprint; feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26519 2026-06-29 cs.AI 新提交 87%

What the LLM Should Not Say: Boundary-Aware Context Grounding for A Seven-Channel EEG Agent

面向低通道EEG智能体的边界感知上下文接地

Zhiyuan Xu, Yueqing Dai, Junling Li, Junwen Luo

机构 * Shanghai Pulse Element Intelligent Technology Co., Ltd. (NeuraDock)(上海脉冲元素智能科技有限公司(NeuraDock))

专题命中 Agent评测 :agent(title,summary_cn);分类 cs.AI

AI总结 提出NeuraDock Agent架构,通过分离确定性本地EEG引擎与硬件感知语言层,实现LLM对低通道EEG数据的边界感知接地,经288次测试验证了系统在数值重复性、故障恢复和边界感知方面的有效性。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20630 2026-06-23 cs.HC cs.AI cs.CY 新提交 87%

Design Principles for Human-Agent Interaction

人-智能体交互的设计原则

Haiyi Zhu, Canwen Wang, Qing Xiao, Hong Shen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);tool use(abstract);agentic(abstract)

AI总结 本文提出14条设计原则,涵盖初始、交互、长期和故障四个阶段,以指导设计可用、可信且有效的人-智能体交互系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14769 2026-06-16 econ.EM cs.AI cs.GT 新提交 87%

Agentomics: Economic Foundations for the Valuation, Attribution, and Pricing of AI Agents in Human-AI Workflows

Agentomics:人机协作工作流中AI代理的估值、归因和定价的经济基础

Quanyan Zhu

机构 * Department of Electrical and Computer Engineering, NYU Tandon School of Engineering(纽约大学Tandon工程学院电气与计算机工程系)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);workflow(abstract);agentic(abstract)

AI总结 提出Agentomics框架,基于工作流模型将AI部署视为联盟形成问题,使用Shapley值进行经济盈余归因,实现AI代理的估值、归因和定价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19245 2026-06-19 cs.AI cs.LG 新提交 87%

TxBench-PP: Analyzing AI Agent Performance on Small-Molecule Preclinical Pharmacology

TxBench-PP:分析AI代理在小分子临床前药理学中的表现

Hannah Le, Ramesh Ramasamy, Alex Urrutia, Mahsa Yazdani, Tim Proctor, Kenny Workman

机构 * LatchBio

专题命中 Agent评测 :agent(title);AI agent(title);workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出TxBench-PP基准,用于评估AI代理从真实实验数据中恢复临床前药理学结论的能力,测试显示最强配置Claude Opus 4.8 / Pi仅通过59.3%的端点尝试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14815 2026-08-18 cs.HC 新提交 87%

AI Agents and the Future of VIS

AI智能体与可视化(VIS)的未来

Chen Zhu-Tian, Nam Wook Kim, Saeed Boorboor, Shivam Raval, Pan Hao, Qianwen Wang, Vidya Setlur

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 该研讨会聚焦AI智能体与VIS领域的融合,探讨自主智能体对VIS的影响、人机协作等关键问题,邀请相关人员分享思路以推动VIS在人机共存未来的发展。

Comments workshop proposal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19865 2026-07-23 cs.AI cs.CL cs.LG 新提交 87%

DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

DocOps:复杂文档操作中自主智能体的可验证基准

Jiazhen Jiang, Boxi Cao, Lingyong Yan, Yaojie Lu, Hongyu Lin, Shuaiqiang Wang, Dawei Yin, Xianpei Han, Le Sun

专题命中 Agent评测 :autonomous agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究自主智能体处理数字文档的能力,引入DocOps评估框架,解构文档操作,评估多种模型,发现其局限性及关键失败模式,揭示能力边界,为健壮无损智能体设计提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14667 2026-08-18 cs.AI cs.HC 新提交 86%

Position: AI Agents in Scientific Teams Should Be Studied as Human-Agent Systems

立场:科学团队中的智能体应作为人机系统(HAS)进行研究

Patrick Emami, Sameera Horawalavithana, Truc Nguyen, Gihan Panapitiya, Bruno Jacob, Siddhisanket Raskar, Saumya Sinha, Jared D. Willard, Andrew Glaws, Nithin Somasekharan, Ling Yue, Brian Lu, Shaowu Pan, Jason Eisner

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 针对当前AI科学家研究忽视科学团队社会层面的问题,提出将其作为人机系统(HAS)研究,分析相关风险并呼吁开发人机协同数学框架。

Comments 15 pages. Accepted at the COLM 2nd Workshop on Language Models for Scientific Discovery

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25921 2026-07-29 cs.CV cs.AI 新提交 86%

Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA

评估用于视频游戏QA中自主代理驱动的几何裁剪检测的视觉语言模型

Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman

机构 * Sony Interactive Entertainment(索尼互动娱乐)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title);分类 cs.AI

AI总结 研究在代理驱动游戏QA中用VLMs检测几何裁剪异常,通过自定义代理收集视觉观察,自动注释提供标签,在零样本提示下对六个VLMs基准测试,分析对提示变体的敏感性,结果显示VLMs适合作多阶段QA管道的高召回候选过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22368 2026-07-27 cs.AI 新提交 86%

Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI

智能体基准测试能衡量能力吗?智能体人工智能时代的协议有效性

Jiaqi Shao, Hanck Chen, Wei Zhang, Maxm Pan, Bing Luo

机构 * Tencent(腾讯) The Hong Kong University of Science and Technology(香港科技大学) Duke Kunshan University(昆山杜克大学)

专题命中 Agent评测 :agent(title,abstract);agentic(title);分类 cs.AI

AI总结 研究智能体基准测试分数能否衡量能力,提出协议有效性概念及HackDetect事后审计方法,通过审计多基准测试轨迹发现暴露和奖励破解证据,量化分数膨胀,强调基准测试报告应证明分数反映预期能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14264 2026-07-17 cs.CV cs.CL 新提交 86%

MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation

MonteRET:通过多粒度知识检索增强多模态大语言模型以生成胸部CT报告的人工智能代理

Yi Lin, Yihao Ding, Elana Benishay, Elefterios Trikantzopoulos, David Nauheim, Hanley Ong, Jiang Bian, Hua Xu, Yuzhe Yang, George Shih, Yifan Peng

机构 * Weill Cornell Medicine(威尔康乃尔医学院) University of Western Australia(西澳大利亚大学) Indiana University(印第安纳大学) Regenstrief Institute(瑞根斯特里夫研究所) Yale University(耶鲁大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.CL

AI总结 研究针对自动生成胸部CT报告的挑战,提出MonteRET框架,它整合多种特征,通过知识检索和报告重写代理完善报告。经训练和评估,该框架在多方面提升了报告质量,相比其他方法有显著优势,获放射科住院医师青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14680 2026-08-18 cs.AI cs.SE 新提交 86%

When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry

当智能体执行失败时:从遥测数据中检测和定位运行时故障

Chenkai Zhang, Yiran Li, Yifang Tian, Michalis Bachras, Hans-Arno Jacobsen

机构 * University of Toronto(多伦多大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.SE

AI总结 该研究提出 AGENTCHAOSBENCH 基准,在智能体系统遥测数据中检测定位运行时故障,实验显示现有 LLM 基线对该任务的解决效果仍远未达标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06020 2026-08-07 cs.AI cs.LG 新提交 86%

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

从经济智能体到智能体经济:经济世界模型的系统蓝图

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

机构 * Shenzhen Loop Area Institute(深圳河套学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);planning(abstract)

AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。

Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02712 2026-08-05 cs.SE cs.AI 新提交 86%

Don't Regenerate, Debug: A Domain-Specific Agent for Repairing Near-Miss Hardware Operators

不要重新生成,要调试:一种用于修复近失配硬件算子的领域特定智能体

Yansong Sun, Shenxiu Wu, Siyuan Chen, Runlin Hou, Junhao Qiu, Junming Cao, Shudi Shao, Zhichao Lu, Qingfu Zhang

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出领域特定调试智能体,通过调试而非重新生成修复硬件近失配算子,其调试Pass@1准确率更高、token消耗更少,可拓展能力边界并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25485 2026-07-29 cs.AI cs.CL 新提交 86%

PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

PatientAgentBench:一个用于评估面向患者的健康人工智能代理的基准框架

Korosh Vatanparvar, Ashutosh Joshi, Maria Xenochristou, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Daniel Lopez-Martinez, Anchal Nema, Ramya Ganesan, Will Kimbrough, Alex Woody, Yadunandana Rao, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康人工智能)

专题命中 Agent评测 :AI agent(title);agent(abstract);workflow(abstract);agentic(abstract)

AI总结 研究面向患者的健康人工智能代理评估问题,核心方法是用PatientAgentBench框架,通过语言模型评审团在多维度评估,主要贡献是发现模型临床差距,发布可重复、经临床医生验证的评估标准助领域弥补差距。

Comments Code: https://github.com/amazon-science/PatientAgentBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18366 2026-07-22 cs.AI cs.CL cs.CY 新提交 86%

Operational Hallucination and Safety Drift in AI Agents

人工智能代理中的操作幻觉与安全漂移

Shasha Yu, Fiona Carroll, Barry L. Bentley

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 研究大型语言模型在多轮执行中引发的可靠性风险,通过多轮评估量化安全漂移和操作幻觉现象,分析其根源,提出行动感知监督层,该层能拦截违规行为且无良性误报,提升了代理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11399 2026-07-14 cs.CL cs.AI 新提交 86%

Agentic Routing: The Harness-Native Data Flywheel

智能体路由:原生执行框架的数据飞轮

Xinchen Liu, Hang Zhou, Yingjie Zong, Yuchuan Tian, Liuyang Song, Shuo Zhang, Yulong Li, Wei He, Mengyu Zheng, Runke Liu, Siyang Cheng, Xiang Kuang, Hailin Hu, Kai Han, Yunhe Wang

机构 * TokenRhythm Technologies(TokenRhythm科技公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 研究大型语言模型智能体中模型选择问题,提出原生执行框架智能体路由范式,依执行框架状态选模型,其决策产生的数据记录形成数据飞轮,经实例化验证,表明该路由不仅控成本,更是智能体训练的数据引擎。

Comments Code: https://github.com/opensquilla/opensquilla

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16000 2026-06-18 cs.CL cs.LG 新提交 86%

GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science

GRACE-DS:数据科学中的受保护奖励引导智能体修正环境

Aleksandr Tsymbalov, Danis Zaripov, Artem Epifanov, Anastasiya Palienko

机构 * ITMO University(ITMO大学) HSE University(高等经济学院)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);workflow(abstract);分类 cs.CL、cs.LG

AI总结 提出GRACE-DS,一个用于评估LLM驱动的AutoML智能体在部署前性能的隔离环境,通过隐藏的可执行验证器衡量预测性能、泄漏避免、可重复性等指标,实验证明其灵活迭代交互模式优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15899 2026-06-16 cs.CR cs.AI cs.HC cs.LG cs.MA 新提交 86%

SkillVetBench: LLM-as-Judge for Multi-Dimensional Security Risk Evaluation in Open-Source LLM Agent Skills

SkillVetBench: 基于LLM评判的多维安全风险评估开源LLM智能体技能

Ismail Hossain, Sai Puppala, Md Jahangir Alam, Tanzim Ahad, Sajedul Talukder

机构 * SUPREME Lab, University of Texas at El Paso, Texas, USA(SUPREME实验室,德克萨斯理工大学埃尔帕索分校,德克萨斯州,美国)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 提出SkillVetBench,利用LLM作为评判器对开源LLM智能体技能进行多维安全风险评估,引入五维技能智能体风险评分(SARS)和CVSS v4.0向量分解,在78个恶意技能上实现零假阴性,22个良性技能上零假阳性。

Comments The main research paper is submitted to NeurIPS 2027, it is in under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13994 2026-06-15 cs.CR cs.AI cs.LG 新提交 86%

Hidden in Plain Sight: Benchmarking Agent Safety Against Decomposition Attacks with DECOMPBENCH

隐于无形:使用DECOMPBENCH基准测试代理安全对抗分解攻击

Vikhyath Kothamasu, Virginia Smith, Chhavi Yadav

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出DeCompBench基准,通过分解攻击将有害任务拆分为良性子任务,揭示现有代理安全机制在对抗分解攻击时的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11166 2026-08-12 cs.SE 新提交 86%

Agentic Configuration Management (ACM): A Reference Configuration Model for Governed Agentic Systems

智能体配置管理(ACM):受管控智能体系统的参考配置模型

Audrey Quessada-Vial

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract,abstract_cn);分类 cs.SE

AI总结 本文提出与框架无关的智能体配置管理(ACM)模型,经实验验证可实现异构智能体系统的管控等价表示,支持可复现性、可审计性等,适配LangGraph等主流框架。

Comments 77 pages, 12 figures, 17 tables. Includes formal appendices and experimental evaluation across LangGraph, CrewAI, and the OpenAI Agents SDK. Reference implementation and evaluation artifacts: https://github.com/audreyqvial/ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20394 2026-06-19 cs.RO math.OC 新提交 86%

Agentic AutoResearch forSpace Autonomy: An Auditable, LLM-Driven Research Agent for Aerospace Control Problems

面向空间自主性的智能体自动研究:用于航空航天控制问题的可审计、LLM驱动的研究代理

Amit Jain, Richard Linares

机构 * Department of Aeronautics and Astronautics(航空航天学系)

专题命中 Agent评测 :agent(title,abstract);agentic(title)

AI总结 提出AutoResearch框架,利用大语言模型作为离线研究代理,自动迭代开发航天控制策略,并通过内置可信层审计结果,消除种子噪声影响,在交会和对接问题上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18099 2026-08-20 cs.AI q-fin.PM 新提交 85%

FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management

FinSkillBench:评估用于投资管理的智能体AI与领域技能

Jermyn Zhen Yong Bek, Zhuang Qiang Bok, Zhongtian Sun

机构 * Deep Insight Labs(深洞察实验室) University of Kent(肯特大学) University of Cambridge(剑桥大学)

专题命中 Agent评测 :AI agent(title);agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI

AI总结 FinSkillBench是评估投资管理领域AI智能体金融技能的基准,经9个模型的大规模评估发现,精选技能可显著提升性能,而自生成技能益处有限,其成果为该领域研究提供了支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17597 2026-08-19 cs.CR cs.AI 新提交 85%

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety

HarnessRisk:面向生命周期的智能体管控安全基准

Yajing Bai, Jinhao Duan, Jie Peng, Xianfeng Wu, Sijia Liu, Song Wang, Tianlong Chen

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 研究提出面向生命周期的智能体管控安全基准HarnessRisk,含128个沙箱案例,评估多模型与管控配置的安全表现,发现管控配置阶段最易受攻击,明确风险识别未必带来安全行动,凸显多维度评估智能体安全的必要性。

Comments Project Page: https://baiyajing.github.io/harness-risk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07965 2026-08-11 cs.AI 新提交 85%

CyberAGENTS: Structured Autonomy for Agentic Gamified Learning in Cybersecurity

CyberAGENTS:面向网络安全领域智能体游戏化学习的结构化自主机制

Ivan Hornung, Deepthi Marasinghe Arachchige, Tharindu Kumarage, Garima Agrawal, Yuli Deng, Ying-Chih Chen, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Amazon AGI(亚马逊AGI)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本研究提出CyberAGENTS框架,通过结构化自主机制实现游戏化网络安全学习,经课堂评估验证其可提升学习者参与度与对AI响应的信任度,为相关系统设计提供蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05573 2026-08-07 cs.AI 新提交 85%

SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution

SkillTV-Bench:评估评判者在技能增强型智能体执行任务中的表现

Zhi Han, Chenxi Zeng, Liuhaichen Yang, Zihan Guo, Ming Zhou, Yang Li

专题命中 Agent评测 :agentic(title);agent(abstract,abstract_cn);tool use(abstract);分类 cs.AI

AI总结 SkillTV-Bench是含681个案例的智能体轨迹基准,用于评估技能感知轨迹验证;提出SkillTV-Evolve优化JudgeSkill,使智能体评判者准确率提升14.8个百分点,选定轨迹成功率大幅提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02657 2026-08-05 cs.CR cs.AI 新提交 85%

Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure

你的智能体大模型会秘密编码间接提示注入暴露的潜在信号

Jianshuo Dong, Yiming Liu, Maosen Zhang, Nan Deng, Xu Peng, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02470 2026-08-04 cs.CV cs.AI 新提交 85%

Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment

基于专用分割模型实现具身智能视觉语言模型(Agentic VLMs)的细粒度车辆损伤评估

Vishwajeet Shivaji Hogale, Anjali Pai, Nitya Ravi

机构 * Northeastern University(东北大学)

专题命中 Agent评测 :agentic(title,title_cn);agent(abstract);分类 cs.AI

AI总结 针对VLMs空间定位不可靠问题,本文提出TinyDamage架构,将空间定位委托给专用多任务分割模型,集成至7节点LangGraph智能体流程,在车辆损伤评估中大幅降低报告虚构率。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26064 2026-07-30 cs.CY cs.AI 新提交 85%

The Age of AI Agents Demands A New Scientific Paradigm To Sustain Trustworthy Science

AI智能体时代需要新的科学范式以维持可信科学

Belinda Mo

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 针对AI自主研究智能体带来的科学产出验证缺口扩大问题,该文提出需进化科学验证基础设施的标准,以应对无人能核查结果等风险,维持科学信任。

Comments Accepted at ICML 2026, Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏