arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15866 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15866 篇

2510.15555 2026-04-03 cs.LG 57%

Doubly Robust Estimation of Causal Effects in Strategic Equilibrium Systems

在战略均衡系统中因果效应的双重稳健估计

Sibo Xiao

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出SDR估计器,结合战略均衡建模与双重稳健估计,解决战略行为导致的内生处理分配问题,理论证明其一致性与渐近正态性,实验证明在不同战略强度下具有更高的偏倚减少效果。

Comments In systems with causal effects, a large majority of individuals are mistakenly classified as using a certain strategy by the strategic equilibrium solver, resulting in the introduction of this feature as an independent variable in causal inference without specificity. This method may have an inherent error

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01637 2026-04-03 cs.CR cs.AI 57%

Seclens: Role-specific Evaluation of LLM's for security vulnerablity detection

SecLens:针对安全漏洞检测LLM的角色特定评估

Subho Halder, Siddharth Saxena, Kashinath Kadaba Shrish, Thiyagarajan M

机构 * Mattersec Labs(Mattersec实验室) Kalmantic Labs(Kalmantic实验室)

专题命中 Agent评测 :tool-use(abstract);分类 cs.AI

AI总结 SecLens引入多利益相关者评估框架,通过角色特定加权配置评估LLM在安全漏洞检测中的性能差异,揭示多目标问题的本质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00788 2026-04-02 cs.AI cs.CR 57%

UK AISI Alignment Evaluation Case-Study

英国人工智能安全研究所对齐评估案例研究

Alexandra Souly, Robert Kirk, Jacob Merizian, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文评估了前沿模型在作为代码助手部署时是否可靠遵循目标,发现未发现研究 sabotage,但部分模型对安全相关任务不合作,且评估意识较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00352 2026-04-02 cs.LG 57%

Deep Learning-Accelerated Surrogate Optimization for High-Dimensional Well Control in Stress-Sensitive Reservoirs

深度学习加速的代理优化用于高维井控在应力敏感性储层中

Mahammad Valiyev, Jodel Cornelio, Behnam Jafarpour

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文提出一种基于深度学习的代理优化框架,用于高维井控优化,通过问题导向的采样策略和神经网络代理,提升高维模拟器问题的计算效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27592 2026-04-02 eess.SY cs.LG cs.SY 57%

Fundamental Limits of Man-in-the-Middle Attack Detection in Model-Free Reinforcement Learning

模型无关强化学习中中间人攻击检测的基本限制

Rishi Rani, Massimo Franceschetti

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了基于学习的中间人攻击检测问题,改进了BDD框架,通过允许奖励函数依赖当前和后续状态来捕捉攻击引起的奖励变化,并证明了检测效率的最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.06026 2026-04-02 cs.GT cs.DS cs.LG 57%

Incentivizing Exploration with Selective Data Disclosure

通过选择性数据披露激励探索

Nicole Immorlica, Jieming Mao, Aleksandrs Slivkins, Zhiwei Steven Wu

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种激励高效探索的推荐系统,通过选择性披露过去代理的数据,实现序列社会学习,采用灵活的频数行为模型,优化探索的遗憾率。

Comments The ACM-EC 2020 conference publication corresponds to the Feb'20 version. Section 7 ("robustness") and Section 8 (the numerical study) were added in, resp., Dec'20 and Nov'24. New discussions (Section 3.2.1 and Appendix B) were added in April'26, as well as a partial reframing of the motivating story to emphasize transparency and deemphasize commitment

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00265 2026-04-02 cs.CV cs.AI 57%

Benchmarking Interaction, Beyond Policy: a Reproducible Benchmark for Collaborative Instance Object Navigation

交互基准测试,超越策略:协作实例物体导航的可重复基准

Edoardo Zorzi, Francesco Taioli, Yiming Wang, Marco Cristani, Alessandro Farinelli, Alberto Castellini, Loris Bazzani

机构 * Sapienza University of Rome(罗马大学) University of Verona(维罗纳大学) Polytechnic of Turin(都灵理工大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Reykjavik University(雷克雅未克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出QAsk-Nav基准,用于评估协作实例物体导航中的导航与协作问答能力,提供轻量级问答协议和高质量数据集,开发出更高效且性能更优的Light-CoNav模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29357 2026-04-01 cs.AI 57%

BenchScope: How Many Independent Signals Does Your Benchmark Provide?

BenchScope:你的基准测试提供了多少独立信号?

Tommy Sha, Stella Zhao

机构 * Stony Brook University(石溪大学) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出有效维度(ED)作为评估基准测量广度的快速诊断指标,揭示了现有基准测试中存在显著冗余问题,并提供了一种诊断流程以指导基准维护。

Comments Equal contribution; correspondence: tianming.sha@stonybrook.edu, zhao2052@umn.edu;

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16081 2026-04-01 cs.HC cs.AI cs.MA 57%

Evaluation of Generative Models for Emotional 3D Animation Generation in VR

生成模型在VR中情感3D动画生成的评估

Kiran Chhatre, Renan Guarese, Andrii Matviienko, Christopher Peters

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过用户研究评估了三种先进的语音驱动3D动画方法,在快乐和中性情绪下的情感质量,发现显式建模情绪的方法更准确,但生成模型在面部表情质量和互动质量上仍需改进。

Comments 20 pages, 5 figures. Webpage: https://emotional3dhumans.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07204 2026-04-01 cs.AI cs.CY cs.MA 57%

Evaluating Online Moderation Via LLM-Powered Counterfactual Simulations

通过LLM赋能的反事实模拟评估在线 moderation

Giacomo Fidone, Lucia Passaro, Riccardo Guidotti

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的反事实模拟方法,用于评估在线社交网络的 moderation 策略,揭示了社交传染现象及个性化策略的有效性。

Comments Accepted for publication at AAAI Conference on Artificial Intelligence 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28625 2026-03-31 cs.RO cs.AI cs.SY eess.SY 57%

Dynamic Lookahead Distance via Reinforcement Learning-Based Pure Pursuit for Autonomous Racing

通过基于强化学习的纯追求实现动态前瞻距离

Mohamed Elgouhary, Amr S. El-Wakeel

机构 * West Virginia University(西弗吉尼亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出结合PPO与经典纯追求控制器的混合控制框架,动态调整前瞻距离以提升自动驾驶赛车性能,实验表明在未见过的赛道上提升了圈速并实现了仿真到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28301 2026-03-31 cs.LG 57%

LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models

LIBERO-Para:一种用于视觉语言动作模型中同义词鲁棒性诊断的基准和指标

Chanyoung Kim, Minwoo Kim, Minseok Kang, Hyunwoo Kim, Dahuin Jung

机构 * Soongsil University(崇实大学) Chung-Ang University(中央大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出LIBERO-Para基准,通过独立变化动作表达和物体参考,分析语言泛化能力。研究发现,不同规模的VLA模型在同义词替换下性能下降22-52个百分点,主要由物体层面的词汇变化导致。提出PRIDE指标量化同义词难度,揭示模型对任务识别的依赖。

Comments 32 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27962 2026-03-31 cs.LG cs.GT 57%

Gradient Manipulation in Distributed Stochastic Gradient Descent with Strategic Agents: Truthful Incentives with Convergence Guarantees

分布式随机梯度下降中梯度操纵的策略性代理:具有收敛保证的诚实激励

Ziqin Chen, Yongqiang Wang

机构 * Department of Electrical and Computer Engineering, Clemson University(克莱姆森大学电气与计算机工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种完全分布式支付机制,首次在分布式随机梯度下降中保证诚实行为和准确收敛,克服了现有诚实机制的两大局限:依赖集中服务器和牺牲收敛精度。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01502 2026-03-31 cs.CV cs.AI 57%

Clinical application of HEDI for biomechanical evaluation and visualisation in incisional hernia repair

HEDI在切口疝修复中的临床应用:生物力学评估与可视化

Philipp D. Lösel, Jacob J. Relle, Samuel Voß, Ramesch Raschidi, Regine Nessel, Johannes Görich, Mark O. Wielpütz, Thorsten Löffler, Vincent Heuveline, Friedrich Kallinowski

机构 * Department of Materials Physics, Research School of Physics, The Australian National University(澳大利亚国立大学物理研究学院材料物理系) Engineering Mathematics and Computing Lab (EMCL), Interdisciplinary Center for Scientific Computing (IWR), Heidelberg University(海德堡大学跨学科科学计算中心工程数学与计算实验室) Data Mining and Uncertainty Quantification (DMQ), Heidelberg Institute for Theoretical Studies (HITS)(海德堡理论研究所数据挖掘与不确定性量化) Forschungscampus STIMULATE, Department of Fluid Dynamics and Technical Flows, Otto von Guericke University Magdeburg(奥托·冯·格里克马格德堡大学流体动力学与技术流动系STIMULATE研究园区) Departement Chirurgie, Kantonsspital Graubünden(格劳宾登州医院外科) General and Visceral Surgery, Municipal Hospital Pirmasens(皮尔马森斯市立医院普通与内脏外科) Radiological Center, Kellereistrasse 32-34, 69412 Eberbach(放射中心) Diagnostic and Interventional Radiology, Heidelberg University Hospital(海德堡大学医院诊断与介入放射科) Translational Lung Research Center (TLRC) Heidelberg, German Center for Lung Research (DZL)(海德堡转化肺研究中心,德国肺研究中心) General and Visceral Surgery, GRN Hospital(GRN医院普通与内脏外科) General, Visceral and Transplantation Surgery, Heidelberg University Hospital(海德堡大学医院普通、内脏与移植外科)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本研究提出一种考虑腹壁不稳定性的生物力学修复策略,并开发可视化工具辅助术前评估,通过31例患者术前评估显示术后三年无疼痛和复发,但需作为辅助工具使用。

Comments 15 pages, 6 figures, this is the author's accepted manuscript of an article published in Communications Medicine (2026). The final version is available online at: https://doi.org/10.1038/s43856-025-01311-w

Journal ref Communications Medicine 6 (2026) 68

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27691 2026-03-31 cs.DB cs.PL cs.SE 57%

The Case for Multi-Version Experimental Evaluation (MVEE)

多版本实验评估(MVEE)的案例

Simon Jörz, Felix Schuhknecht

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 本文提出多版本实验评估(MVEE)以解决编译版本差异导致的评估问题,通过分析后续构建中的异常,生成新的版本以提高实验评估的准确性和表达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27415 2026-03-31 cs.AI stat.CO 57%

Greedy Is a Strong Default: Agents as Iterative Optimizers

贪婪是一种强大的默认选择:智能体作为迭代优化器

Yitao Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了在智能体替代随机提议生成器的情况下,经典优化方法的有效性。通过四个任务验证,发现贪心爬山法在多个搜索空间中表现优异,且生成的规则具有可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26922 2026-03-31 cs.HC cs.AI 57%

Mimetic Alignment with ASPECT: Evaluation of AI-inferred Personal Profiles

模仿对齐与ASPECT:AI推断个人资料的评估

Ruoxi Shang, Dan Marshall, Edward Cutrell, Denae Ford

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本文提出ASPECT方法,通过验证的沟通量表和职场数据评估LLM沟通特征,生成的个人资料在自评上表现良好,并在多个场景中优于通用和自述基线。

Comments 20 pages (including appendix), 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26177 2026-03-30 cs.LG 57%

Can AI Scientist Agents Learn from Lab-in-the-Loop Feedback? Evidence from Iterative Perturbation Discovery

AI科学家代理能否从循环实验室反馈中学习?来自迭代扰动发现的证据

Gilles Wainrib, Barbara Bodinier, Haitem Dakhli, Josep Monserrat, Almudena Espin Perez, Sabrina Carpentier, Roberta Codato, John Klein

机构 * Owkin Inc(Owkin公司)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文通过800次独立重复实验,比较了基于LLM的代理在循环扰动发现中利用反馈与零样本基线的性能差异,发现反馈能显著提升发现效率,且模型能力提升后效果更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26031 2026-03-30 cs.HC cs.AI 57%

Designing Fatigue-Aware VR Interfaces via Biomechanical Models

通过生物力学模型设计疲劳感知的VR界面

Harshitha Voleti, Charalambos Poullis

机构 * Immersive \& Creative Technologies Lab, Concordia University Canada Immersive \& Creative Technologies Lab, Concordia University

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种分层强化学习框架,利用生物力学用户模型评估和优化VR界面,以减少空中交互的疲劳。通过模拟疲劳反馈优化UI布局,实验表明该方法能有效降低用户感知疲劳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25727 2026-03-27 cs.AI cs.MM 57%

Back to Basics: Revisiting ASR in the Age of Voice Agents

回归基础:在语音助手时代重新审视ASR

Geeyang Tay, Wentao Ma, Jaewon Lee, Yuzhi Tang, Daniel Lee, Weisu Yin, Dongming Shen, Silin Meng, Yi Zhu, Mu Li, Alex Smola

机构 * Boson AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究指出现有ASR系统在真实场景下表现不佳,提出多语言诊断基准WildASR,揭示模型在环境退化、人口变化和语言多样性下的性能退化问题,并提供分析工具提升可靠性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25633 2026-03-27 cs.AI 57%

Is Mathematical Problem-Solving Expertise in Large Language Models Associated with Assessment Performance?

大语言模型中的数学问题解决能力是否与评估表现相关?

Liang Zhang, Yu Fu, Xinyi Jin

机构 * University of Michigan(密歇根大学) The High School Affiliated to Minzu University of China(中央民族大学附属中学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了大语言模型在数学问题解决能力与评估表现之间的关系,发现模型在解决正确问题时评估准确率更高,但步级诊断仍需额外能力支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24369 2026-03-27 math.OC cs.LG 57%

Adaptive decision-making for stochastic service network design

适应性决策在随机服务网络设计中的应用

Javier Durán-Micco, Bilge Atasoy

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出一种两阶段优化方法,结合元启发式算法、仿真和机器学习,解决物流服务提供商在多模式货运网络中的服务网络设计问题,通过模拟退火算法和自适应替代模型提升解决方案质量和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19516 2026-03-27 cs.CV cs.AI 57%

Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis

Gastric-X:一种多模态多阶段基准数据集,用于推进胃癌分析中的视觉-语言模型

Sheng Lu, Hao Chen, Rui Yin, Juyan Ba, Yu Zhang, Yuanzhe Li

机构 * Ruijin Hospital(瑞金医院) University of Cambridge(剑桥大学) Nanjing First Hospital(南京市第一医院) Shenzhen University(深圳大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 Gastric-X通过1700例胃癌病例数据,评估视觉-语言模型在胃癌诊断中的多阶段任务能力,推动医疗领域VLM发展。

Comments Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02606 2026-03-27 cs.SI cs.AI cs.CY 57%

Gender Dynamics and Homophily in a Social Network of LLM Agents

社交网络中LLM代理的性别动态与同性倾向

Faezeh Fadaei, Jenny Carla Moran, Taha Yasseri

机构 * School of Mathematics and Statistics, University College Dublin(都柏林大学数学与统计学院) Centre for Sociology of Humans and Machines (SOHAM), Trinity College Dublin and Technological University Dublin(人类与机器社会学中心(SOHAM),都柏林圣三一学院与都柏林理工大学) Trinity Long Room Hub, Trinity College Dublin(都柏林圣三一学院长厅中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究LLM代理在社交网络中的性别表现动态及同性倾向,发现尽管个体性别表现随时间变化,网络仍表现出强性别同质性,揭示文化影响下的性别排序机制。

Comments Under Review

Journal ref Philosophical Transactions A. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24703 2026-03-27 cs.SE cs.RO cs.SY eess.SY 57%

IndustriConnect: MCP Adapters and Mock-First Evaluation for AI-Assisted Industrial Operations

IndustriConnect:MCP适配器与先假测试用于AI辅助工业操作

Melwin Xavier, Melveena Jolly, Vaisakh M A, Midhun Xavier

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 本文提出IndustriConnect,通过MCP适配器将工业操作暴露为可发现的AI工具,支持协议特定连接和安全控制,并通过先假测试和确定性基准验证适配器的正确性、并发行为和结构化错误处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11118 2026-03-27 cs.LG cs.CV 57%

Revealing Human Attention Patterns from Gameplay Analysis for Reinforcement Learning

从游戏分析中揭示强化学习中的人类注意力模式

Henrik Krauss, Takehisa Yairi

机构 * Department of Advanced Interdisciplinary Studies(先进跨学科研究系) Research Center for Advanced Science and Technology(先进科学与技术研究中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种从游戏数据中揭示人类内部注意力模式的新方法,通过对比人类和强化学习代理的注意力图,验证了人类注意力模式的稀疏性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19808 2026-03-26 cs.LG math.AP stat.ML 57%

Two-Time-Scale Learning Dynamics: A Population View of Neural Network Training

双时间尺度学习动态:神经网络训练的群体视角

Giacomo Borghi, Hyesung Im, Lorenzo Pareschi

机构 * Maxwell Institute for Mathematical Sciences and School of Mathematical and Computer Sciences Heriot–Watt University, Edinburgh, UK(麦克斯韦数学科学研究所和赫里奥特-沃特大学数学与计算机科学学院,爱丁堡,英国) Department of Mathematics and Computer Science University of Ferrara, Italy(费拉拉大学数学与计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于双时间尺度群体动态的理论框架,分析神经网络训练中参数与超参数的演化机制,揭示群体学习与双层优化的关系,并探讨噪声与多样性在优化与探索中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11304 2026-03-26 cs.IR cs.AI cs.CR 57%

CryptoAnalystBench: Failures in Multi-Tool Long-Form LLM Analysis

CryptoAnalystBench: 多工具长文本LLM分析中的失败

Anushri Eswaran, Oleg Golev, Darshan Tank, Sidhant Rahi, Himanshu Tyagi

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出CryptoAnalystBench,通过198个加密和DeFi查询评估多工具LLM在复杂输入中的表现,揭示七类高阶错误类型,并提供评估框架和缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10051 2026-03-26 cs.CL 57%

GraphIF: Enhancing Multi-Turn Instruction Following for Large Language Models with Relation Graph Prompt

GraphIF: 通过关系图提示增强大语言模型的多轮指令遵循

Zhenhe Li, Can Lin, Ling Zheng, Wen-Da Wei, Junli Liang, Qi Song

机构 * Zhenhe Li 1(李振和1) Can Lin 1(林灿1) Ling Zheng 1(郑凌1) Wen-Da Wei 2(韦文达2) Junli Liang 1(梁俊利1) Qi Song 1(宋琪1)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 GraphIF通过构建关系图结构,利用图提示提升大语言模型的多轮指令遵循能力,实验表明其在多轮对话评估指标上表现优异。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence (AAAI-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22892 2026-03-25 cs.LG 57%

VLGOR: Visual-Language Knowledge Guided Offline Reinforcement Learning for Generalizable Agents

VLGOR:基于视觉-语言知识的离线强化学习用于通用智能体

Pengsen Liu, Maosen Zeng, Nan Tang, Kaiyuan Li, Jing-Cheng Pang, Yunan Liu, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China \& School of Artificial Intelligence, Nanjing University, China Computational Intelligence Center (CIC), School of Computer Artificial Intelligence, Shandong Jianzhu University, Jinan, 250101, China

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出VLGOR框架,结合视觉和语言知识生成虚拟轨迹,提升智能体在未见任务中的泛化能力,实验显示其性能比基线方法高24%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏