arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11076 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11076 篇

2602.07918 2026-02-10 cs.CR cs.LG stat.ME 70%

CausalArmor: Efficient Indirect Prompt Injection Guardrails via Causal Attribution

CausalArmor: 通过因果归因实现高效的间接提示注入防护

Minbeom Kim, Mihir Parmar, Phillip Wallis, Lesly Miculicich, Kyomin Jung, Krishnamurthy Dj Dvijotham, Long T. Le, Tomas Pfister

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google(谷歌) Google Deepmind(谷歌DeepMind) Seoul National University(首尔国立大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 CausalArmor通过因果归因实现高效间接提示注入防护,提升AI代理的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07553 2026-02-10 cs.AI 70%

VirtualEnv: A Platform for Embodied AI Research

VirtualEnv: 一个用于具身AI研究的平台

Kabir Swain, Sijie Han, Ayush Raina, Jin Zhang, Shuang Li, Michael Stopa, Antonio Torralba

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 VirtualEnv是一个基于Unreal Engine 5的开源平台,用于评估LLM在具身和交互场景中的能力,支持多智能体协作和程序生成任务,旨在推动AI与游戏的交叉研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07215 2026-02-10 eess.SY cs.AI cs.DC cs.SY 70%

Multi-Agentic AI for Fairness-Aware and Accelerated Multi-modal Large Model Inference in Real-world Mobile Edge Networks

多智能体AI用于现实世界移动边缘网络中公平性感知和加速的多模态大模型推理

Haiyuan Li, Hari Madhukumar, Shuangyi Yan, Yulei Wu, Dimitra Simeonidou

机构 * Smart Internet Lab, Department of Electrical and Electronic Engineering, University of Bristol(布里斯托大学电子与电气工程系智能互联网实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出多智能体AI框架,通过优化提示路由和模型部署,实现移动边缘网络中多模态大模型推理的低延迟与高公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14388 2026-02-09 cs.AI 70%

Hi-Agent: Hierarchical Vision-Language Agents for Mobile Device Control

Hi-Agent:用于移动设备控制的分层视觉语言代理

Zhe Wu, Hongjin Lu, Junliang Xing, Changhao Zhang, Yuxuan Li, Yin Zhu, Yuhao Yang, Yuheng Jing, Kai Li, Kun Shao, Jianye Hao, Jun Wang, Yuanchun Shi

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University College London(伦敦大学学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 Hi-Agent通过分层结构和前瞻性优势函数,实现移动设备控制的高效训练和高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08585 2026-02-09 cs.AI cs.CV 70%

Simulating the Visual World with Artificial Intelligence: A Roadmap

用人工智能模拟视觉世界:一条路线图

Jingtong Yue, Ziqi Huang, Zhaoxi Chen, Xintao Wang, Pengfei Wan, Ziwei Liu

机构 * Robotics Institute Carnegie Mellon University(卡内基梅隆大学机器人研究所) S-Lab Nanyang Technological University(南洋理工大学S实验室) Kling Team Kuaishou Technology(快手科技 Kling 团队)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于隐式世界模型和视频渲染器的视频基础模型,用于模拟物理动态、智能体交互和任务规划,涵盖四代视频生成技术,应用于机器人、自动驾驶和互动游戏等领域。

Comments Project page: https://world-model-roadmap.github.io/ Github Repo: https://github.com/ziqihuangg/Awesome-From-Video-Generation-to-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02071 2026-02-09 cs.AI 70%

Human-AI Co-Embodied Intelligence for Scientific Experimentation and Manufacturing

人类-人工智能协同具身智能用于科学实验与制造

Xinyi Lin, Yuyang Zhang, Yuanhang Gan, Juntao Chen, Hao Shen, Yichun He, Lijun Li, Ze Yuan, Shuang Wang, Chaohao Wang, Rui Zhang, Na Li, Jia Liu

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出人类-人工智能协同具身智能,通过智能体-物理实验系统提升科学实验与制造的精度与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05327 2026-02-06 cs.AI 70%

ProAct: Agentic Lookahead in Interactive Environments

ProAct:交互环境中的代理前瞻性

Yangbin Yu, Mingyu Yang, Junyou Li, Yiming Gao, Feiyu Liu, Yijun Yang, Zichuan Lin, Jiafei Lyu, Yicheng Liu, Zhicong Lu, Deheng Ye, Jie Jiang

机构 * Tencent Hunyuan(腾讯文言)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 ProAct通过双阶段训练范式提升交互环境中的前瞻性推理能力,结合GLAD和MC-Critic实现更稳定的策略优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17767 2026-02-06 cs.CL 70%

Position: The Real Barrier to LLM Agent Usability is Agentic ROI

位置:LLM代理可用性的真正障碍是代理的ROI

Weiwen Liu, Jiarui Qin, Xu Huang, Xingshan Zeng, Yunjia Xi, Jianghao Lin, Chuhan Wu, Yasheng Wang, Lifeng Shang, Ruiming Tang, Defu Lian, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本文提出LLM代理可用性的核心问题在于其投资回报率,主张通过Z字型发展路径提升其在日常应用中的可用性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03442 2026-02-04 cs.CL 70%

A-RAG: Scaling Agentic Retrieval-Augmented Generation via Hierarchical Retrieval Interfaces

A-RAG:通过分层检索接口扩展代理检索增强生成

Mingxuan Du, Benfeng Xu, Chiwei Zhu, Shaohan Wang, Pengyu Wang, Xiaorui Wang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(metastone技术公司)

专题命中 规划推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

AI总结 A-RAG通过分层检索接口提升检索增强生成效果,有效利用模型能力并适应不同任务。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02995 2026-02-04 cs.AI 70%

Agent Alpha: Tree Search Unifying Generation, Exploration and Evaluation for Computer-Use Agents

Agent Alpha:通过树搜索统一生成、探索和评估计算机使用代理

Sizhe Tang, Rongqian Chen, Tian Lan

机构 * The George Washington University(乔治·华盛顿大学)

专题命中 规划推理 :planning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 Agent Alpha通过步骤级MCTS统一生成、探索和评估,实现计算机使用代理的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15519 2026-02-03 cs.AI 70%

TransportAgents: a multi-agents LLM framework for traffic accident severity prediction

TransportAgents: 一种用于交通事故严重性预测的多智能体LLM框架

Zhichao Yang, Jiashu He, Jinxuan Fan, Cirillo Cinzia

机构 * Civil and Environmental Engineering, University of Maryland(大学环境工程系,马里兰州大学) Computer and Information Science, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学) Statistics, University of California, Berkeley(统计学系,加州大学伯克利分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 TransportAgents通过多智能体框架提升交通事故严重性预测的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08366 2026-02-03 cs.AI 70%

Reflecting with Two Voices: A Co-Adaptive Dual-Strategy Framework for LLM-Based Agent Decision Making

双声道反思:基于LLM的智能体决策的共适应双策略框架

Wentao Zhang, Qunbo Wang, BoXuan Zhao, Tao Zhang, Junsheng Wu, Hongping Gan, Ling Dai, Shizhuang Deng, Shuntong Sun, Yang Liu

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 DuSAR通过双策略共适应推理框架,无需演示或微调即可在模拟和真实环境中实现优于现有方法的性能,同时减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22662 2026-02-02 cs.AI cs.MA 70%

Task-Aware LLM Council with Adaptive Decision Pathways for Decision Support

具有自适应决策路径的任务感知大语言模型委员会用于决策支持

Wei Zhu, Lixing Yu, Hao-Ren Yao, Zhiwen Tang, Kun Yue

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 TALC通过任务感知的LLM委员会和自适应决策路径,提升决策支持任务的成功率和搜索效率。

Comments A shorter version of this work has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22491 2026-02-02 cs.CL 70%

SSL: Sweet Spot Learning for Differentiated Guidance in Agentic Optimization

SSL:在代理优化中差异化引导的甜蜜点学习

Jinyang Wu, Changpeng Yang, Yuhao Shen, Fangzhi Xu, Bolin Ni, Chonghua Liao, Yuchen Liu, Hongzhen Wang, Shuai Nie, Shuai Zhang, Haoran Luo, Jiaming Xu

机构 * Tsinghua University(清华大学) Xiaomi Corporation(小米公司) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 SSL通过分层奖励引导代理优化,提升解空间中的方向性优化,实现样本效率提升和跨任务迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02553 2026-01-30 cs.AI 70%

SimpleMem: Efficient Lifelong Memory for LLM Agents

SimpleMem: 为LLM代理高效终身记忆

Jiaqi Liu, Yaofeng Su, Peng Xia, Siwei Han, Zeyu Zheng, Cihang Xie, Mingyu Ding, Huaxiu Yao

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 SimpleMem通过语义无损压缩和三阶段流程,提升LLM代理在复杂环境中的记忆效率与检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10996 2026-01-30 cs.CL 70%

RAS: Retrieval-And-Structuring for Knowledge-Intensive LLM Generation

RAS:基于检索与构建的知识密集型大语言模型生成

Pengcheng Jiang, Lang Cao, Ruike Zhu, Minhao Jiang, Yunyi Zhang, Jiaming Shen, Jimeng Sun, Jiawei Han

机构 * Department of Computer Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机科学系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 RAS通过动态构建问题特定知识图谱,提升大语言模型在知识密集型任务中的推理准确性和鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20380 2026-01-29 cs.AI 70%

OmegaUse: Building a General-Purpose GUI Agent for Autonomous Task Execution

OmegaUse:构建一个通用的 GUI 代理以实现自主任务执行

Le Zhang, Yixiong Xiao, Xinjiang Lu, Jingjia Cao, Yusai Zhao, Jingbo Zhou, Lang An, Zikan Feng, Wanxiang Sha, Yu Shi, Congxi Xiao, Jian Xiong, Yankai Zhang, Hua Wu, Haifeng Wang

机构 * Baidu Frontier Research Department(百度前沿研究部)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 OmegaUse 是一种通用 GUI 代理模型,通过高质量数据和解耦训练方法实现跨平台自主任务执行,展现卓越的 GUI 任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20206 2026-01-29 cs.AI 70%

Towards Intelligent Urban Park Development Monitoring: LLM Agents for Multi-Modal Information Fusion and Analysis

面向智能城市公园发展监测:LLM代理用于多模态信息融合与分析

Zixuan Xiao, Chunguang Hu, Jun Ma

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出基于LLM的多模态代理框架,用于提升城市公园发展监测中多模态数据的融合与分析能力,解决传统方法在高级分析和灵活适应性方面的不足。

Journal ref IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2025, Aug 3-8 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17383 2026-01-27 cs.CV cs.AI 70%

Physical Prompt Injection Attacks on Large Vision-Language Models

针对大视觉-语言模型的物理提示注入攻击

Chen Ling, Kai Hu, Hangcheng Liu, Xingshuo Han, Tianwei Zhang, Changhai Ou

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究提出了一种无需访问模型或输入的物理提示注入攻击方法,通过物理物体注入恶意指令,成功攻击多种大视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15533 2026-01-23 cs.AI 70%

From Generative Engines to Actionable Simulators: The Imperative of Physical Grounding in World Models

从生成引擎到可操作模拟器:世界模型中物理基础的必要性

Zhikang Chen, Tingting Zhu

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出将世界模型重新定义为可操作模拟器,强调因果结构和约束意识,以提升医疗决策中的反事实推理和长期预见能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14437 2026-01-22 cs.RO cs.AI 70%

Agentic AI Meets Edge Computing in Autonomous UAV Swarms

代理AI遇见边缘计算在自主无人机群中

Thuan Minh Nguyen, Vu Tuan Truong, Long Bao Le

机构 * INRS, University of Québec(INRS大学、魁北克大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出利用LLM驱动的代理AI与边缘计算结合,提升无人机群在高风险场景中的自主性和任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13918 2026-01-21 cs.CL 70%

AgentEHR: Advancing Autonomous Clinical Decision-Making via Retrospective Summarization

AgentEHR: 通过回顾性总结推进自主临床决策制定

Yusheng Liao, Chuan Xuan, Yutong Cai, Lina Yang, Zhe Chen, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 AgentEHR通过RetroSum框架提升自主临床决策制定,减少交互错误并提升性能

Comments 37 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12988 2026-01-21 cs.LG 70%

PaperGuide: Making Small Language-Model Paper-Reading Agents More Efficient

PaperGuide: 使小型语言模型论文阅读代理更加高效

Zijian Wang, Tiancheng Huang, Hanqi Li, Da Ma, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence, SJTU AI Institute, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室、计算机科学学院、人工智能关键实验室、SJTU人工智能研究所、上海交通大学、上海,中国) Suzhou Laboratory, Suzhou, China(苏州实验室、苏州,中国)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 PaperCompass通过分离高层规划与细粒度执行,提升小型语言模型在论文阅读任务中的效率,实现高效且可靠的训练过程。

Comments 35 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12939 2026-01-21 cs.RO cs.AI eess.SP 70%

Active Inference-Driven World Modeling for Adaptive UAV Swarm Trajectory Design

基于主动推断的世界建模用于自适应无人机蜂群轨迹设计

Kaleem Arshid, Ali Krayani, Lucio Marcenaro, David Martin Gomez, Carlo Regazzoni

机构 * University of Genoa(热那亚大学) Carlos III University Madrid(马德里卡洛斯三世大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出基于主动推断的世界建模框架,用于自适应无人机蜂群轨迹设计,通过整合概率推理和自我学习实现动态环境下的适应性响应。

Comments This paper has been accepted for presentation at the 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (IEEE ICASSP 2026) Workshop: 'Multi-Modal Signal Processing and AI for Communications and Sensing in 6G and Beyond (MuSiC-6GB)'

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17281 2026-01-21 cs.CL 70%

From Language to Action: A Review of Large Language Models as Autonomous Agents and Tool Users

从语言到行动:大型语言模型作为自主代理和工具使用者的综述

Sadia Sultana Chowa, Riasad Alvi, Subhey Sadi Rahman, Md Abdur Rahman, Mohaimenul Azam Khan Raiaan, Md Rafiqul Islam, Mukhtar Hussain, Sami Azam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Faculty of Science and Technology(科学与技术学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型作为自主代理和工具使用者的发展,探讨了其架构设计、认知机制及未来研究方向。

Comments Submitted to Artificial Intelligence Review for peer review

Journal ref Artif. Intell. Rev. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10148 2026-01-16 cs.AI 70%

DecisionLLM: Large Language Models for Long Sequence Decision Exploration

DecisionLLM: 用于长序列决策探索的大型语言模型

Xiaowei Lv, Zhilin Zhang, Yijun Li, Yusen Huo, Siyuan Ju, Xuyan Li, Chunxiang Hong, Tianyu Wang, Yongcai Wang, Peng Sun, Chuan Yu, Jian Xu, Bo Zheng

机构 * Renmin University of China, Beijing China(中国人民大学) Alibaba Group, Beijing, China(阿里巴巴集团)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 DecisionLLM基于Transformer架构,通过将轨迹视为独立模态,解决LLMs在连续值解释上的不足,实现长序列决策任务的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09259 2026-01-15 cs.AI 70%

MAXS: Meta-Adaptive Exploration with LLM Agents

MAXS: 基于LLM代理的元适应性探索

Jian Zhang, Zhiyuan Wang, Zhangqi Wang, Yu He, Haoran Luo, li yuan, Lingling Zhang, Rui Mao, Qika Lin, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) South China University of Technology(华南理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 MAXS通过元适应性探索框架提升LLM代理在多工具推理中的全局有效性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09113 2026-01-15 cs.AI 70%

The AI Hippocampus: How Far are We From Human Memory?

人工智能海马体:我们离人类记忆还有多远?

Zixia Jia, Jiaqi Li, Yipeng Kang, Yuxuan Wang, Tong Wu, Quansen Wang, Xiaobo Wang, Shuyi Zhang, Junzhe Shen, Qing Li, Siyuan Qi, Yitao Liang, Di He, Zilong Zheng, Song-Chun Zhu

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了大语言模型和多模态大语言模型中记忆机制的分类与研究进展,探讨了隐性、显性和代理记忆框架,以及多模态场景下的记忆整合与挑战。

Journal ref Transactions on Machine Learning Research (11/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09032 2026-01-15 cs.AI 70%

The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments

代理能力的层级:在现实强化学习环境中评估前沿模型

Logan Ritchie, Sushant Mehta, Nick Heiner, Mason Yu, Edwin Chen

机构 * Surge AI

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文评估了前沿AI模型在现实强化学习环境中的代理能力层级,揭示了模型在工具使用、规划、适应性等任务上的能力差异及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06818 2026-01-13 cs.CL 70%

AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents

AgentHallu: 评估基于大语言模型的代理的自动幻觉归因

Xuannan Liu, Xiao Yang, Zekun Li, Peipei Li, Ran He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Department of Computer Science & Technology, Tsinghua University(清华大学计算机科学与技术系) University of California, Santa Barbara(加州大学圣芭芭拉分校) Center for Research on Intelligent Perception and Computing, NLPR, CASIA(智能感知与计算研究中心,国家工程实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 AgentHallu提出一个评估基于大语言模型的代理自动识别幻觉来源的任务,通过高质量轨迹和多级注释评估13个模型,发现顶级模型在定位幻觉步骤上表现有限,工具使用幻觉最难识别。

Comments Project page: https://liuxuannan.github.io/AgentHallu.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏