arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11047 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11047 篇

2604.02226 2026-04-03 cs.AI cs.LG 73%

When to ASK: Uncertainty-Gated Language Assistance for Reinforcement Learning

何时提问:用于强化学习的不确定性门控语言帮助

Juarez Monteiro, Nathan Gavenski, Gianlucca Zuin, Adriano Veloso

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ASK方法,通过结合小型语言模型和训练好的RL策略,提升模型在分布外任务中的泛化能力,通过不确定性门控机制选择性利用语言模型进行决策,实验显示其在迁移任务中表现稳健。

Comments In Proceedings of International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09724 2026-04-03 cs.CL cs.AI 73%

Syntactic Framing Fragility: An Audit of Robustness in LLM Ethical Decisions

句法框架脆弱性:LLM伦理决策稳健性审计

Katherine Elkins, Jon Chun

机构 * Integrated Program in Humane Studies / AIColab(人文研究综合项目 / AIColab) Computing, Kenyon College(凯尼恩学院计算系)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Syntactic Framing Fragility框架,用于量化LLM在逻辑等价句法变换下的决策一致性,发现开源模型在高风险决策中表现更脆弱,且否定性语法是主要失效模式。

Comments 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08545 2026-04-02 cs.CL cs.AI cs.CV cs.MA 73%

Curriculum Guided Massive Multi Agent System Solving For Robust Long Horizon Tasks

课程引导的大规模多智能体系统解决稳健长周期任务

Indrajit Kar, Kalathur Chenchu Kishore Kumar

机构 * Wipro Innovation Networks(威普罗创新网络)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种分层多智能体架构,通过空间课程逐步扩展网格区域,使智能体先掌握中央任务再处理外围任务,提升长周期任务的稳定性和推理能力。

Comments 22 pages, 2 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28522 2026-04-01 cs.RO cs.AI cs.CV cs.LG 73%

RAD-LAD: Rule and Language Grounded Autonomous Driving in Real-Time

基于规则和语言的实时自动驾驶:RAD-LAD

Anurag Ghosh, Srinivasa Narasimhan, Manmohan Chandraker, Francesco Pittaluga

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAD-LAD,结合规则和语言的实时自动驾驶系统,通过中断架构实现高效路径规划与文本推理,提升自动驾驶性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26953 2026-03-31 astro-ph.EP astro-ph.IM cs.AI cs.ET cs.LG 73%

ASTER -- Agentic Science Toolkit for Exoplanet Research

ASTER -- 用于系外行星研究的代理科学工具包

Emilie Panek, Alexander Roman, Gaurav Shukla, Leonardo Pagliaro, Katia Matcheva, Konstantin Matchev

机构 * University of Alabama(阿拉巴马大学) University of Padova(帕多瓦大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 ASTER通过整合AI代理与领域专用工具,为系外行星大气分析提供统一平台,支持多步骤数据处理和检索任务。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22918 2026-03-30 cs.CV cs.AI cs.CL 73%

EVA: Efficient Reinforcement Learning for End-to-End Video Agent

EVA: 为端到端视频代理的高效强化学习

Yaolun Zhang, Ruohui Wang, Jiahao Wang, Yepeng Tang, Xuanyu Zheng, Haonan Duan, Hao Lu, Hanming Deng, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 EVA通过迭代总结-计划-行动-反思推理实现先规划后感知,提升长视频理解效率,采用三阶段学习流程和高质量数据集,在六个视频理解基准上取得显著提升。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24382 2026-03-26 cs.LG cs.AI cs.CE 73%

MolEvolve: LLM-Guided Evolutionary Search for Interpretable Molecular Optimization

MolEvolve: 基于大语言模型的可解释分子优化进化搜索

Xiangsen Chen, Ruilong Wu, Yanyan Lan, Ting Ma, Yang Liu

机构 * Hong Kong University of Science(香港科技大学) Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 MolEvolve通过大语言模型引导进化搜索,实现可解释的分子优化,优于传统方法在属性预测和分子优化任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19685 2026-03-23 cs.AI cs.LG cs.MA 73%

A Subgoal-driven Framework for Improving Long-Horizon LLM Agents

一种用于提升长周期LLM代理的子目标驱动框架

Taiyi Wang, Sian Gooding, Florian Hartmann, Oriana Riva, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出子目标分解规划框架和MiRA强化学习框架,通过实时规划和密集奖励信号提升LLM在长周期任务中的表现,成功率达到43.0%。

Comments 50 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13295 2026-03-17 cs.LG cs.AI 73%

ICPRL: Acquiring Physical Intuition from Interactive Control

ICPRL: 从交互控制中获取物理直觉

Xinrun Xu, Pi Bu, Ye Wang, Börje F. Karlsson, Ziming Wang, Tengtao Song, Qi Zhu, Jun Song, Shuo Zhang, Zhiming Ding, Bo Zheng

机构 * Institute of Software, Chinese Academy of Science(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) RUC(中国人民大学) PUC-Rio(里约热内卢联邦大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 ICPRL通过多轮组相对策略优化,使VLM在动态物理环境中获取物理直觉并适应策略,其世界模型预测潜在动作结果,提升物理谜题解决能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11052 2026-03-17 cs.DB cs.AI cs.CL cs.HC cs.IR 73%

GraphSeek: Next-Generation Graph Analytics with LLMs

GraphSeek: 基于LLM的下一代图分析

Maciej Besta, Łukasz Jarmocik, Orest Hrycyna, Shachar Klaiman, Konrad Mączka, Robert Gerstenberger, Jürgen Müller, Piotr Nyczyk, Hubert Niewiadomski, Torsten Hoefler

机构 * ETH Zurich(苏黎世联邦理工学院) IDEAS Research Institute(IDEAS研究机构) Cledar(Cledar公司) NCBJ Warszawa(华沙国家生物中心) BASF SE(巴斯夫股份有限公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GraphSeek框架,通过语义目录实现复杂多查询分析,提升图数据处理效率与效果,实现LLM推理与数据库级执行的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17188 2026-03-16 cs.CL cs.AI cs.IR 73%

Towards AI Search Paradigm

迈向人工智能搜索范式

Yuchen Li, Hengyi Cai, Rui Kong, Xinran Chen, Jiamin Chen, Jun Yang, Haojie Zhang, Jiayi Li, Jiayi Wu, Yiqun Chen, Changle Qu, Wenwen Ye, Lixin Su, Xinyu Ma, Lingyong Yan, Long Xia, Daiting Shi, Junfeng Wang, Xiangyu Zhao, Jiashu Zhao, Haoyi Xiong, Shuaiqiang Wang, Dawei Yin

机构 * Baidu Search(百度搜索)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AI搜索范式,通过四个LLM驱动代理动态适应各类信息需求,结合任务规划、工具集成和高效推理方法,构建可信赖、适应性强的下一代搜索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07527 2026-03-12 cs.AI cs.LG 73%

Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions

学习强化学习无法做到的:用于最难问题的交错在线微调

Lu Ma, Hao Liang, Meiyi Qiang, Lexiang Tang, Xiaochen Ma, Zhen Hao Wong, Junbo Niu, Chengyu Shen, Runming He, Yanhao Li, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京软件与硬件协同人工智能系统重点实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 ReLIFT通过结合强化学习和在线微调,提升模型在复杂问题上的推理能力,实现超过5.2分的性能提升。

Comments 12 pages, 5 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17938 2026-03-09 cs.CL cs.LG 73%

SPINE: Token-Selective Test-Time Reinforcement Learning with Entropy-Band Regularization

SPINE:基于熵带正则化的令牌选择性测试时间强化学习

Jianghao Wu, Yasmeen George, Jin Ye, Yicheng Wu, Daniel F. Schmidt, Jianfei Cai

机构 * Monash University(墨尔本大学) Imperial College London(伦敦帝国理工学院)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 SPINE通过令牌选择性和熵带正则化提升测试时间推理稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.14133 2026-03-04 cs.NI cs.AI cs.LG 73%

Network Topology Optimization via Deep Reinforcement Learning

通过深度强化学习进行网络拓扑优化

Zhuoran Li, Xing Wang, Ling Pan, Lin Zhu, Zhendong Wang, Junlan Feng, Chao Deng, Longbo Huang

机构 * IIIS, Tsinghua University(清华大学信息科学与技术学院) China Mobile Research Institute(中国移动研究院)

专题命中 规划推理 :planning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DRL-GS算法,通过深度强化学习优化网络拓扑,提升效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01907 2026-03-03 cs.LG cs.CL 73%

Efficient RLVR Training via Weighted Mutual Information Data Selection

通过加权互信息数据选择实现高效的RLVR训练

Xinyu Zhou, Boyu Zhu, Haotian Zhang, Huiming Wang, Zhijiang Guo

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.LG

AI总结 InSight通过加权互信息数据选择方法提升RLVR训练效率,实现性能和加速的显著提升。

Comments 15 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00977 2026-03-03 cs.AI cs.LG 73%

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents

HiMAC:用于长视界LLM代理的分层宏微学习

Hongbo Jin, Rongpeng Zhu, Jiayu Ding, Wenhao Zhang, Ge Li

机构 * School of Electronic and Computer Engineering(电子与计算机工程学院) Peking University(北京大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 HiMAC通过分层宏微学习框架,提升LLM代理在长视界任务中的规划与执行能力,实现更高效的强化学习训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19439 2026-02-26 cs.AI cs.LG math.OC 73%

OptiRepair: Closed-Loop Diagnosis and Repair of Supply Chain Optimization Models with LLM Agents

OptiRepair:基于LLM代理的闭环供应链优化模型诊断与修复

Ruicheng Ao, David Simchi-Levi, Xinshang Wang

机构 * Massachusetts Institute of Technology(麻省理工学院) Alibaba Group(阿里巴巴集团)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 OptiRepair通过训练LLM代理实现供应链优化模型的闭环诊断与修复,显著提升修复效率和合理性,解决求解器交互和运营合理性两大难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20502 2026-02-25 cs.AI cs.LG 73%

ActionEngine: From Reactive to Programmatic GUI Agents via State Machine Memory

ActionEngine: 通过状态机内存实现从响应式到程序化GUI代理的转变

Hongbin Zhong, Fazle Faisal, Luis França, Tanakorn Leesatapornwongsa, Adriana Szekeres, Kexin Rong, Suman Nath

机构 * Microsoft Research(微软研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 ActionEngine通过状态机内存实现从响应式到程序化GUI代理的转变,提升效率和准确性,减少成本和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27623 2026-02-24 cs.AI cs.CL cs.CV 73%

BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning

BEAT:通过对比触发学习对基于VLM的具身代理进行视觉后门攻击

Qiusi Zhan, Hyeonjeong Ha, Rui Yang, Sirui Xu, Hanyang Chen, Liang-Yan Gui, Yu-Xiong Wang, Huan Zhang, Heng Ji, Daniel Kang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 BEAT通过对比触发学习在基于VLM的具身代理中实现视觉后门攻击,提升后门激活精度至39%。

Comments ICLR 2026. Project Page: https://zqs1943.github.io/BEAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14229 2026-02-17 cs.AI cs.ET cs.LG 73%

CORPGEN: Simulating Corporate Environments with Autonomous Digital Employees in Multi-Horizon Task Environments

CORPGEN:在多时间尺度任务环境中通过自主数字员工模拟企业环境

Abubakarr Jaye, Nigel Boachie Kumankumah, Chidera Biringa, Anjel Shaileshbhai Patel, Sulaiman Vesal, Dayquan Julienne, Charlotte Siska, Manuel Raúl Meléndez Luján, Anthony Twum-Barimah, Mauricio Velazco, Tianwei Chen

机构 * Microsoft Corporation(微软公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 CorpGen通过分层规划、子代理隔离和分层内存等机制,在多时间尺度任务环境中实现自主数字员工的高效模拟,提升企业环境模拟的完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12662 2026-02-16 cs.AI cs.CL 73%

Think Fast and Slow: Step-Level Cognitive Depth Adaptation for LLM Agents

快速思考与缓慢思考:面向LLM代理的步骤级认知深度适应

Ruihan Yang, Fanghua Ye, Xiang We, Ruoqing Zhao, Kang Luo, Xinbo Xu, Bo Zhao, Ruotian Ma, Shanyi Wang, Zhaopeng Tu, Xiaolong Li, Deqing Yang, Linus

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文恩)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CogRouter通过动态调整认知深度提升LLM代理在多轮决策任务中的性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12285 2026-02-16 cs.CL cs.AI 73%

From Biased Chatbots to Biased Agents: Examining Role Assignment Effects on LLM Agent Robustness

从有偏聊天机器人到有偏代理:检验角色分配对LLM代理鲁棒性的影响

Linbo Cao, Lihao Sun, Yang Yue

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现基于人口统计学的人设分配会影响LLM代理的行为和性能,导致高达26.2%的降级,揭示了代理系统中隐含偏见和行为波动的风险。

Comments Accepted to the AAAI 2026 TrustAgent Workshop. 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11583 2026-02-13 cs.AI cs.LG 73%

The Five Ws of Multi-Agent Communication: Who Talks to Whom, When, What, and Why -- A Survey from MARL to Emergent Language and LLMs

多智能体通信的五个W:谁与谁沟通,何时沟通,沟通什么,为何沟通——从MARL到涌现语言和LLMs的综述

Jingdi Chen, Hanqing Yang, Zongjun Liu, Carlee Joe-Wong

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了多智能体通信的五个W,探讨了从MARL到涌现语言和LLM的发展,分析了不同范式下的通信设计、权衡与挑战。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07695 2026-02-12 cs.AI cs.CL cs.IR cs.MM 73%

EventCast: Hybrid Demand Forecasting in E-Commerce with LLM-Based Event Knowledge

EventCast:基于LLM事件知识的电子商务混合需求预测

Congcong Hu, Yuang Shi, Fan Huang, Yang Xiang, Zhou Ye, Ming Jin, Shiyu Wang

机构 * ByteDance China(字节跳动中国) National University of Singapore(新加坡国立大学) Griffith University(格里菲斯大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 EventCast通过整合LLM事件知识提升电子商务需求预测精度,实现86.9%和97.7%的MAE和MSE改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06967 2026-02-10 cs.RO cs.AI cs.CL 73%

Leveraging Adaptive Group Negotiation for Heterogeneous Multi-Robot Collaboration with Large Language Models

利用自适应群体谈判实现异构多机器人协作的大型语言模型

Siqi Song, Xuanbing Xie, Zonglin Li, Yuqiang Li, Shijie Wang, Biqing Qi

机构 * Tsinghua University(清华大学) Central South University(中南大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CLiMRS通过自适应群体谈判框架提升异构多机器人协作效率,实验显示在复杂任务中效率提升超40%。

Comments 20 pages, 12 figures, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10962 2026-02-06 cs.LG cs.AI 73%

WebSTAR: Scalable Data Synthesis for Computer Use Agents with Step-Level Filtering

WebSTAR: 可扩展的数据合成用于计算机使用代理的步级过滤

Yifei He, Pranit Chawla, Yaser Souri, Subhojit Som, Xia Song

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 WebSTAR通过步级过滤技术合成高质量数据,构建了WebSTAR和WebSCORE数据集,并训练了高效的过程奖励模型StepRM,提升计算机使用代理的训练效果和部署效率。

Comments Project website: https://yifei-he.github.io/webstar-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17489 2026-02-05 cs.CL cs.AI 73%

MapCoder-Lite: Distilling Multi-Agent Coding into a Single Small LLM

MapCoder-Lite:将多智能体编码 distilling 进单一小型 LLM

Woongkyu Lee, Junhee Cho, Jungwook Choi

机构 * Hanyang University(翰阳大学) Samsung SDS(三星SDS)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 MapCoder-Lite通过三支柱方法将多智能体编码distilling进单一7B模型,显著提升代码生成性能并降低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01915 2026-02-03 cs.LG cs.AI 73%

VLM-Guided Experience Replay

基于VLM的经验回放

Elad Sharony, Tom Jurgenson, Orr Krupnik, Dotan Di Castro, Shie Mannor

机构 * Nvidia Research(英伟达研究)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用VLMs指导经验回放,提升强化学习中样本效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19875 2026-02-03 cs.CL cs.AI 73%

Stream: Scaling up Mechanistic Interpretability to Long Context in LLMs via Sparse Attention

Stream: 通过稀疏注意力扩展机械可解释性以分析LLM中的长上下文

J Rosser, José Luis Redondo García, Gustavo Penha, Konstantina Palla, Hugues Bouchard

机构 * University of Oxford(牛津大学) Spotify Spain(Spotify西班牙分公司) Spotify Netherlands(Spotify荷兰分公司) Spotify UK(Spotify英国分公司)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 Stream通过稀疏注意力技术实现LLM长上下文的高效可解释性分析,显著减少内存消耗并提升推理轨迹追踪能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10691 2026-02-02 cs.CL cs.AI 73%

Evaluating from Benign to Dynamic Adversarial: A Squid Game for Large Language Models

从温和到动态对抗的评估:一个大型语言模型的鱿鱼游戏

Zijian Chen, Wenjun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出鱿鱼游戏,一个动态对抗性评估环境,用于评估大型语言模型的多方面能力,并揭示静态基准中可能存在的评估范式污染问题。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏