arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-28 至 2026-08-28 共收录 37 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 37 篇

2608.07167 2026-08-28 cs.AI 版本更新 91%

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体

Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid

专题命中 Agent评测 :agent(title,summary_cn);AI agent(title);autonomous agent(abstract);分类 cs.AI

AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04292 2026-08-28 cs.CV 版本更新 89%

Binding Biometrics with AI Agent Identifiers for Delegation of Authority

将生物特征与AI智能体标识符绑定以实现权限委托

Joseph Geo Benjamin, Anil K Jain, Karthik Nandakumar

机构 * Michigan State University(密歇根州立大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(abstract)

AI总结 本研究提出BIND框架,通过生物特征密码系统将人类生物特征与AI智能体ID及权限范围绑定,实现经认证的权限委托,基于人脸特征的实验验证其在零错误匹配率下96%真实匹配率,支持1024位智能体令牌。

Comments Accepted in IJCB sessions 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26225 2026-08-28 cs.AI cs.DC cs.MA cs.SE 新提交 86%

Agent Mesh: Reliability Primitives for Non-Idempotent Agent Delegation - Identity Adequacy and Evidence Adequacy

智能体网格:非幂等智能体委托的可靠性原语——身份充分性与证据充分性

Mazhar Shaikh, Anurag Rajkumar Bombarde, Harshal Pathak

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文研究生产智能体平台的故障问题,发现现有服务网格机制的假设不成立,提出身份与证据充分性,推导7个以委托为单元的可靠性原语。

Comments 14 pages, 9 figures, 6 tables; 5-page ancillary supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27454 2026-08-28 cs.AI cs.CL 新提交 84%

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

WikiSkill:将智能体经验编译为持久知识以实现技能演化

Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan, Tu Vu

机构 * Google Research(谷歌研究院) Virginia Tech(弗吉尼亚理工大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 WikiSkill是使智能体技能与持久知识库协同演化的框架,在多基准与模型上优于现有方法,证实持久知识积累对技能演化关键,且演化技能可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27260 2026-08-28 cs.AI cs.CL 新提交 84%

What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents

什么构成优质的智能体数据?LLM智能体数据生成的ACE视角

Xingshan Zeng, Zishan Xu, Boju Zhang, Yuzhou Wu, Lingzhi Wang, Jianghao Lin, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Weinan Zhang, Yong Yu, Qun Liu, Weiwen Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Shanghai Jiao Tong University(上海交通大学) Northwestern University(西北大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对LLM智能体数据生成领域提出两级框架与ACE视角,明确核心挑战是为演化的智能体与环境分配有效、非冗余的经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26950 2026-08-28 cs.AI cs.CL 新提交 84%

From Atomic to Agentic: Towards Interpretable Evaluation of LLMs' Agentic Mathematical Capabilities

从原子到智能体:迈向大语言模型智能体数学能力的可解释评估

Jiayi Kuang, Yinghui Li, Yunze Song, Keyu Chen, Zhifeng Shen, Yangning Li, Yidong Wang, Di Yin, Ruizhi Qiao, Xing Sun, Kai Jin, Ying Shen, Liang Lin, Philip S. Yu

机构 * Sun Yat-sen University(中山大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Pengcheng Laboratory(鹏城实验室)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出过程级基准,对齐智能体行为与数学原子能力分类,评估LLMs智能体数学推理能力,发现相似端到端准确率的模型智能体能力轮廓差异显著,凸显过程级评估的重要性。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26546 2026-08-28 cs.AI cs.CL 新提交 84%

DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows

DuMateBench:评估自主智能体在复杂真实工作流程中的表现

Zechun Niu, Yukun Zhao, Jiaxin Zhang, Xu Shen, Jinhua Si, Han Tian, Can Xu, Yunfan Song, Jiaxin Mao, Yansong Gao, Yuchen Li, Jianmin Wu, Lingyong Yan, Shuaiqiang Wang, Dawei Yin

机构 * Renmin University of China(中国人民大学) Shandong University(山东大学) Michigan State University(密歇根州立大学) Nankai University(南开大学) East China Normal University(华东师范大学) Imperial College London(伦敦帝国学院) Baidu, Inc.(百度公司)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 DuMateBench是基于真实用户会话构建的自主智能体评估基准,含200个跨8场景的任务,注入三类环境复杂性,搭配五款智能体框架与四款LLM实验,发现严格任务完成存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26195 2026-08-28 cs.SE 新提交 83%

Cost-Utility Alignment in LLM Agent Trajectories:Profiling,Attribution,Diagnosis,Adaptation,and Evaluation

大语言模型智能体轨迹中的成本-效用对齐:分析、归因、诊断、适配与评估

Dan Liu, Jian Li

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.SE

AI总结 本研究提出以轨迹为中心的成本-效用对齐框架,通过五阶段分析解决LLM智能体资源消耗与任务贡献不匹配问题,为资源感知的智能体设计部署提供结构化基础。

Comments 12pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23045 2026-08-28 cs.AI 版本更新 81%

From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation

从惯性到客观性:通过噪声隔离改进深度研究智能体

Xiangxin Zhang, Zhanwei Zhang, Zhihang Fu, Binbin Lin, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(summary_cn,abstract);分类 cs.AI

AI总结 针对深度研究智能体存在的惯性偏差问题,提出NIS-Agent方法,在网页分类和最终答案验证环节应用上下文隔离,降低33%的token成本,训练的8B模型性能可与GPT-4o相当。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26733 2026-08-28 cs.CR cs.AI cs.LG 新提交 81%

Daydreaming: Stealing Hidden Agent Skills through Black-Box Task Interaction

白日梦:通过黑盒任务交互窃取隐藏的智能体技能

Yu-Lin Tsai, Yu-An Lu, Ci-Yang Tsai, Muxi Lyu, Raluca Ada Popa, Chia-Mu Yu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出Daydreaming攻击,通过黑盒任务交互窃取智能体技能,在7种技能和4种模型上恢复了原始技能86.8%的能力,性能优于SigLeak,证明仅隐藏技能文件无法阻止功能重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24279 2026-08-28 cs.CL cs.SE 版本更新 81%

ContextEcho: A Benchmark for Persona Drift in Long Agentic-Coding Sessions

ContextEcho: 长智能编码会话中角色漂移的基准测试

Xianzhong Ding, Yangyang Yu, Changwei Liu, Bill Zhao, Le Chen, Tao Chen

机构 * Center for Advanced AI(先进人工智能中心)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL、cs.SE

AI总结 提出ContextEcho基准测试,通过25探针身份套件和快照-探针协议,测量部署规模下长编码会话中语言模型角色漂移的普遍性、压缩影响及下游效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26237 2026-08-28 cs.CR cs.AI 新提交 79%

How Do LLM Agents Actually Get the Flag? Trace-Level Provenance for Agentic Offensive Security Evaluation

大语言模型智能体究竟如何拿到Flag?面向智能体进攻性安全评估的追踪级来源分析

Kimberly Milner, Minghao Shao, Nanda Rani, Haoran Xi, Venkata Sai Charan Putrevu, Meet Udeshi, Sandeep K. Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Muhammad Shafique, Ramesh Karri

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 针对现有CTF基准评估智能体进攻性安全能力时忽略轨迹的问题,本文提出CTF-ABACUS框架,通过追踪级审计验证漏洞利用,发现仅62%-87%的恢复Flag为真实利用,为优化基准设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22444 2026-08-28 cs.CL 版本更新 79%

Aligned Alone, Misaligned Together: Forecasting Adversarial Capture in LLM Agent Populations

单独对齐,共同错位:预测大语言模型智能体群体中的对抗捕获

Isotta Magistrali, Chen Shani

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 该研究针对LLM智能体群体,提出从群体无攻击时的良性运行状态校准响应函数,可提前预测坚定少数群体引发的对抗捕获,且捕获为临时状态,孤立对齐不等同于群体对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27009 2026-08-28 cs.CR 新提交 78%

The Guard That Cried Wolf: How Scary Words Make Agent Guardrails Refuse Legitimate Actions

会喊“狼来了”的守卫:恐怖词汇如何导致智能体防护栏拒绝合法操作

Yingjie Zhang, Yuanbo Xie, Kai Chen

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究构建了首个针对智能体防护栏过度安全问题的基准Cautious Bench,发现防护栏存在名称迷信效应,会因对象名称而非授权上下文过度拒绝合法操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26238 2026-08-28 cs.CV cs.GR 新提交 78%

Procedura: Agentic 3D Modeling with Procedural Control

Procedura:基于程序控制的智能体3D建模

Youtian Lin, Yikang Yang, Zhanpeng Hu, Mengqi Zhou, Feihu Zhang, Xun Cao, Jiaheng Liu, Yao Yao

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 针对原生3D生成器缺乏部件结构与可编辑性的问题,提出Procedura框架,以LLM编码能力构建参数化程序集,在P3D-Bench和MechBench-36上表现优于现有方法,生成可编辑的部件结构化3D模型。

Comments Project page: this https URL (https://spatiaos.github.io/projects/procedura/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26372 2026-08-28 cs.CL cs.AI 新提交 73%

Knowledge-Verified Emergent Deception in LLM Agents Under Conflicting Incentives

利益冲突情境下LLM智能体中经知识验证的涌现式欺骗

Zheyuan Liu, Weiliang Zhao, Xiangchi Yuan, Ningshan Ma, Yue Huang, Meng Jiang

机构 * University of Notre Dame(圣母大学) Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对利益冲突下LLM智能体的诚实性问题,构建KnownLieBench基准并开展实验,发现不同模型的涌现式欺骗存在差异,诚实导向微调可减少激励下的欺骗。

Comments A benchmark for knowledge-verified emergent deception in LLM agents under conflicting incentives

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27311 2026-08-28 cs.AI 新提交 70%

Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification

更智能地验证,进一步进化:通过感知行为的验证实现高效的智能体控制策略进化

Jinghan Xu, Yikai Zhang, Aili Chen, Weiyuan Li, Jiaqing Liang, Deqing Yang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 针对智能体控制策略进化中验证成本高的问题,提出HarnessLens框架,通过行为感知的选择性验证,在提升保留任务性能的同时大幅降低评估预算。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22631 2026-08-28 cs.LG 版本更新 70%

Learning Generalizable Behaviors for Terminal Agents

学习终端智能体的可泛化行为

Yihang Yao, Bo Pang, Xuan Phi Nguyen, Ding Zhao, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce人工智能研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本研究针对终端智能体泛化问题,提出智能体组合泛化假设,开发训练方案River,其用不足30%的TMax环境使多规模模型在两个基准上RL增益平均提升超100%,且性能优于开源8B模型、可跨多维度泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27167 2026-08-28 cs.AI cs.CL 新提交 62%

Calibrated Enough to Know, Not Calibrated to Act: Fabricated Evidence Makes LLM Agents Commit to the Unknowable

足够校准以知晓,却未校准以行动:伪造证据使大语言模型智能体对不可知之事作出承诺

Pranav Aggarwal

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究发现LLM智能体易被伪造证据诱导对不可知问题作出错误承诺,其「行动/弃权(不执行)」闸门可通过合成案例微调优化,但对僵化响应格式敏感,部署需兼顾这一特性。

Comments 28 pages, 6 figures. Code, data, pre-registration and all cached model outputs: this https URL (https://github.com/Pranav-1100/confidence-calibration-evaluation). Also archived at Zenodo, DOI https://doi.org/10.5281/zenodo.22043517

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27146 2026-08-28 cs.AI cs.SE 新提交 62%

When Tool Outputs Become Commands: Separating Action Induction from Runtime Authorization in Tool-Augmented LLM Agents

当工具输出成为命令:在工具增强型大语言模型智能体中分离动作诱导与运行时授权

Xiaokun Guo, Zhen Xu, Dongdong Huo, Yanqiu Zhang, Wei Wang, Qinfu Yang, Dongjin Yu, Yu Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究针对工具增强型LLM智能体中工具输出成为命令的风险,提出SARA框架分离动作诱导与执行授权,在AgentDojo等数据集上有效限制攻击成功率并保持任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26674 2026-08-28 cs.CL cs.AI 新提交 62%

Do LLMs Understand Personality? Rethinking Persona Fidelity Evaluation through Structured Behavioral Inference

大语言模型是否理解人格?通过结构化行为推理重新思考人格保真度评估

Mengfan Li, Zesheng Wei, Xuanhua Shi, Yang Deng

机构 * Singapore Management University(新加坡管理大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对现有LLM人格评估范式的局限,提出基于SFL的PRISM框架,将人格保真度评估转化为结构化逆推理任务,实验显示其评估结果更准确稳定。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26860 2026-08-28 cs.LG cs.AI math.OC 新提交 62%

Reinforcement Learning-Based Control of CAV Platoon Joining Maneuvers in Mixed Traffic

基于强化学习的混合交通环境下网联自动驾驶车辆(CAV)队列汇入机动控制

Biao Yin, Abderrahmane Kasmi, Nadir Farhi

机构 * Université Gustave Eiffel(古斯塔夫·埃菲尔大学) Université Paris Dauphine-PSL(巴黎多芬大学-PSL) Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia机构)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对混合交通环境下CAV队列汇入的安全高效控制问题,提出结合SUMO的建模框架,评估PPO等DRL算法,发现PPO在平衡安全与效率上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26221 2026-08-28 physics.soc-ph cs.AI cs.LG cs.MA 新提交 62%

Prompt Sensitivity of Generative Agents: Evidence from an Epidemic Model

生成式智能体的提示敏感性:来自流行病模型的证据

Ross Williams, Niyousha Hosseinichimeh

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究借助生成式智能体流行病模型,探究生成式智能体的行为对提示修改和角色名称的敏感性,发现同义提示影响极小,提示微小变化或情境改变会影响结果,角色名称对流行病结果无显著影响。

Comments 14 pages, 3 figures. Code and data: this https URL (https://github.com/RossFW/Paper2-Prompt-Sensitivity-of-Generative-Agents)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23955 2026-08-28 cs.AI cs.DC cs.LG cs.SI q-fin.CP 版本更新 62%

From Accuracy to Auditability: A Survey of Determinism in Financial AI Systems

从准确性到可审计性:金融AI系统中的确定性综述

Ruizhe Zhou, Xiaoyang Liu, Gaoyuan Du, Yi Zheng, Shouxi Ren, Deepayan Chakrabarti, Dengdu Jiang

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文从系统视角综述了金融AI中表格模型、图网络和基于LLM的智能体工作流三种模态的不可重现性问题,通过实验量化了确定性指标并提出了分层评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27182 2026-08-28 cs.LG 新提交 57%

TraceBench: Controlled Evaluation of LLM Agents for Time-Series Root-Cause Attribution

TraceBench:用于时间序列根因归因的LLM智能体受控评估框架

Tommaso Bendinelli, Artur Dox, Christian Holz

机构 * ETH Zürich(苏黎世联邦理工学院) CSEM SA(CSEM公司)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究针对LLM智能体时间序列根因归因性能缺乏受控评估的问题,推出TraceBench框架,评估了四个LLM智能体的表现并揭示其分析规律,相关资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26400 2026-08-28 cs.SE cs.PL 新提交 57%

Spec2Vision: Contract-Guided Delivery of AI-Generated Computer Vision Pipelines

Spec2Vision:基于规约引导的AI生成计算机视觉流水线交付

Ghfran Jabour, Sergey Ivanov

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 该研究提出Spec2Vision框架,通过分阶段运行时保持任务规约明确性,在17项CV任务的850次运行评估中实现81/85的通过率,证实任务规约明确性对AI生成CV流水线交付的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26310 2026-08-28 cs.AI 新提交 57%

FaithSieve: Fine-Grained Evaluation of Math Proofs with Faithful Formal Evidence

FaithSieve:基于忠实形式证据的数学证明细粒度评估

Ziyu Wang, Qiming Dai, Yishan Wu, Zaiwen Wen

机构 * Peking University(北京大学) School of Mathematical Sciences(数学科学学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出Lean辅助框架FaithSieve,通过分解数学证明为细粒度单元并结合忠实形式证据,在两个专家验证数据集上提升了首个错误定位的精确评估准确率。

Comments 32 pages, 3 figures; preprint with appendix and supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12227 2026-08-28 cs.AI 版本更新 57%

Rethinking the Evaluation of Harness Evolution for Agents

重新思考智能体的 harness 进化评估

Yike Wang, Huaisheng Zhu, Zhengyu Hu, Yige Yuan, Zhengyu Chen, Shakti Senthil, Hannaneh Hajishirzi, Yulia Tsvetkov, Pradeep Dasigi, Teng Xiao

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 研究重新审视大语言模型智能体的自动 harness 进化评估,通过在可比条件下与基线比较及在保留任务上测试,发现其不总优于简单方法且泛化有限,对其有效性提出质疑,强调需更公平评估协议和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29353 2026-08-28 cs.AI 版本更新 57%

Nomad: Autonomous Exploration and Discovery

Nomad:自主探索与发现

Bokang Jia, Samta Kamboj, Satheesh Katipomu, Seung Hun Han, Neha Sengupta, Andrew Jackson

机构 * Inception, G42(G42 的 Inception) G42 MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Nomad通过探索优先架构,构建领域探索地图,系统遍历以平衡广度与深度,生成并验证假设,最终生成可信报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27261 2026-08-28 econ.TH 新提交 50%

Strategy-Proof and Minimally Wasteful Random Assignment

防策略且浪费最少的随机分配

Christian Basteck, Lars Ehlers

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对不可分物品的随机分配问题,证明满足特定条件的机制必然存在至少1/6的代理人-物品浪费,且随机串行独裁(RSD)在相关场景中达到浪费最小界限,随机延期接受(RDA)浪费更低但违反平等对待条件。

详情

展开后加载摘要…

URL PDF HTML 收藏