arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-24 至 2026-02-24 共收录 195 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 36 篇

2602.18891 2026-02-24 cs.CY cs.AI cs.HC 57%

Orchestrating LLM Agents for Scientific Research: A Pilot Study of Multiple Choice Question (MCQ) Generation and Evaluation

协调大型语言模型代理进行科学研究:多选题生成与评估的试点研究

Yuan An

机构 * College of Computing and Informatics(计算与信息学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文研究了通过协调多个LLM代理生成和评估多选题,发现生成的题目在质量上存在与专家审核题目不完全可比的问题,同时揭示了科学研究中劳动力向AI研究操作技能转变的趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18716 2026-02-24 cs.RO cs.AI 57%

Temporal Action Representation Learning for Tactical Resource Control and Subsequent Maneuver Generation

战术资源控制与后续机动生成的时序动作表示学习

Hoseong Jung, Sungil Son, Daesol Cho, Jonghae Park, Changhyun Choi, H. Jin Kim

机构 * Seoul National University(首尔国立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 TART通过时序动作表示学习框架,有效整合资源使用与机动生成,提升有限资源下的战术决策能力。

Comments ICRA 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18462 2026-02-24 cs.CY cs.AI 57%

Assessing the Reliability of Persona-Conditioned LLMs as Synthetic Survey Respondents

评估基于人设的大型语言模型作为合成调查受访者可靠性

Erika Elizabeth Taday Morocho, Lorenzo Cima, Tiziano Fagni, Marco Avvenuti, Stefano Cresci

机构 * IIT-CNR, University of Pisa(IIT-CNR与比萨大学) University of Florence(佛罗伦萨大学) University of Pisa(比萨大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文评估了基于人设的LLM作为合成调查受访者可靠性,发现多属性提示可能引入偏差,影响子群体的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19939 2026-02-24 physics.soc-ph 50%

Mass Manipulation in Simulated Social Networks: Dominating vs. Diversifying Attention

模拟社交网络中的信息操控:主导注意力还是多样化注意力

Viktoria Kainz, Justin Sulik, Anna Neudert, Torsten Enßlin

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过模拟社交网络,探讨了主题多样化在对抗虚假信息中的有效性,发现多样化注意力能有效减少虚假信息的影响。

Comments main part: 22 pages, 13 figures, 1 table; appendix: 4 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19507 2026-02-24 cs.HC 50%

Conversational AI for Automated Patient Questionnaire Completion: Development Insights and Design Principles

用于自动患者问卷完成的对话式AI:开发见解与设计原则

David Fraile Navarro, Mor Peleg

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于生成式AI的对话代理,用于自动完成患者问卷,通过主题对话提高数据收集效率,并总结了设计原则和开发经验。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19488 2026-02-24 econ.GN q-fin.EC 50%

The dynamics of innovation diffusion: A survey of Bass-type models

创新扩散的动力学:Bass型模型的综述

Nicolas Langrené, Rui Liu, Xiangqin Wu, Tianhao Zhi

专题命中 Agent评测 :agent(abstract)

AI总结 本文综述了Bass型模型在创新扩散研究中的发展,涵盖模型扩展、参数估计方法及替代模型,揭示了该领域近几十年的研究进展。

Comments 26 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19453 2026-02-24 physics.soc-ph cond-mat.stat-mech nlin.AO 50%

Emergence of opinion splits in the Sznajd model with latency

带有延迟的Sznajd模型中意见分裂的出现

Ryan W. Salatti, André M. Timpanaro

专题命中 Agent评测 :agent(abstract)

AI总结 研究发现,在Sznajd模型中引入延迟后,低延迟时一种意见主导,高延迟时两种意见对称共存,而更多意见共存不稳定,揭示了意见分裂的机制。

Comments 7 pages (main text) + 10 pages (appendices), 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19073 2026-02-24 cs.CE 50%

Evaluation and Benchmarking Suite for Financial Large Language Models and Agents

金融大语言模型与代理的评估与基准测试套件

Shengyuan Lin, Kaiwen He, Jaisal Patel, Qinchuan Zhang, Chris Ding, James Tang, Keyi Wang, Yupeng Cao, Yan Wang, Kairong Xiao, Vincent Caldeira, Matt White, Xiao-Yang Liu Yanglet

专题命中 Agent评测 :agentic(abstract)

AI总结 本文提出了一套评估和基准测试套件,用于评估和比较金融大语言模型与代理,促进更稳健的FinAI生态系统。

Comments 13 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14631 2026-02-24 econ.TH 50%

The Effects of Social Pressure on Fundamental Choices: Indecisiveness and Deferral

社会压力对基本选择的影响:犹豫与延后

Alfio Giarlotta, M. Ali Khan, Angelo Enrico Petralia, Francesco Reito

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种非标准的模型,探讨社会压力如何影响消费者选择,通过分解决策为两个阶段,揭示犹豫与延后行为对社会造成的损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11035 2026-02-24 cs.HC 50%

SusBench: An Online Benchmark for Evaluating Dark Pattern Susceptibility of Computer-Use Agents

SusBench: 一个用于评估计算机使用代理对暗模式易感性的在线基准

Longjie Guo, Chenjie Yuan, Mingyuan Zhong, Robert Wolfe, Ruican Zhong, Yue Xu, Bingbing Wen, Hua Shen, Lucy Lu Wang, Alexis Hiniker

专题命中 Agent评测 :autonomous agent(abstract)

AI总结 SusBench通过构建真实暗模式评估CUAs对操纵性界面的易感性,发现人类和代理对预选、误导性措辞和隐藏信息等暗模式特别敏感。

Comments Accepted as a full paper to IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18751 2026-02-24 eess.SY cs.SY 50%

Seeking Nash Equilibrium in Non-cooperative Quadratic Games Under Delayed Information Exchange

在延迟信息交换下的非合作二次游戏中寻找纳什均衡

Kaichen Jiang, Yuyue Yan, Mingda Yue, Yuhu Wu

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在延迟信息交换下非合作二次游戏中寻找纳什均衡的方法,通过设计估计机制和限制学习率,实现了策略配置的渐近收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18714 2026-02-24 cs.CE 50%

Universal Basic Income with Time-Decaying Currency: Structural Effects on Essential Labor and Long-Term Formation

全民基本收入与时间衰减货币:对基本劳动和长期形成结构的影响

Hitoshi Yamada

专题命中 Agent评测 :agent(abstract)

AI总结 本研究探讨了时间衰减货币作为全民基本收入机制对基本劳动和长期人力资本形成的影响,发现其在稳定短期生活条件的同时可能扭曲长期激励。

Comments 13 pages, 3 figures. Simulation-based study of dual-currency UBI mechanism

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18506 2026-02-24 cs.GT cs.MA 50%

Control in Hedonic Games

霍德尼克游戏中的控制

Jiehua Chen, Jakob Guttmann, Merisa Mustajbašić, Sofia Simola

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了霍德尼克游戏中通过添加或删除代理来实现联盟形成控制的问题,分析了不同稳定性和偏好下的计算复杂性。

Comments Conference version appears at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06467 2026-02-24 physics.soc-ph math-ph math.MP 50%

Kinetic modeling of knowledge and wealth dynamics in national and global markets

知识与财富动态的动能建模:国家与全球市场

Marzia Bisi, Martina Conte, Maria Groppi

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出动能模型研究国家和全球市场中财富与知识的动态演变,通过微观交互规则揭示代理行为,推导福克-平克方程并分析帕累托尾部形成。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2602.19783 2026-02-24 econ.GN q-fin.EC 50%

Janus-Faced Technological Progress and the Arms Race in the Education of Humans and Chatbots

双面技术进步与人类及聊天机器人教育的军备竞赛

Wolfgang Kuhle

专题命中 其他Agent :AI agent(abstract)

AI总结 本文研究了技术进步与对数正态工资分布如何导致人类和聊天机器人陷入低效教育军备竞赛,并探讨了其对GDP、不平等和福利的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏