arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-06 至 2026-01-06 共收录 17 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 17 篇

2601.01723 2026-01-06 cs.CR 88%

Structural Representations for Cross-Attack Generalization in AI Agent Threat Detection

结构表示用于AI代理威胁检测中的跨攻击泛化

Vignesh Iyer

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

AI总结 本文提出结构标记化方法,通过编码执行流程模式提升AI代理威胁检测的跨攻击泛化能力,显著提高对未知攻击的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00868 2026-01-06 cs.LG cs.AI 84%

SmartFlow Reinforcement Learning and Agentic AI for Bike-Sharing Optimisation

SmartFlow 强化学习与代理AI用于自行车共享优化

Aditya Sreevatsa K, Arun Kumar Raveendran, Jesrael K Mani, Prakash G Shigli, Rajkumar Rangadore, Narayana Darapaneni, Anwesh Reddy Paduri

机构 * Department of Data Science, Machine Learning \& Artificial Intelligence, PES University, Bengaluru, Karnataka - 560100, India 1 Sunrise Setting Ltd, 12a Fore Street, St. Marychurch, Torquay, Devon, TQ1 4NE, UK 2 European Alliance for Innovation (EAI), Gent, Belgium

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 SmartFlow 通过整合强化学习与代理AI,实现城市自行车共享系统的高效再平衡,显著减少网络不平衡并提升运营效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01366 2026-01-06 cs.AI 83%

KGCE: Knowledge-Augmented Dual-Graph Evaluator for Cross-Platform Educational Agent Benchmarking with Multimodal Language Models

KGCE:基于多模态语言模型的跨平台教育代理基准评估知识增强双图评估器

Zixian Liu, Sihao Liu, Yuqi Zhao

机构 * Faculty of the School of Computer Science, Central China Normal University(中央财经大学计算机学院)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 KGCE提出一种基于多模态语言模型的跨平台教育代理基准评估框架,通过知识库增强和双图评估方法提升对特定学校软件任务的执行效率和评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01008 2026-01-06 eess.IV cs.AI cs.CV 83%

An Explainable Agentic AI Framework for Uncertainty-Aware and Abstention-Enabled Acute Ischemic Stroke Imaging Decisions

可解释的代理AI框架:用于不确定性和可 abstention 的急性缺血性中风影像决策

Md Rashadul Islam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Daffodil International University(达福尔国际大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出了一种可解释的代理AI框架,用于在急性缺血性中风影像学中实现不确定性意识和选择性退避,以提高临床决策的安全性和透明性。

Comments Preprint. Conceptual and exploratory framework focusing on uncertainty-aware and abstention-enabled decision support for acute ischemic stroke imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01673 2026-01-06 cs.CR cs.AI 77%

Exposing Hidden Interfaces: LLM-Guided Type Inference for Reverse Engineering macOS Private Frameworks

揭示隐藏接口:LLM引导的类型推断用于macOS私有框架逆向工程

Arina Kharlamova, Youcheng Sun, Ting Yu

专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 MOTIF通过LLM引导的类型推断技术,显著提升了对macOS私有框架的逆向工程能力,实现了更高的签名恢复率和更稳定的推断结果。

Comments IEEE S&P'26 under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03860 2026-01-06 cs.CL cs.AI cs.LG 75%

Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models

幻觉与事实:大型语言模型中事实核查与事实性评估的综述

Subhey Sadi Rahman, Md. Adnanul Islam, Md. Mahbub Alam, Musarrat Zeba, Md. Abdur Rahman, Sadia Sultana Chowa, Mohaimenul Azam Khan Raiaan, Sami Azam

机构 * Department of Computer Science and Engineering, United International University, Dhaka 1212, Bangladesh(乌姆特国际大学计算机科学与工程系) Department of Computer Science and Engineering, Daffodil International University, Dhaka-1341, Bangladesh(达芙尼国际大学计算机科学与工程系) Faculty of Science and Technology, Charles Darwin University, Casuarina, NT 0909, Australia(查尔斯·达尔文大学科学与技术学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文综述了大型语言模型中事实核查与事实性评估的关键挑战及方法,强调了提升事实准确性的重要性。

Journal ref Artif. Intell. Rev. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01844 2026-01-06 cs.AI 70%

Clinical Knowledge Graph Construction and Evaluation with Multi-LLMs via Retrieval-Augmented Generation

基于多语言模型的临床知识图谱构建与评估:通过检索增强生成

Udiptaman Das, Krishnasai B. Atmakuri, Duy Ho, Chi Lee, Yugyung Lee

机构 * University of Missouri–Kansas City(密苏里大学-堪萨斯城分校) California State University, Fullerton(加州州立大学弗雷斯诺分校)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于多语言模型的临床知识图谱构建与评估框架,通过检索增强生成策略实现从自由文本到可解释、临床相关知识图谱的端到端构建与持续优化。

Comments 13 pages, 5 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02314 2026-01-06 cs.AI 57%

Project Ariadne: A Structural Causal Framework for Auditing Faithfulness in LLM Agents

Project Ariadne: 一种用于审计大语言模型代理忠实性的结构因果框架

Sourena Khanzadeh

机构 * Sourena Khanzadeh(独立研究者)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 Project Ariadne提出一种结构因果框架,通过因果干预评估大语言模型代理推理的忠实性,揭示代理推理与决策之间的因果脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21907 2026-01-06 cs.AI 57%

SpatialBench: Can Agents Analyze Real-World Spatial Biology Data?

SpatialBench: 聊聊智能体能否分析真实世界的空间生物学数据?

Kenny Workman, Zhen Yang, Harihara Muralidharan, Hannah Le

机构 * LatchBio

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 SpatialBench通过146个可验证问题评估智能体分析真实世界空间生物学数据的能力,揭示了模型性能受设计和平台影响显著,需进一步优化工具与流程。

Comments 10 pages, 9 figures, 4 tables; NeurIPS 2024 format

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01530 2026-01-06 cs.CL cs.HC 57%

EmoHarbor: Evaluating Personalized Emotional Support by Simulating the User's Internal World

EmoHarbor:通过模拟用户的内心世界评估个性化情感支持

Jing Ye, Lu Xiang, Yaping Zhang, Chengqing Zong

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 EmoHarbor通过模拟用户内心世界,评估个性化情感支持的定制能力,揭示大语言模型在情感支持中的不足,推动用户感知情感支持系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00930 2026-01-06 cs.IR cs.AI 57%

AlignUSER: Human-Aligned LLM Agents via World Models for Recommender System Evaluation

AlignUSER: 通过世界模型对齐LLM代理以评估推荐系统

Nicolas Bougie, Gian Maria Marconi, Tony Yip, Narimasa Watanabe

机构 * Woven by Toyota(丰田织物)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AlignUSER通过世界模型驱动的代理学习,利用人类交互数据提升推荐系统评估的准确性与真实用户行为的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09737 2026-01-06 cs.AI cs.RO 57%

General Dynamic Goal Recognition using Goal-Conditioned and Meta Reinforcement Learning

使用目标条件化和元强化学习进行通用动态目标识别

Osher Elhadad, Owen Morrissey, Reuth Mirsky

机构 * Department of Computer Science, Bar Ilan University(巴伊兰大学计算机科学系) Department of Computer Science, Tufts University(塔夫茨大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出两种方法,通过目标条件化和元强化学习实现动态环境下的目标识别,提升系统在变化和噪声中的适应能力与识别精度。

Comments Accepted for publication at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.08674 2026-01-06 cs.GT 50%

Budget Pacing in Repeated Auctions: Regret and Efficiency without Convergence

重复拍卖中的预算节奏:无需收敛的遗憾与效率

Jason Gaitonde, Yingkai Li, Bar Light, Brendan Lucier, Aleksandrs Slivkins

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了重复拍卖中预算节奏算法的福利和效率保障,证明了无需动态收敛即可获得至少一半最优液体福利,并展示了动态遗憾界限及对核心拍卖的鲁棒性。

Comments Preliminary version in ITCS 2023. MAJOR UPDATES since then: our aggregate and individual guarantees are extended to several other gradient-based pacing algorithms (Section 5, since Dec'25), the regret analysis is extended to the utility-maximization objective (since Dec'25), and numerical experiments are added (Section 6, since Aug'24, with additional baselines added in Dec'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01334 2026-01-06 econ.TH 50%

Agreement with reservation of judgment under risk

风险下保留判断的协议

Leo Kurata, Kensei Nakamura

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出在风险下保留判断的帕累托原则,通过加权求和构建社会效用函数,确保自然属性的聚合规则。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17468 2026-01-06 q-fin.RM 50%

Optimal design of reinsurance contracts with a continuum of risk assessments

再保险合同最优设计与风险评估的连续体

Ka Chun Cheung, Sheung Chi Phillip Yam, Fei Lung Yuen, Yiying Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过委托-代理模型,分析在存在信息不对称的垄断再保险市场中,针对连续体保险公司类型进行最优合同设计,证明再保险人会将代理人分为高风险和低风险两组,并解决了三种常见再保险结构的最优问题。

Comments 36 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03554 2026-01-06 econ.TH 50%

Categorize and randomize: a permissive model of stochastic choice

分类与随机化:一种允许性的随机选择模型

Ester Sudano

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种允许性随机选择模型,通过分类和随机选择机制解释消费者行为,并扩展了卢斯模型和嵌套日志it模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00839 2026-01-06 cs.CV 50%

Unified Review and Benchmark of Deep Segmentation Architectures for Cardiac Ultrasound on CAMUS

针对心脏超声的深度分割架构的统一回顾与基准测试:CAMUS

Zahid Ullah, Muhammad Hilal, Eunsoo Lee, Dragan Pamucar, Jihie Kim

机构 * Department of Computer Science Artificial Intelligence, Dongguk University, Seoul 04620, Republic of Korea Department of Semiconductor System Engineering, Sejong University, Seoul, 05006, Republic of Korea Department of Operations Research Statistics, Faculty of Organizational Sciences, University of Belgrade, Belgrade, Serbia Department of Industrial Engineering \& Management, Yuan Ze University, Taoyuan City 320315, Taiwan Department of Applied Mathematical Science, College of Science Technology, Korea University, Sejong 30019, Republic of Korea

专题命中 Agent评测 :workflow(abstract)

AI总结 本文通过统一基准测试评估了三种心脏超声分割架构的性能,提出标准化预处理方法,并展望了自监督和多模态标注技术的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏