arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-13 至 2026-01-13 共收录 177 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 36 篇

2601.07763 2026-01-13 cs.GT 78%

Structural Approach to Guiding a Present-Biased Agent

结构化方法用于引导现时偏好代理

Tatiana Belova, Yuriy Dementiev, Artur Ignatiev, Danil Sagunov

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出了一种结构化方法,用于引导现时偏好代理,通过参数化算法分析任务图的计算复杂性,并给出了固定参数可 tractable 算法。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06920 2026-01-13 cs.NE cs.MA 78%

Calibrating Agent-Based Financial Markets Simulators with Pretrainable Automatic Posterior Transformation-Based Surrogates

基于可预训练的自动后验变换的代理基于金融市场模拟器校准

Boquan Jiang, Zhenhua Yang, Chenkai Wang, Muyao Zhong, Heping Fang, Peng Yang

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出ANTR方法,通过可预训练的神经密度估计器和自适应信任区域策略,提升代理基于金融市场模拟器的校准精度和效率。

Comments 32 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06216 2026-01-13 cs.CY cs.AI 77%

LLM Agents in Law: Taxonomy, Applications, and Challenges

法律中的LLM代理:分类、应用与挑战

Shuang Liu, Ruijia Zhang, Ruoyun Ma, Yujia Deng, Lanyi Zhu, Jiayu Li, Zelong Li, Zhibin Shen, Mengnan Du

机构 * Carnegie Mellon University(卡内基梅隆大学) National University of Singapore(国立新加坡大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) The University of Chicago(芝加哥大学) Rutgers University(罗格斯大学) Columbia University(哥伦比亚大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨了法律领域中LLM代理的分类、应用及挑战,分析了技术转变、应用分类、评估方法及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07606 2026-01-13 cs.CL cs.AI 73%

Proof of Time: A Benchmark for Evaluating Scientific Idea Judgments

证明时间:评估科学思想判断的基准

Bingyang Ye, Shan Chen, Jingxuan Tu, Chen Liu, Zidi Xiong, Samuel Schmidgall, Danielle S. Bitterman

机构 * Harvard University(哈佛大学) Mass General Brigham(麻省总医院) Boston Children’s Hospital(波士顿儿童医院) Brandeis University(布兰迪大学) Yale University(耶鲁大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 PoT通过半可验证的基准框架评估科学思想判断,利用时间分区和未来可验证的目标,结合离线沙盒实现可扩展的评估。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07403 2026-01-13 cs.CL 70%

LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction

LongEmotion: 测量大语言模型在长上下文交互中的情感智能

Weichu Liu, Jing Xiong, Yuxuan Hu, Zixuan Li, Minghuan Tan, Ningning Mao, Hui Shen, Wendong Xu, Chaofan Tao, Min Yang, Chengming Li, Lingpeng Kong, Ngai Wong

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) The University of Hong Kong(香港大学) City University of Hong Kong(香港城市大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Beijing Normal University(北京师范大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 LongEmotion是一个评估大语言模型在长上下文交互中情感智能的基准,通过多任务和协作框架提升模型在情绪识别与共情生成中的表现。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06838 2026-01-13 cs.CR cs.SE 70%

CHASE: LLM Agents for Dissecting Malicious PyPI Packages

CHASE:用于拆解恶意PyPI包的LLM代理

Takaaki Toda, Tatsuya Mori

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 CHASE通过多代理架构提升恶意PyPI包检测的可靠性,实现高召回率与低误报率。

Comments Accepted for publication and presented at the 2nd IEEE International Conference on AI-powered Software (AIware 2025). 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07484 2026-01-13 cs.GR 67%

R3-RECON: Radiance-Field-Free Active Reconstruction via Renderability

R3-RECON:通过可渲染性进行无辐射场主动重建

Xiaofeng Jin, Matteo Frosi, Yiran Guo, Matteo Matteucci

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 R3-RECON通过无辐射场的可渲染性场实现高效主动重建,提升新视角质量和3DGS重建精度。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01592 2026-01-13 cs.CR cs.CV 67%

OpenRT: An Open-Source Red Teaming Framework for Multimodal LLMs

OpenRT: 一种用于多模态大语言模型的开源红队框架

Xin Wang, Yunhao Chen, Juncheng Li, Yixu Wang, Yang Yao, Tianle Gu, Jie Li, Yan Teng, Yingchun Wang, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 OpenRT框架通过模块化设计和高吞吐量运行时,系统性评估多模态大语言模型的安全性,揭示了前沿模型在复杂攻击下的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06636 2026-01-13 cs.CL cs.AI 62%

MedEinst: Benchmarking the Einstellung Effect in Medical LLMs through Counterfactual Differential Diagnosis

MedEinst:通过反事实差异诊断基准测试医疗大语言模型中的Einstellung效应

Wenting Chen, Zhongrui Zhu, Guolin Huang, Wenxuan Wang

机构 * Stanford University(斯坦福大学) Xi’an Jiaotong University(西安交通大学) Shenzhen University(深圳大学) Renmin University of China(中国人民大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 MedEinst通过反事实差异诊断基准测试,揭示医疗大语言模型中的Einstellung效应,并提出ECR-Agent提升循证医学标准。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07395 2026-01-13 cs.CR cs.AI 57%

MCP-ITP: An Automated Framework for Implicit Tool Poisoning in MCP

MCP-ITP:一种用于MCP中隐式工具中毒的自动化框架

Ruiqi Li, Zhiqiang Wang, Yunhao Yao, Xiang-Yang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 MCP-ITP是一种用于MCP中隐式工具中毒的自动化框架,通过黑箱优化策略提升攻击成功率并规避检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02598 2026-01-13 cs.DL cs.AI 57%

LongDA: Benchmarking LLM Agents for Long-Document Data Analysis

LongDA:评估基于LLM的代理在长文档数据分析中的基准测试

Yiyang Li, Zheyuan Zhang, Tianyi Ma, Zehong Wang, Keerthiram Murugesan, Chuxu Zhang, Yanfang Ye

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 LongDA通过评估基于LLM的代理在长文档数据分析中的性能,揭示了现有模型在处理复杂任务时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06361 2026-01-13 cs.MA cs.AI cs.GT 57%

A Graph-Theoretical Perspective on Law Design for Multiagent Systems

多智能体系统的法律设计图论视角

Qi Shi, Pavel Naumov

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文从图论角度研究多智能体系统中法律设计问题,提出两种法律类型并证明其最小化问题的计算复杂性,同时利用超图顶点覆盖的近似算法进行高效近似。

Comments The 40th AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02225 2026-01-13 cs.LG 57%

Metric Design != Metric Behavior: Improving Metric Selection for the Unbiased Evaluation of Dimensionality Reduction

度量设计不等于度量行为:改进无偏评估降维的度量选择

Jiyeon Bae, Hyeon Jeon, Jinwook Seo

机构 * Seoul National University(首尔国立大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文提出了一种基于度量相关性聚类的工作流程,以减少降维评估中的偏差,提高评估的稳定性。

Comments IEEE VIS 2025 (short paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06027 2026-01-13 cs.HC cs.AI cs.CE cs.IR cs.PL 57%

AI-Assisted Authoring for Transparent, Data-Driven Documents

辅助作者生成透明、数据驱动的文档

Alfonso Piscitelli, Cristina David, Mattia De Rosa, Ali Mohammed, Federico Nanni, Jacob Pake, Roly Perera, Jessy Sodimu, Chenyiqiu Zheng

机构 * University of Salerno(萨勒诺大学) University of Bristol(布里斯托大学) Manchester Metropolitan University(曼彻斯特 Metropolitan 大学) The Alan Turing Institute(艾伦·图灵研究所) University of Kent(肯特大学) University of Cambridge(剑桥大学) University of Bath(巴斯大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型的工具,用于生成透明、数据驱动的文档,通过交互式数据溯源技术增强学术文章的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07278 2026-01-13 cs.AI 57%

Lifelong Learning of Large Language Model based Agents: A Roadmap

基于大语言模型代理的终身学习:路线图

Junhao Zheng, Chengming Shi, Xidi Cai, Qiuke Li, Duzhen Zhang, Chenxing Li, Dong Yu, Qianli Ma

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型代理的终身学习框架,通过三个模块整合多模态输入、知识存储与动态环境交互,以实现持续适应和长期性能提升。

Comments Accepted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07523 2026-01-13 cs.IT math.IT 50%

Sparse Point-wise Privacy Leakage: Mechanism Design and Fundamental Limits

稀疏点隐私泄露:机制设计与基本限制

Amirreza Zamani, Sajad Daei, Parastoo Sadeghi, Mikael Skoglund

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了稀疏点隐私泄露机制设计问题,提出了一种基于信息几何的二次近似方法,并通过凸半正定规划松弛解决NP难问题,同时确定了稀疏最优的阈值条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07402 2026-01-13 cs.CR 50%

Peacock: UEFI Firmware Runtime Observability Layer for Detection and Response

Peacock:用于检测和响应的UEFI固件运行时可观察性层

Hadar Cochavi Gorelik, Orel Fadlon, Denis Klimov, Oleg Brodt, Asaf Shabtai, Yuval Elovici

专题命中 Agent评测 :agent(abstract)

AI总结 Peacock通过模块化框架实现UEFI启动过程的完整性保证监控和远程验证,有效检测多种现实中的固件启动套件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07001 2026-01-13 cs.CV 50%

Spatial Multi-Task Learning for Breast Cancer Molecular Subtype Prediction from Single-Phase DCE-MRI

空间多任务学习用于从单相DCE-MRI预测乳腺癌分子亚型

Sen Zeng, Hong Zhou, Zheng Zhu, Yang Liu

机构 * Tsinghua University(清华大学) Southwest Forestry University(西南林业大学) GigaAI KCL

专题命中 Agent评测 :agent(abstract)

AI总结 本研究提出空间多任务学习框架,利用单相DCE-MRI实现乳腺癌分子亚型的非侵入性预测,通过多任务学习提升ER、PR、HER2及Ki-67的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03742 2026-01-13 math.AP 50%

Mean-field limits for interacting particle systems on general adaptive dynamical networks

一般自适应动态网络上相互作用粒子系统的均场极限

Nathalie Ayi

专题命中 Agent评测 :agent(abstract)

AI总结 研究一般自适应动态网络上相互作用粒子系统的均场极限,通过两种方法建立Vlasov型方程并分析其适定性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00374 2026-01-13 q-bio.CB 50%

The spontaneous emergence of leaders and followers in a mathematical model of cranial neural crest cell migration

数学模型中颅骨神经嵴细胞迁移中领导者和追随者的自发出现

Samuel W. S. Johnson, Ruth E. Baker, Philip K. Maini

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于极性的基于代理的数学模型,用于模拟颅骨神经嵴细胞迁移中领导者和追随者表型的自发出现,无需预先设定表型。

Comments 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05942 2026-01-13 math.CO 50%

A poset representation for stable contracts in a two-sided market generated by integer choice functions

关于由整数选择函数生成的双侧市场中稳定合同的偏序表示

Alexander V. Karzanov

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究由整数选择函数生成的双侧市场中稳定合同的偏序表示,通过构造加权偏序实现稳定合同集的显式表示。

Comments 38 pages, 1 figure. Compared with the initial version, some minor corrections and improvements have been done

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06515 2026-01-13 eess.SY cs.SY 50%

Convergence Analysis of Weighted Median Opinion Dynamics with Higher-Order Effects

带高阶效应的加权中位数意见动力学收敛性分析

Lingrui Chen, Xu Zhang, Fanpeng Song, Fang Wang, Cunquan Qu, Zhixin Liu

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于simplicial复形的高阶交互加权中位数意见动力学模型,分析了其收敛性与稳定性,为高阶环境效应下的意见动力学提供了新的分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06237 2026-01-13 cs.CY 50%

Data-Dependent Goal Modeling for ML-Enabled Law Enforcement Systems

面向数据依赖的目标建模用于机器学习赋能的执法系统

Dalal Alrajeh, Vesna Nowack, Patrick Benjamin, Katie Thomas, William Hobson, Carolina Gutierrez Muñoz, Catherine Hamilton-Giachritsis, Juliane A. Kloess, Jessica Woodhams, Daniel Butler, Mark Law, Ralph Morton, Benjamin Costello, Amy Burrell, Tim Grant, Prachiben Shah, Frances Laureano de Leon, Mark Lee

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出利用GORE框架KAOS进行数据驱动的目标建模,以提升ML赋能执法系统在识别在线儿童性虐待嫌疑人中的性能。

Comments 10 + 2 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06141 2026-01-13 cs.CY 50%

An LLM -Powered Assessment Retrieval-Augmented Generation (RAG) For Higher Education

基于大语言模型的评估检索增强生成(RAG)系统用于高等教育

Reza Vatankhah Barenji, Nazila Salimi, Sina Khoshgoftar

专题命中 Agent评测 :agentic(abstract)

AI总结 本研究提出基于RAG架构的大语言模型驱动评估系统,通过整合评分标准和范文生成高质量反馈,实现大规模、一致的评估反馈,提升学生自主学习能力。

Comments 19 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 3 篇

2601.07058 2026-01-13 cs.LG cs.AI 62%

Hallucinations Live in Variance

幻觉存在于方差中

Aaron R. Flouro, Shawn P. Chadwick

机构 * PhD research(博士研究)

专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究提出语义稳定性(SS)作为衡量模型方差驱动不可靠性的诊断工具,通过同义词一致性(PC@k)评估模型在不同稀疏度下的稳定性,发现稀疏度增加可显著提升一致性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06047 2026-01-13 cs.AI cs.CL cs.CY 62%

"They parted illusions -- they parted disclaim marinade": Misalignment as structural fidelity in LLMs

他们分开了幻象——他们分开了否定腌制:在大语言模型中将不一致视为结构忠实

Mariana Lins Costa

专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出大语言模型中'不一致'现象源于对不一致语言结构的忠实,而非欺骗性意图,通过分析案例和实证数据,揭示语言结构与意图生成的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06456 2026-01-13 cs.SE 57%

Architecting AgentOps Needs CHANGE

构建 AgentOps 需要 CHANGE

Shaunak Biswas, Hiya Bhatt, Karthik Vaidhyanathan

专题命中 其他Agent :agentic(abstract);分类 cs.SE

AI总结 本文提出CHANGE框架,用于构建能够适应不确定性和持续演化的AgentOps平台,以管理演进中的代理式人工智能系统。

Comments This paper has been accepted to CAIN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏