arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-21 至 2026-01-21 共收录 42 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 42 篇

2601.13268 2026-01-21 cs.AI 88%

Improving the Safety and Trustworthiness of Medical AI via Multi-Agent Evaluation Loops

通过多智能体评估循环提升医疗AI的安全性与可信度

Zainab Ghafoor, Md Shafiqul Islam, Koushik Howlader, Md Rasel Khondokar, Tanusree Bhattacharjee, Sayantan Chakraborty, Adrito Roy, Ushashi Bhattacharjee, Tirtho Roy

机构 * Sonoma State University(索诺玛州立大学) Iowa State University(爱荷华州立大学) University of Dhaka(达卡大学) Notre Dame College(诺特丹学院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 本文提出多智能体评估循环框架,通过结合DeepSeek R1和Med-PaLM等模型,有效提升医疗AI的安全性和伦理合规性,实现89%的伦理违规减少和92%的风险降级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13243 2026-01-21 cs.LG 88%

A Comprehensive Evaluation of LLM Reasoning: From Single-Model to Multi-Agent Paradigms

大语言模型推理的全面评估:从单模型到多智能体范式

Yapeng Li, Jiakuo Yu, Zhixin Liu, Xinnan Liu, Jing Yu, Songze Li, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本研究全面评估了LLM推理范式,包括单模型和多智能体系统,通过新基准测试揭示了不同范式在成本与准确率之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11583 2026-01-21 cs.CY cs.AI cs.MA 88%

Bit-politeia: An AI Agent Community in Blockchain

Bit-politeia: 区块链上的一个AI代理社区

Xing Yang

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 Bit-politeia通过区块链和AI代理构建公平高效的资源分配系统,以减少传统同行评审中的偏见和资源集中问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12560 2026-01-21 cs.AI cs.MA 87%

Agentic Artificial Intelligence (AI): Architectures, Taxonomies, and Evaluation of Large Language Model Agents

代理型人工智能(AI):架构、分类及大语言模型代理的评估

Arunkumar V, Gangadharan G. R., Rajkumar Buyya

机构 * University College of Engineering, Anna University(安娜大学工程学院) National Institute of Technology Tiruchirappalli(Tiruchirappalli 国家理工学院) School of Computing and Information Systems University of Melbourne(墨尔本大学计算机与信息系统学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 本文探讨了代理型人工智能的架构、分类及评估,提出统一分类框架,分析从线性推理到原生推理模型的转变,并指出未来研究方向以提升自主系统的可靠性。

Comments 28 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11903 2026-01-21 cs.AI 86%

AEMA: Verifiable Evaluation Framework for Trustworthy and Controlled Agentic LLM Systems

AEMA:可验证评估框架用于可信和受控的代理LLM系统

YenTing Lee, Keerthi Koneru, Zahra Moslemi, Sheethal Kumar, Ramesh Radhakrishnan

机构 * University of California, San Diego(加州大学圣地亚哥分校) Center for Advanced AI, Accenture(Accenture高级人工智能中心) University of California, Irvine(加州大学伊拉斯姆斯分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 AEMA提出了一种可验证的评估框架,用于评估基于LLM的多代理系统,通过人类监督实现稳定、可追溯的自动化评估。

Comments Workshop on W51: How Can We Trust and Control Agentic AI? Toward Alignment, Robustness, and Verifiability in Autonomous LLM Agents at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13383 2026-01-21 cs.AI 85%

A Lightweight Modular Framework for Constructing Autonomous Agents Driven by Large Language Models: Design, Implementation, and Applications in AgentForge

基于大语言模型的轻量模块化框架:用于AgentForge中的设计、实现与应用

Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

机构 * University of Tartu(塔尔图大学) S Holding OÜ(3S控股公司)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 AgentForge是一种基于大语言模型的轻量模块化框架,通过可组合的技能抽象、统一的LLM后端接口和声明性配置系统,提升自主代理的开发效率和灵活性。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13186 2026-01-21 cs.AI cs.MA 85%

Prompt Injection Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

通过语义缓存、嵌套学习和AI可持续性缓解提示注入

Diego Gosmar, Deborah A. Dahl

机构 * Head of AI, Tesisquare Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Torino, Italy(AI负责人,Tesisquare成员,开放语音互操作性倡议Linux基金会AI与数据部门,意大利托里诺) Principal, Conversational Technologies Member, Open Voice Interoperability Initiative Linux Foundation AI & Data Plymouth Meeting, PA, USA(首席科学家,对话技术成员,开放语音互操作性倡议Linux基金会AI与数据部门,美国普利茅斯会议)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文通过语义缓存、嵌套学习和AI可持续性方法,提出了一种缓解提示注入的系统,实现安全、高效且环保的LLM部署。

Comments 33 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10061 2026-01-21 cs.CV cs.AI 83%

DiffusionAgent: Navigating Expert Models for Agentic Image Generation

DiffusionAgent: 专家模型导航用于代理图像生成

Jie Qin, Jie Wu, Weifeng Chen, Yueming Lyu

机构 * Meituan(美团) ByteDance(字节跳动) Nanjing University(南京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 DiffusionAgent通过统一代理框架实现多领域图像生成,结合树状思维导航和优势数据库提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12754 2026-01-21 cs.HC cs.AI cs.CL cs.CY 81%

PAIR-SAFE: A Paired-Agent Approach for Runtime Auditing and Refining AI-Mediated Mental Health Support

PAIR-SAFE: 一种配对代理方法用于运行时审计和改进AI介导的心理健康支持

Jiwon Kim, Violeta J. Rodriguez, Dong Whi Yoo, Eshwar Chandrasekharan, Koustuv Saha

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 PAIR-SAFE通过配对代理框架,在运行时对AI生成的心理健康支持进行审计和改进,结合MITI-4框架提升临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13880 2026-01-21 cs.AI 79%

LifeAgentBench: A Multi-dimensional Benchmark and Agent for Personal Health Assistants in Digital Health

LifeAgentBench: 一个多维基准和代理用于数字健康中的个人健康助手

Ye Tian, Zihao Wang, Onat Gungor, Xiaoran Fan, Tajana Rosing

机构 * University of California San Diego(加州大学圣地亚哥分校) Google Research(谷歌研究)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出LifeAgentBench多维基准和代理,用于评估LLM在长周期、跨维度健康推理中的能力,并通过实验识别关键瓶颈,提出基线代理LifeAgent实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13801 2026-01-21 cs.RO 78%

HoverAI: An Embodied Aerial Agent for Natural Human-Drone Interaction

HoverAI: 一种用于自然人-无人机交互的具身空中代理

Yuhua Jin, Nikita Kuzmin, Georgii Demianchuk, Mariya Lezina, Fawad Mehboob, Issatay Tokmurziyev, Miguel Altamirano Cabrera, Muhammad Ahsan Mustafa, Dzmitry Tsetserukou

机构 * Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Skolkovo Institute of Science and Technology(斯克尔科沃信息科技研究所)

专题命中 Agent评测 :agent(title,abstract)

AI总结 HoverAI通过结合无人机移动、视觉投影和对话式AI,实现了人-无人机自然交互的具身代理,提升了空间感知与社交响应能力。

Comments This paper has been accepted for publication at LBR HRI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12628 2026-01-21 cs.SI 78%

Constructing a Dataset to Support Agent-Based Modeling of Online Interactions: Users, Topics, and Interaction Networks

构建支持在线交互 agent-based 模型的数据集:用户、话题和交互网络

Abdul Sittar, Miha Cesnovar, Alenka Gucek, Marko Grobelnik

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过构建基于 Reddit 的大规模数据集,支持 agent-based 模型研究用户、话题和交互网络的现实性与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05484 2026-01-21 cs.CY 78%

Evaluating LLM Safety Across Child Development Stages: A Simulated Agent Approach

评估大语言模型在儿童发展阶段的安全性:一种模拟代理方法

Abhejay Murali, Saleh Afroogh, Kevin Chen, David Atkinson, Amit Dhurandhar, Junfeng Jiao

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出ChildSafe基准,通过模拟不同儿童发展阶段的认知变化,评估大语言模型在面对认知多样性时的安全性与对齐鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21046 2026-01-21 cs.AI 77%

A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence

自我进化代理的综述:何时、何地、如何进化以实现人工超级智能

Huan-ang Gao, Jiayi Geng, Wenyue Hua, Mengkang Hu, Xinzhe Juan, Hongzhang Liu, Shilong Liu, Jiahao Qiu, Xuan Qi, Yiran Wu, Hongru Wang, Han Xiao, Yuhang Zhou, Shaokun Zhang, Jiayi Zhang, Jinyu Xiang, Yixiong Fang, Qiwen Zhao, Dongrui Liu, Qihan Ren, Cheng Qian, Zhenhailong Wang, Minda Hu, Huazheng Wang, Qingyun Wu, Heng Ji, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Sydney(悉尼大学) Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Michigan(密歇根大学) Oregon State University(俄勒冈州立大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California San Diego(加州大学圣地亚哥分校) University of Edinburgh(爱丁堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文综述了自我进化代理的现状,探讨了进化机制、适应方法及挑战,为实现人工超级智能提供路线图。

Comments 77 pages, 9 figures, Transactions on Machine Learning Research (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10599 2026-01-21 cs.CY 75%

Institutional AI: A Governance Framework for Distributional AGI Safety

机构AI:分布式AGI安全的治理框架

Federico Pierucci, Marcello Galisai, Marcantonio Syrnikov Bracale, Matteo Prandi, Piercosma Bisconti, Francesco Giarrusso, Olga Sorokoletova, Vincenzo Suriani, Daniele Nardi

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract)

AI总结 机构AI通过治理框架解决分布式AGI安全问题,将对齐视为治理机制设计问题,通过运行时监控、激励塑造和规范执行来约束代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00332 2026-01-21 cs.AI cs.CE 74%

When Hallucination Costs Millions: Benchmarking AI Agents in High-Stakes Adversarial Financial Markets

当幻觉成本百万:在高风险对抗性金融市场中基准测试AI代理

Zeshi Dai, Zimo Peng, Zerui Cheng, Ryan Yihe Li

机构 * Surf AI, Cybertino Lab(Surf AI,Cybertino 实验室) Princeton University(普林斯顿大学)

专题命中 Agent评测 :AI agent(title);分类 cs.AI

AI总结 CAIA基准测试揭示了AI在对抗性金融市场中的能力缺口,指出当前模型在面对虚假信息和不可逆决策时表现不佳,强调对抗鲁棒性对可信AI的重要性。

Comments 15 pages, 5 figures, 4 tables; Accepted to AAAI 2026 (AI-4-Finance Workshop - Oral, top 10%); In submission to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11868 2026-01-21 cs.SE cs.AI 73%

Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces

终端基准:在命令行界面中对硬、现实任务的智能体基准测试

Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini, Boxuan Li, Harsh Raj, Ivan Bercovich, Lin Shi, Jeong Yeon Shin, Thomas Walshe, E. Kelly Buchanan, Junhong Shen, Guanghao Ye, Haowei Lin, Jason Poulos, Maoyu Wang, Marianna Nezhurina, Jenia Jitsev, Di Lu, Orfeas Menis Mastromichalakis, Zhiwei Xu, Zizhao Chen, Yue Liu, Robert Zhang, Leon Liangyu Chen, Anurag Kashyap, Jan-Lucas Uslu, Jeffrey Li, Jianbo Wu, Minghao Yan, Song Bian, Vedang Sharma, Ke Sun, Steven Dillmann, Akshay Anand, Andrew Lanpouthakoun, Bardia Koopah, Changran Hu, Etash Guha, Gabriel H. S. Dreiman, Jiacheng Zhu, Karl Krauth, Li Zhong, Niklas Muennighoff, Robert Amanfu, Shangyin Tan, Shreyas Pimpalgaonkar, Tushar Aggarwal, Xiangning Lin, Xin Lan, Xuandong Zhao, Yiqing Liang, Yuanli Wang, Zilong Wang, Changzhi Zhou, David Heineman, Hange Liu, Harsh Trivedi, John Yang, Junhong Lin, Manish Shetty, Michael Yang, Nabil Omi, Negin Raoof, Shanda Li, Terry Yue Zhuo, Wuwei Lin, Yiwei Dai, Yuxin Wang, Wenhao Chai, Shang Zhou, Dariush Wahdany, Ziyu She, Jiaming Hu, Zhikang Dong, Yuxuan Zhu, Sasha Cui, Ahson Saiyed, Arinbjörn Kolbeinsson, Jesse Hu, Christopher Michael Rytting, Ryan Marten, Yixin Wang, Alex Dimakis, Andy Konwinski, Ludwig Schmidt

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 终端基准2.0通过89个计算机终端环境中的硬任务,评估智能体在现实任务中的表现,并揭示模型改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13453 2026-01-21 cs.CL cs.HC 70%

PhysicsSolutionAgent: Towards Multimodal Explanations for Numerical Physics Problem Solving

PhysicsSolutionAgent: 向数值物理问题求解的多模态解释迈进

Aditya Thole, Anmol Agrawal, Arnav Ramamoorthy, Dhruv Kumar

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 PhysicsSolutionAgent通过生成多模态视频解释,提升数值物理问题的可视化教学效果,揭示了多模态推理与评估的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12392 2026-01-21 cs.AI 70%

PsychēChat: An Empathic Framework Focused on Emotion Shift Tracking and Safety Risk Analysis in Psychological Counseling

PsychēChat: 一种专注于心理辅导中情感转变跟踪和安全风险分析的共情框架

Zhentao Xia, Yongqi Fan, Yuxiang Chu, Yichao Yin, Liangliang Chen, Tong Ruan, Weiyan Zhang

机构 * East China University of Science and Technology(东华大学) Shanghai Changning Mental Health Center, Affiliated Mental Health Center of East China Normal University(上海昌宁心理健康中心,华东师范大学附属心理健康中心)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 PsychēChat通过情感管理与风险控制模块,提升心理辅导中情感转变跟踪和安全风险分析的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19423 2026-01-21 cs.AI 70%

ETOM: A Five-Level Benchmark for Evaluating Tool Orchestration within the MCP Ecosystem

ETOM:一种用于评估MCP生态系统内工具编排的五级基准

Jia-Kai Dong, I-Wei Huang, Chun-Tin Wu, Yi-Tien Tsai

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 ETOM提出了一种五级基准,用于评估LLM代理在MCP生态系统中进行多跳工具编排的能力,通过构建等效功能集提供客观指标,揭示代理在鲁棒性和复杂任务中的系统性弱点。

Comments Accepted to the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13556 2026-01-21 cs.RO 67%

LogicEnvGen: Task-Logic Driven Generation of Diverse Simulated Environments for Embodied AI

LogicEnvGen: 基于任务逻辑的多样化模拟环境生成用于具身AI

Jianan Wang, Siyang Zhang, Bin Li, Juan Chen, Jingtao Qi, Zhuo Zhang, Chen Qian

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) School of Artifical Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 LogicEnvGen通过任务逻辑驱动生成多样化模拟环境,提升智能体在不同环境中的适应性和鲁棒性评估性能。

Comments 19 pages, 15 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12339 2026-01-21 econ.GN q-fin.EC 67%

The Economics of Digital Intelligence Capital: Endogenous Depreciation and the Structural Jevons Paradox

数字智能资本的经济学:内生折旧与结构杰文斯悖论

Yukun Zhang, Tianyang Zhang

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 本文研究数字智能资本的经济学,揭示其内生折旧和结构杰文斯悖论,通过模型分析AI产业动态及竞争机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13217 2026-01-21 cs.CL cs.AI 62%

Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report Revision

超越单次写作:深度研究代理在多轮报告修订中不可靠

Bingsen Chen, Boyan Li, Ping Nie, Yuyu Zhang, Xi Ye, Chen Zhao

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出Mr Dre评估套件,揭示深度研究代理在多轮报告修订中存在内容退化和编辑丢失的问题,表明需更深入的方法改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13007 2026-01-21 cs.SE cs.AI 62%

ArchAgent: Scalable Legacy Software Architecture Recovery with LLMs

ArchAgent: 基于LLM的可扩展遗留软件架构恢复

Rusheng Pan, Bingcheng Mao, Tianyi Ma, Zhenhua Ling

机构 * HiThink Research(慧思研究) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 ArchAgent通过结合静态分析、自适应分段和LLM合成,实现大规模遗留软件架构的高效恢复与多视图业务对齐。

Comments to be published in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12259 2026-01-21 cs.AI cs.CE cs.LG 62%

FutureX-Pro: Extending Future Prediction to High-Value Vertical Domains

FutureX-Pro: 将未来预测扩展到高价值垂直领域

Jiashuo Liu, Siyuan Chen, Zaiyuan Wang, Zhiyuan Zeng, Jiacheng Guo, Liang Hu, Lingyue Yin, Suozhi Huang, Wenxin Hao, Yang Yang, Zerui Cheng, Zixin Yao, Lingyue Yin, Haoxin Liu, Jiayi Cheng, Yuzhen Li, Zezhong Ma, Bingjie Wang, Bingsen Qiu, Xiao Liu, Zeyang Zhang, Zijian Liu, Jinpeng Wang, Mingren Yin, Tianci He, Yali Liao, Yixiao Tian, Zhenwei Zhu, Anqi Dai, Ge Zhang, Jingkai Liu, Kaiyuan Zhang, Wenlong Wu, Xiang Gao, Xinjie Chen, Zhixin Yao, Zhoufutu Wen, B. Aditya Prakash, Jose Blanchet, Mengdi Wang, Nian Si, Wenhao Huang

机构 * Hong Kong University of Science and Technology(香港科技大学) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 FutureX-Pro通过扩展未来预测到金融、零售、公共健康和自然灾害等高价值垂直领域,评估代理LLMs在工业部署中的领域基础能力。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01047 2026-01-21 cs.NI cs.AI 61%

A Deep Reinforcement Learning-Based TCP Congestion Control Algorithm: Design, Simulation, and Evaluation

基于深度强化学习的TCP拥塞控制算法:设计、仿真与评估

Efe Ağlamazlar, Emirhan Eken, Harun Batur Geçici

机构 * Aydın Science High School(艾丁科学高中) ASELSAN Technical Anatolian High School(ASELSAN技术安纳托利亚高中) Erman Ilıcak Science High School(埃尔曼·伊利卡克科学高中)

专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI

AI总结 本文提出一种基于深度强化学习的TCP拥塞控制算法,通过动态调整拥塞窗口提升吞吐量与降低延迟,优于传统TCP算法。

Comments 11 pages, 4 figures. Presents a DRL agent that mitigates bufferbloat and achieves near-zero packet loss. Validated via NS-3 simulations under a strict training-testing protocol. Code: https://github.com/aglamazlarefe/DRL-TCP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08778 2026-01-21 cs.AI cs.DB 57%

Pervasive Annotation Errors Break Text-to-SQL Benchmarks and Leaderboards

广泛注释错误破坏文本到SQL基准测试和排行榜

Tengjun Jin, Yoojin Choi, Yuxuan Zhu, Daniel Kang

机构 * University of Illinois (UIUC)(伊利诺伊大学香槟分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究发现文本到SQL基准测试中广泛存在的注释错误显著影响了代理性能和排行榜排名,可能误导研究方向和部署选择。

Comments 18 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12974 2026-01-21 cs.CL 57%

Bridging the Knowledge-Action Gap by Evaluating LLMs in Dynamic Dental Clinical Scenarios

通过评估LLMs在动态牙科临床场景中弥合知识-行动鸿沟

Hongyang Ma, Tiantian Gu, Huaiyuan Sun, Huilin Zhu, Yongxin Wang, Jie Li, Wubin Sun, Zeliang Lian, Yinghong Zhou, Yi Gao, Shirui Wang, Zhihui Tang

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文通过SCMPE基准评估LLMs在动态牙科临床场景中的表现,发现其在动态对话中存在主动信息收集和状态跟踪的瓶颈,揭示了外部知识不足以弥补推理差距,需领域自适应预训练。

Comments 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12473 2026-01-21 cs.CL 57%

Capability-Aware Early-Stage Research Idea Evaluation

具备能力的早期研究想法评估

Renlong Jie, Chen Chu, Zhen Wang

机构 * Northwestern Polytechnical University(西北工业大学) School of Statistics and Mathematics(统计与数学学院) iOPEN

专题命中 Agent评测 :planning(abstract);分类 cs.CL

AI总结 本文提出一种基于能力的框架,通过作者信息和研究想法预测论文接受情况,无需完整文本或实验结果,显著提升预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13794 2026-01-21 cs.GR cs.LG cs.RO 57%

MimicKit: A Reinforcement Learning Framework for Motion Imitation and Control

MimicKit:一种用于运动模仿与控制的强化学习框架

Xue Bin Peng

机构 * Simon Fraser University(西蒙弗雷泽大学) NVIDIA(英伟达)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 MimicKit 通过运动模仿和强化学习结合,提供统一的运动控制训练框架,支持计算机图形学和机器人学的研究与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏