arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15841 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15841 篇

2602.10356 2026-05-12 cs.CL 57%

Autonomous Continual Learning for Environment Adaptation of Computer-Use Agents

自主持续学习用于计算机使用智能体的环境适应

Tianci Xue, Zeyi Liao, Tianneng Shi, Zilu Wang, Kai Zhang, Dawn Song, Yu Su, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出ACuRL框架,通过自主生成任务实现持续学习,无需人工标注数据,在不同环境中实现3-29%的性能提升,且避免灾难性遗忘。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16093 2026-05-12 q-fin.PM cs.AI math.PR 57%

Efficient Portfolio Selection through Preference Aggregation with Quicksort and the Bradley--Terry Model

通过快速排序和布拉德利-蒂尔模型进行高效投资组合选择

Yurun Ge, Lucas Böttcher, Tom Chou, Maria R. D'Orsogna

机构 * Department of Mathematics, California State University at Northridge(加州州立大学北岭分校数学系) Department of Computational Medicine, University of California, Los Angeles(加州大学洛杉矶分校计算医学系) Department of Computational Science and Philosophy, Frankfurt School of Finance and Management(法兰克福金融与管理学院计算科学与哲学系) Laboratory for Systems Medicine, University of Florida(佛罗里达大学系统医学实验室) Department of Mathematics, University of California, Los Angeles(加州大学洛杉矶分校数学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出基于快速排序和布拉德利-蒂尔模型的高效投资组合选择方法,通过聚合个体评估以最大化总体收益,优于现有方法,并结合采样技术减少配对比较。

Comments 15pp, 4 figs

Journal ref J. Comput. Sci. 92, 102728 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08816 2026-05-12 cs.AI cs.CY 57%

Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?

镜中镜:视觉语言模型代理是否真的能辨认自己?

Filippo Ziliotto, Ciro Beneduce, Bruno Lepri, Luciano Serafini, Massimiliano Luca, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) University of Trento(特伦托大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨视觉语言模型是否能通过镜像识别自身,通过设计3D基准测试评估其自我识别能力,发现更强的模型能利用镜像信息进行行动,而较弱的模型则无法正确提取自身相关信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08713 2026-05-12 cs.RO cs.AI 57%

REAP: Reinforcement-Learning End-to-End Autonomous Parking with Gaussian Splatting Simulator for Real2Sim2Real Transfer

REAP:基于高斯点扩散模拟器的端到端自主泊车强化学习

Changze Li, Zhe Chen, Shaoyu Chen, Lisen Mu, Yijian Li, Yuelong Yu, Qian Zhang, Qing Su, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Horizon Robotics Technology Research and Development Co., Ltd.(地平线机器人技术研究与开发有限公司)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出REAP方法,通过高斯点扩散模拟器实现Real2Sim2Real迁移,利用SAC算法提升训练效率,结合行为克隆和软预测碰撞惩罚机制,解决极端场景下的泊车问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08687 2026-05-12 cs.DB cs.AI 57%

PrepBench: How Far Are We from Natural-Language-Driven Data Preparation?

PrepBench: 我们距离自然语言驱动的数据准备还有多远?

Jingzhe Xu, Rui Wang, Jiannan Wang, Guoliang Li

机构 * Department of Computer Science and Technology, BNRist, Tsinghua University(计算机科学与技术系,BNRist,清华大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 PrepBench评估自然语言驱动的数据准备能力,涵盖交互澄清、代码生成和代码到工作流翻译三项核心能力,通过爬取数据挑战并设计系统性基准,揭示当前LLM在实现该范式转变中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12606 2026-05-12 cs.LG 57%

RelBench v2: A Large-Scale Benchmark and Repository for Relational Data

RelBench v2:关系数据的大型基准和存储库

Justin Gu, Rishabh Ranjan, Charilaos Kanatsoulis, Haiming Tang, Martin Jurkovic, Valter Hudovernik, Mark Znidar, Pranshu Chaturvedi, Parth Shroff, Fengyu Li, Jure Leskovec

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) University of Ljubljana(卢布尔雅那大学) Kumo AI University of Oxford(牛津大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 RelBench v2引入了四个大规模关系数据集,扩展了基准测试,并引入了自动补全任务,展示了关系学习模型在多表预测中的优势。

Comments Published at ICLR 2026. Website: https://relbench.stanford.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06286 2026-05-12 cs.AI 57%

When Agents Say One Thing and Do Another: Validating Elicited Beliefs from LLMs

当代理人言辞与行为不一致时:从LLMs中验证提取的信念

Khurram Yamin, Jingjing Tang, Santiago Cortes-Gomez, Amit Sharma, Eric Horvitz, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种决策理论框架,通过提取概率判断和决策并检验其一致性,验证LLMs的信念是否合理,发现最强模型的不一致程度较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01022 2026-05-12 econ.GN cs.AI q-fin.EC 57%

Calibrating Behavioral Parameters with Large Language Models

用大语言模型校准行为参数

Brandon Yee, Pairie Koh

机构 * Management Sciences Lab(管理科学实验室) Yee Collins Research Group(Yee Collins研究组)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文利用大语言模型校准行为参数,发现其存在系统性理性偏差,并通过校准方法提升参数稳定性与理论一致性,验证了校准参数在资产定价模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22449 2026-05-12 cs.AI 57%

Emergence of Physical Intelligence via Controllable Information Production

通过可控信息生成实现物理智能的涌现

Tristan Shah, Stas Tiomkin

机构 * Department of Computer Science(计算机科学系) Texas Tech University(德克萨斯技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出可控信息生成框架,将内在动机与最优控制统一,揭示价值函数结构与柯莫哥罗夫-辛恩熵的联系,展现物理智能源于可控混沌边缘的驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08113 2026-05-12 cs.LG cs.CV 57%

Do Foundation Model Embeddings Improve Cross-Country Crop Yield Generalisation? A Leave-One-Country-Out Evaluation in Sub-Saharan Africa

基础模型嵌入是否能提升跨国家作物产量泛化?一种留一国家法的撒哈拉以南非洲评估

Yaw Osei Adjei

机构 * Department of Computer Science, Kwame Nkrumah University of Science and Technology(计算机科学系,库马西技术科学大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文评估了地理空间基础模型嵌入在留一国家法交叉验证中的表现,发现跨国家预测效果不佳,主要受限于产量分布差异。

Comments 9 pages, 10 figures, appendix, code and processed results released publicly

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07840 2026-05-11 cs.LG 57%

RelAgent: LLM Agents as Data Scientists for Relational Learning

RelAgent:基于LLM的数据科学家用于关系学习

Xingyue Huang, Louis Tichelman, Jinwoo Kim, Krzysztof Olejniczak, İsmail İlkan Ceylan

机构 * University of Oxford(牛津大学) TU Wien(维也纳技术大学) AITHYRA(AITHYRA研究所) KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 RelAgent是一种基于LLM的关系学习自主数据科学家,通过两阶段流程构建SQL特征程序并选择预测模型,最终通过SQL查询和经典模型实现快速、确定性和可解释的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07823 2026-05-11 cs.CL 57%

SCENE: Recognizing Social Norms and Sanctioning in Group Chats

SCENE:识别社交规范并实施制裁在群聊中

Mateusz Jacniacki, Maksymilian Bilski

机构 * HumaLike

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 SCENE旨在通过多角色聊天场景识别隐性社交规范并实施制裁,评估LLM在动态社交互动中的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04712 2026-05-11 cs.LG 57%

SPHERE: Mitigating the Loss of Spectral Plasticity in Mixture-of-Experts for Deep Reinforcement Learning

SPHERE: 缓解混合专家在深度强化学习中的频谱可塑性损失

Lirui Luo, Guoxi Zhang, Hongming Xu, Cong Fang, Qing Li

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,智能科学与技术学院,北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出SPHERE,通过引入Parseval惩罚来缓解混合专家策略在持续学习中的频谱可塑性损失,提升了MetaWorld和HumanoidBench的持续强化学习性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05777 2026-05-11 cs.AI 57%

Emergent social transmission of model-based representations without inference

涌现的社会传递模型基于表示而无需推理

Silja Keßler, Miriam Bautista-Salinero, Claudio Tennie, Charley M. Wu

机构 * University of Tübingen(图宾根大学) Technical University Darmstadt(达姆施塔特技术大学) Hessian AI(黑森人工智能)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了在有限认知能力下,人们如何通过他人获取丰富灵活的知识,发现通过简单社会线索而非推理可实现高级表示的间接传递。

Comments Code available at https://github.com/skessler01/social-transmission-rl.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09652 2026-05-11 cs.AI 57%

MiniAppBench: Evaluating the Shift from Text to Interactive HTML Responses in LLM-Powered Assistants

MiniAppBench:评估从文本到交互式HTML响应的转变

Zuhao Zhang, Chengyue Yu, Yuante Li, Chenyi Zhuang, Linjian Mo, Shuai Li

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出MiniAppBench,首个评估原理驱动交互应用生成能力的基准,通过10M+生成数据提炼500个任务,结合MiniAppEval框架评估意图、静态和动态维度,揭示LLM在生成高质量交互应用上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01333 2026-05-11 cs.CL 57%

OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

OralMLLM-Bench: 评估多模态大语言模型在牙科实践中的认知能力

Rongyang Wang, Shuang Zhou, Jiashuo Wang, Wenya Xie, Xiaoxia Che

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文提出OralMLLM-Bench,通过27个临床任务评估多模态大语言模型在牙科影像分析中的认知能力,揭示模型与牙科医生的性能差异及改进方向。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21858 2026-05-11 cs.AI 57%

ProactiveMobile: A Comprehensive Benchmark for Boosting Proactive Intelligence on Mobile Devices

ProactiveMobile: 一个全面的基准,用于提升移动设备上的主动智能

Dezhi Kong, Zhengzhao Feng, Qiliang Liang, Hao Wang, Haofei Sun, Changpeng Yang, Yang Li, Peng Zhou, Shuai Nie, Hongzhen Wang, Linfeng Zhou, Hao Jia, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(小米公司HyperAI团队) Zhejiang University(浙江大学) Peking University(北京大学) Northeastern University(东北大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出ProactiveMobile基准,通过多模态大语言模型在移动代理中实现主动智能,通过63个API生成可执行函数序列,实验表明Qwen2.5-VL-7B-Instruct在主动智能任务中表现优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02382 2026-05-11 eess.IV cs.AI cs.CV 57%

Benchmark of Segmentation Techniques for Pelvic Fracture in CT and X-ray: Summary of the PENGWIN 2024 Challenge

CT和X射线中骨盆骨折分割技术的基准测试:PENGWIN 2024挑战总结

Yudi Sang, Yanzhen Liu, Sutuke Yibulayimu, Yunning Wang, Benjamin D. Killeen, Mingxu Liu, Ping-Cheng Ku, Ole Johannsen, Karol Gotkowski, Maximilian Zenk, Klaus Maier-Hein, Fabian Isensee, Peiyan Yue, Yi Wang, Haidong Yu, Zhaohong Pan, Yutong He, Xiaokun Liang, Daiqi Liu, Fuxin Fan, Artur Jurgas, Andrzej Skalski, Yuxi Ma, Jing Yang, Szymon Płotka, Rafał Litka, Gang Zhu, Yingchun Song, Mathias Unberath, Mehran Armand, Dan Ruan, S. Kevin Zhou, Qiyong Cao, Chunpeng Zhao, Xinbao Wu, Yu Wang

机构 * Beijing Rossum Robot Technology Co., Ltd.(北京罗素机器人科技有限公司) Key Laboratory of Biomechanics and Mechanobiology, Ministry of Education, Beijing Advanced Innovation Center for Biomedical Engineering, School of Biological Science and Medical Engineering, Beihang University(生物力学与机械生物学重点实验室,教育部,北京生物医学创新中心,生物科学与医学工程学院,北航) Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Division of Medical Image Computing, German Cancer Research Center (DKFZ)(医学影像计算部,德国癌症研究中心(DKFZ)) Helmholtz Imaging, Heidelberg(海德堡大学医院影像中心) Smart Medical Imaging, Learning and Engineering (SMILE) Lab, Medical UltraSound Image Computing(智能医学影像、学习与工程(SMILE)实验室,医学超声影像计算)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文通过PENGWIN 2024挑战评估了CT和X射线中骨盆骨折分割技术,发现CT分割准确率较高,但X射线分割仍需进一步改进,揭示了分割方法的多样性及片段定义的不确定性。

Comments PENGWIN 2024 Challenge Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16811 2026-05-08 cs.LG 57%

Graph Learning Is Suboptimal in Causal Bandits

图学习在因果老虎机中是次优的

Mohammad Shahverdikondori, Jalal Etesami, Negar Kiyavash

机构 * College of Management of Technology, EPFL(EPFL技术管理学院) Department of Computer Science, TU Munich(慕尼黑技术大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了在因果充分性条件下因果老虎机的 regrets 最小化问题,发现学习父集并非最优策略,并提出无需图学习的近优算法。

Comments 32 pages, accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05726 2026-05-08 cs.AI 57%

SkillRet: A Large-Scale Benchmark for Skill Retrieval in LLM Agents

SkillRet:一种大规模技能检索基准,用于LLM代理

Hongcheol Cho, Ryangkyung Kang, Youngeun Kim

机构 * ThakiCloud

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出SkillRet基准,用于评估LLM代理中的技能检索。该基准包含17810个公开技能,提供63259个训练样本和4997个评估查询,通过任务特定微调显著提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05280 2026-05-08 cs.LG 57%

Forecasting Green Skill Demand in the Automotive Industry: Evidence from Online Job Postings

预测汽车行业的绿色技能需求:来自在线招聘信息的证据

Sabur Butt, Joshua N. Arrazola E., Hector G. Ceballos, Patricia Caratozzolo

机构 * Institute for the Future of Education, Tecnológico de Monterrey(教育未来研究所,蒙特雷理工大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文通过分析墨西哥汽车行业的在线招聘信息,构建计算框架预测绿色技能需求,识别出274种绿色技能,并利用时间序列模型预测未来趋势,发现可再生能源、回收和氢能技术需求增长最快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01358 2026-05-05 cs.LG 57%

PACE: Parameter Change for Unsupervised Environment Design

PACE:无监督环境设计的参数变化

Fang Yuan, Quanjun Yin, Siqi Shen, Yuxiang Xie, Junqiang Yang, Long Qin, Junjie Zeng, Qinglun Li

机构 * College of Systems Engineering, National University of Defense Technology(国防科技大学系统工程学院) Test Center, National University of Defense Technology(国防科技大学测试中心) State Key Laboratory of Digital Intelligent Modeling(数字智能建模与仿真国家重点实验室) Fujian Key Laboratory of Urban Intelligent Sensing(福建城市智能感知重点实验室) Key Laboratory of Multimedia Trusted Perception(多媒体可信感知重点实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 PACE通过政策参数变化评估环境,提升强化学习泛化能力,实验显示在MiniGrid和Craftax上优于现有无监督环境设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01082 2026-05-05 cs.LG cs.GT econ.TH 57%

Networked Information Aggregation for Binary Classification

基于网络的信息聚合用于二分类

MohammadHossein Bateni, Zahra Hadizadeh, MohammadTaghi Hajiaghayi, Mahdi JafariRaviz, Shayan Taherijam

机构 * University of Maryland, College Park, MD, USA(马里兰大学学院市分校) Google Research, New York City, NY, USA(谷歌研究纽约市分校) University of California, Irvine, CA, USA(加州大学尔湾分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究网络二分类中信息聚合问题,通过序列分布式训练流程分析信息聚合效果,证明深度对信息聚合的限制。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00723 2026-05-04 stat.ML cs.LG math.PR 57%

Decentralized Proximal Stochastic Gradient Langevin Dynamics

去中心化近端随机梯度兰格朗日动力学

Mohammad Rafiqul Islam, Lingjiong Zhu

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出去中心化近端随机梯度兰格朗日动力学算法,用于在凸域内采样对数凹概率分布。通过共享的近端正则化约束,保证更新一致性。算法在2-瓦瑟斯坦距离下具有非渐近收敛性,并在合成和真实数据集上验证了其有效性。

Comments 42 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00420 2026-05-04 cs.MA cs.LG q-fin.GN 57%

Foresight Arena: An On-Chain Benchmark for Evaluating AI Forecasting Agents

前瞻性竞技场:一种去中心化的链上基准,用于评估AI预测代理

Maksym Nechepurenko, Pavel Shuvalov

机构 * Director of Research, Devnull(研发总监,Devnull) Chief Technology Officer, Devnull(首席技术官,Devnull)

专题命中 Agent评测 :AI agent(abstract);分类 cs.LG

AI总结 本文提出Foresight Arena,首个去中心化链上基准,用于评估AI预测代理在真实世界预测市场中的能力,通过概率预测和智能合约评估,结合Brier分数和Alpha分数衡量性能。

Comments 27 pages, 5 figures, 10 tables. Project page: https://foresightarena.xyz/. Code: https://github.com/foresight-arena/contracts

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00400 2026-05-04 cs.IR cs.CL 57%

FollowTable: A Benchmark for Instruction-Following Table Retrieval

FollowTable:一项指令遵循表格检索的基准测试

Rihui Jin, Yuchen Lu, Ting Zhang, Jun Wang, Kuicai Dong, Zhaocheng Du, Dongping Liu, Gang Wang, Yong Liu, Guilin Qi

机构 * Southeast University(东南大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(新一代人工智能技术及其交叉应用国家重点实验室(东南大学)) Its Interdisciplinary Applications (Southeast University), Ministry of Education(交叉应用(东南大学),教育部)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文提出了一项新的表格检索任务IFTR,要求模型同时满足主题相关性和细粒度指令约束。通过引入FollowTable基准测试,评估模型在遵循指令方面的表现,发现现有检索模型在处理表格数据时存在系统性偏差。

Comments SIGIR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00281 2026-05-04 cs.LG cs.MA math.OC 57%

High-Probability Convergence in Decentralized Stochastic Optimization with Gradient Tracking

去中心化随机优化中带有梯度跟踪的高概率收敛性

Aleksandar Armacki, Haoyuan Cai, Ali H. Sayed

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究去中心化随机优化中的高概率收敛性,提出结合梯度跟踪技术的DSGD算法,证明其在非凸和Polyak-Łojasiewicz成本下的最优收敛率,且在放松的子高斯条件下实现高概率收敛。

Comments 49 pages, 4 figures. arXiv admin note: text overlap with arXiv:2510.06141

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00074 2026-05-04 cs.CY cs.AI 57%

Adoption and Use of LLMs at an Academic Medical Center

学术医疗中心中大语言模型的采用与使用

Nigam H. Shah, Nerissa Ambers, Abby Pandya, Timothy Keyes, Juan M. Banda, Srikar Nallan, Carlene Lugtu, Artem A. Trotsyuk, Suhana Bedi, Alyssa Unell, Miguel Fuentes, Francois Grolleau, Sneha S. Jain, Jonathan Chen, Devdutta Dash, Danton Char, Aditya Sharma, Duncan McElfresh, Patrick Scully, Vishanthan Kumar, Clancy Dennis, Connor OBrien, Satchi Mouniswamy, Elvis Jones, Krishna Jasti, Gunavathi Mannika Lakshmanan, Sree Ram Akula, Varun Kumar Singh, Ramesh Rajmanickam, Sudhir Sinha, Vicky Zhou, Xu Wang, Bilal Mawji, Joshua Ge, Wencheng Li, Travis Lyons, Jarrod Helzer, Vikas Kakkar, Ramesh Powar, Darren Batara, Cheryl Cordova, William Frederick, Olivia Tang, Phoebe Morgan, April S. Liang, Stephen P. Ma, Shivam Vedak, Dong-han Yao, Akshay Swaminathan, Mehr Kashyap, Brian Ng, Jamie Hellman, Nikesh Kotecha, Christopher Sharp, Gretchen Brown, Christian Lindmark, Anurang Revri, Michael A. Pfeffer

机构 * Stanford Medicine, Technology and Digital Solutions(斯坦福医学院技术与数字解决方案)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出ChatEHR系统,通过整合患者多年医疗记录,实现LLM在临床文档中的自动化与交互应用,提升医疗效率与数据准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08597 2026-05-04 cs.GT cs.AI cs.MA econ.TH 57%

Markets with Heterogeneous Agents: Dynamics and Survival of Bayesian vs. No-Regret Learners

异质主体市场:贝叶斯学习者与无遗憾学习者的动态与生存

David Easley, Yoav Kolumbus, Eva Tardos

机构 * Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究比较贝叶斯学习者与无遗憾学习者在资产市场中的表现,探讨其生存条件及市场主导因素,提出混合策略提升鲁棒性与适应性。

Comments Learning in Markets, Heterogeneous Agents, Regret and Survival, Bayesian Learning, No-Regret Learning, Portfolio Optimization, Kelly Rule, Distribution Shifts, Robust Bayesian Updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27543 2026-05-01 cs.CL 57%

AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR

AppTek 电话客服对话:一种多口音长形式评估基准用于英语语音识别

Eugen Beck, Sarah Beranek, Uma Moothiringote, Daniel Mann, Wilfried Michel, Katie Nguyen, Taylor Tragemann

机构 * ANONYMIZED-ORG-NAME(匿名机构)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出AppTek电话客服对话数据集,用于评估英语语音识别系统在不同口音下的性能,揭示了不同口音和分段方法对识别效果的影响。

Comments Submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏