Towards AI Agents Supported Research Problem Formulation
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.SE
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.SE
RadOnc-GPT:一种用于大规模实时患者结果标注的自主大语言模型代理
机构 * Mayo Clinic, Phoenix, AZ, USA(梅奥诊所,凤凰城,亚利桑那州,美国) ; Mayo Clinic, Rochester, MN, USA(梅奥诊所,罗切斯特,明尼苏达州,美国)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 RadOnc-GPT是一种自主大语言模型代理,通过自主检索和评估实现大规模实时患者结果标注,提升放射肿瘤学研究的效率和准确性。
AI透明度地图:框架、评分与实时模型卡片评估流程
机构 * Department of Computer Science, The College of Wooster, Wooster, OH, USA(计算机科学系,沃斯特学院,沃斯特,OH,USA) ; Robert F. Wagner Graduate School of Public Service, New York University, New York, NY, USA(罗伯特·F·瓦格纳公共事务研究生学院,纽约大学,纽约,NY,USA)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出AI透明度框架和实时评估流程,评估50个模型发现前沿实验室合规率约80%,而多数供应商低于60%,安全关键领域存在显著缺口。
SoMi-ToM:评估具身社会互动中的多视角理论之心假设
机构 * The University of Hong Kong(香港大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of California Irvine(加州大学尔湾分校) ; Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 SoMi-ToM基准通过多视角评估人类与模型在具身社会互动中的理论之心能力,揭示大型视觉-语言模型在复杂社交场景中的不足。
Comments 24 pages, 6 figures
Journal ref Proceedings of the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
生成代理行为模型在交互式自动驾驶中的训练和测试时间缩放
专题命中 Agent评测 :agent(title)
AI总结 本文提出GRBO和Warm-K两种方法,用于提升交互式自动驾驶中生成代理行为模型的训练和测试时间性能,提高安全性和鲁棒性。
Comments 11 pages, 5 figures
手术视觉世界模型
机构 * University of Aberdeen, UK(阿伯丁大学,英国) ; Cambridge Research Laboratory, Toshiba Europe Ltd, UK(剑桥研究实验室,东芝欧洲有限公司,英国) ; Nepal Applied Mathematics and Informatics Institute for research (Naamii), Nepal(尼泊尔应用数学与信息学研究所(Naamii),尼泊尔) ; University of Lausanne, Switzerland(洛桑大学,瑞士)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.LG
AI总结 本文提出首个手术视觉世界模型,通过生成动作可控的手术数据,提升自主手术代理训练的现实感与交互性。
Comments This paper has been accepted at the Data Engineering in Medical Imaging Workshop, MICCAI 2025
Journal ref MICCAI Workshop on Data Engineering in Medical Imaging (2025) 1-10
车载对话系统上下文理解评估
机构 * Humboldt University of Berlin(柏林洪堡大学) ; Technical University of Munich(慕尼黑技术大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL
AI总结 本文通过LLM和提示技术评估车载对话系统上下文理解,发现非推理模型在成本效率上表现最佳,DeepSeek-R1达到高F1分数。
MedInsightBench: 通过多步骤洞察发现评估医疗分析代理在多模态医疗数据中的能力
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; ByteDance(字节跳动)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 MedInsightBench通过多步骤洞察发现评估医疗分析代理在多模态医疗数据中的能力,提出MedInsightAgent框架提升医疗数据洞察发现性能。
忘却却忠实:一种认知记忆架构与隐私意识生成代理的基准测试
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种认知记忆架构和隐私意识生成代理的基准测试,通过平衡性能、隐私和计算效率,提升生成代理在资源受限环境中的应用能力。
DynamiX: 大规模动态社交网络模拟器
机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) ; Department of Computer Science, University of Rochester(计算机科学系,罗切斯特大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 DynamiX通过动态层级模块和不同用户类型的社交关系建模策略,提升了大规模动态社交网络模拟的准确性与实用性。
Comments Social and Information Networks
GPT-OSS好吗?对OpenAI最新开源模型的综合评估
机构 * AI Agent Lab, Vokram Group(AI代理实验室,Vokram集团) ; Purdue University(普渡大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Minnesota(明尼苏达大学) ; Emory University(埃默里大学) ; Imperial College London(伦敦帝国学院)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 GPT-OSS在代码生成方面表现优异,但在多语言任务上存在不足,研究发现稀疏架构扩展未必能带来性能提升。
衡量重要性:面向自动驾驶轨迹预测器的场景驱动评估
机构 * HRI, San Jose(HRI, 洛杉矶)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种基于场景驱动的评估流程,通过准确性与多样性两个维度评估自动驾驶轨迹预测器,以更合理地反映其对自动驾驶车辆性能的影响。
Comments 9 Pages, 8 Figures
深度对冲与强化学习:期权风险管理的实用框架
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出基于强化学习的深度对冲框架,通过动态对冲股票指数期权头寸,提升风险调整后收益,同时控制换手率和回撤。
Comments All code, configuration files, and experiment scripts are available at https://github.com/tlucius16/deep-hedging-rl
DeepResearchGym: 一个免费、透明且可复现的深度研究评估沙盒
专题命中 Agent评测 :agentic(abstract)
AI总结 DeepResearchGym提供了一个免费、透明且可复现的深度研究评估沙盒,结合可复现的搜索API和严谨的评估协议,用于评估深度研究系统性能,展示其在成本效益训练中的实用性。
战略调度中的公平协调
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种统一算法,通过调整子程序实现公平协调的调度问题,结合可信度和平等性属性,以在战略考虑下实现公平的调度结果。
利用本地智能电表数据进行分布式强化学习以实现配电网电压调节
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种利用本地智能电表数据的分布式强化学习算法,通过动态Thevenin模型和校正策略提升配电网电压调节效果。
人工智能在ERP评估中的整合:跨趋势与架构
专题命中 Agent评测 :planning(abstract)
AI总结 本文提出了一种理论模型,将AI赋能的ERP性能评估指标与预测智能和自适应自动化相结合,以改进AI整合ERP的评估方法。
Comments 9 pages, 2 Figures. Journal of Information Systems Engineering and Management,2025