arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2607.22563 2026-07-28 cs.AI 新提交 57%

Synthetic Scenario Generation for Evaluation of Industry 4.0 Agents

用于工业4.0智能体评估的合成场景生成

Sagar Chethan Kumar, Rohith Kanathur, Dhaval Patel, Kaoutar El Maghraoui

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对工业智能体基准测试场景有限问题,扩展AssetOpsBench并引入ScenarioGeneratorAgent管道,通过多种优化方式提高可扩展性,实现智能电网变压器场景生成的高效优化,有效扩展工业智能体基准测试且保证场景质量。

Comments 19 pages, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22573 2026-07-28 cs.AI cond-mat.mtrl-sci physics.comp-ph 新提交 57%

PhononBench-MP40: a spectrum-resolved benchmark dataset for phonon stability

PhononBench-MP40:用于声子稳定性的光谱分辨基准数据集

Wen-Kao Li, Ze-Feng Gao, Zhong-Yi Lu

机构 * School of Physics and Key Laboratory of Quantum State Construction and Manipulation (Ministry of Education), Renmin University of China(中国人民大学物理学院及量子态构建与调控教育部重点实验室)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 研究针对计算材料筛选中虚声子模式瓶颈,提出PhononBench-MP40数据集,源于47969个MP40任务,含4类记录。通过科学数据银行公开,配套GitHub仓库提供代码等,为相关研究提供可审计参考。

Comments 18 pages, 3 figures, includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22520 2026-07-27 cs.AI 新提交 57%

The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents

回归税:剖析技能对大语言模型智能体产生帮助和伤害的原因

Darshan Tank, Baran Nama

机构 * Sentient Labs(森蒂恩实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究剖析大语言模型智能体中技能产生帮助和伤害的原因,通过对比实验区分回归和残余失败两种结果,识别出回归的三个原因,发现现有技能过度强调程序指导,指出应分解技能净效应评估,还识别出应避免的回归模式及可靠性的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22393 2026-07-27 cs.AI cs.CV 新提交 57%

SceneActBench: Can Agents Act on the 3D Scenes They See?

SceneActBench:智能体能否对其所看到的3D场景采取行动?

Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi Zhu

机构 * Tencent Hunyuan(腾讯混元) THU(清华大学) NJU(南京大学) HKUST(香港科技大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) PKU(北京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究视觉语言模型智能体在3D场景行动能力,提出SceneActBench基准测试,涵盖五个3D任务,通过特定指标评估智能体输出,分析不同配置得分及失败情况,为评估智能体在多对象3D场景行动提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21646 2026-07-27 cs.LG 新提交 57%

Adjustment Speed as a Safety Constraint for Nonstationary Reinforcement Learning

作为非平稳强化学习安全约束的调整速度

Timothy Tomashevskiy

机构 * McMaster University(麦克马斯特大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究非平稳强化学习中的安全问题,提出以调整速度为安全约束,用上下文表示和预测估计适应需求,与智能体适应能力比较,超限时收紧动作集并激活屏蔽,实验验证该方法可减少安全违规,支持适应可行性原则。

Comments 15 pages, 5 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21400 2026-07-24 cs.RO cs.AI 新提交 57%

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

VoLN:仅视觉的长距离导航——范式、基准和方法

Jiabin Lou, Haopeng Wang, Yuanshuai Wang, Xinyu Liu, Xuxin Lv, Yuxin Guo, Lei Huang, Rongye Shi, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。

Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20916 2026-07-24 cs.AI cs.DL 新提交 57%

Traceable Scholarship: Page Anchors and Ariadne's Thread for Humanistic Inquiry in the Age of Generative AI

可追溯的学术研究:生成式人工智能时代人文探究的页面锚点与阿里阿德涅之线

Deyu Jing

机构 * Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对生成式人工智能时代人文研究中解释缺乏明确依据的问题,提出可追溯学术研究,介绍页面锚点等方法及AIH-Infra参考实现,通过案例研究展示其作用,确保人文研究在该时代保持公开可反驳。

Comments 33 pages, 8 tables. This paper proposes a normative and infrastructural framework for traceable, AI-assisted humanistic research and presents an auditable Kant case study

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20872 2026-07-24 cs.CL 新提交 57%

LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports

LegalCiteTrust:评估中文长篇法律研究报告中引用可信度的基准

Yunhan Li, Mingjie Xie, Zeyang Shi, Gengshen Wu, Min Yang

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Southern University of Science and Technology(南方科技大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 研究旨在评估中文长篇法律研究报告引用可信度,引入LegalCiteTrust基准,含72个任务并从三个维度评估。通过实验发现不同系统表现各异,检索工具与基于E/F/A的修订效果不同,强调可靠法律研究生成需检索后的引用感知证据治理。

Comments 8 pages, 21 pages with appendix, 26 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20549 2026-07-24 cs.LG cs.RO cs.SY eess.SY 新提交 57%

SevDiff: Severity-Conditioned Diffusion for Long-Tail Conflict Trajectory Generation

SevDiff:用于长尾冲突轨迹生成的严重程度条件扩散

Eni Solomon Laughter

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究针对ADAS评估中冲突轨迹罕见及现有方法不足的问题,提出SevDiff严重程度条件扩散模型,以TTC值为调节信号生成配对轨迹,经训练在不同TTC目标下有高命中率,生成特征物理合理,命中率下降模式可精确表征生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20528 2026-07-24 cs.AI 新提交 57%

PromptPack: Scaling LLM Annotation Agents for Online Recommendation

PromptPack:扩展用于在线推荐的大语言模型注释代理

Sebastian Koralewski, Merwan Barlier, Yulia Stolin, Blaž Škrlj

机构 * Teads Inc.(缇德思公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在线推荐平台用LLMs提取广告素材特征时按创意提示成本高的问题,提出可扩展的PromptPack代理,通过上下文内批处理等实现扩展,经实验评估,相比基线,它大幅降低成本、提高吞吐量且保留AUC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20431 2026-07-24 cs.CL cs.IR 新提交 57%

Skill-Contracted Agents for Evidence-Aware Materials Literature Analysis

用于证据感知材料文献分析的技能收缩代理

Bixuan Li, Yu Liu, Shuo Shi, Xiaoya Huang, Peng Kang, Lei Zheng

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究针对材料科学文献分析难题,提出技能驱动的AlphaAgent框架,通过明确技能契约解耦任务。其含专门检索技能和报告生成技能,在盲评中显著优于基线系统,提升了文献分析效果。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20124 2026-07-23 cs.LG cs.MA 新提交 57%

Autonomous Collaborative Learning Among an Ensemble of Tsetlin Machines with Consensus-Based Inference

基于共识推理的Tsetlin机集成中的自主协作学习

Yehuda Rudin, Osnat Keren, Michal Yemini, Alexander Fish

机构 * Faculty of Engineering, Bar Ilan University(巴伊兰大学工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文针对分布式和去中心化TM学习关注不足的问题,提出基于共识推理的Tsetlin机集成去中心化协作学习范式,各智能体维护私有模型,不交换原始数据,实验表明该范式下分类准确率与集中式模型相当,促进了信息集成融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20005 2026-07-23 cs.AI 新提交 57%

Safe Remediation as Risk-Constrained Intervention Decision in Microservice Systems

作为微服务系统中风险约束干预决策的安全修复

Chengxiao Dai, Zhaokun Yan, Chenjun Lei, Qiao Li, Luyan Zhang

机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) Khoury College of Computer Sciences, Northeastern University(美国东北大学库里计算机科学学院) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) College of Business and Economics, Australian National University(澳大利亚国立大学商业与经济学院) School of Computer Science and Technology, Fujian Normal University(福建师范大学计算机科学与技术学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究微服务系统中安全修复问题,将其转化为风险约束干预决策问题并构建约束马尔可夫决策过程,引入三维风险分解和上下文自适应人在回路门,通过实验验证该框架能降低错误修复率、提高修复成功率并减轻值班升级负载。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19380 2026-07-23 cs.LG 新提交 57%

CruiseBench: A Real-Flight-Aligned N-CMAPSS Benchmark for Engine RUL Prediction

CruiseBench:用于发动机剩余使用寿命预测的真实飞行对齐N-CMAPSS基准测试

Pu Cheng, Qiang Miao

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 研究发动机RUL预测问题,提出CruiseBench基准测试及CPM-N-CMAPSS方法,通过固定协议处理数据,排除部分因素,利用多种模型实验给出基线结果,为RUL模型比较提供可重复子基准及数据基础。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19356 2026-07-23 cs.AI 新提交 57%

NEXUS: Structured Runtime Safety for Tool-Using LLM Agents

NEXUS:工具使用型大语言模型智能体的结构化运行时安全

Elias Hossain, Md Mehedi Hasan Nipu, Tasfia Nuzhat Ornee, Rajib Rana, Niloofar Yousefi

机构 * University of Central Florida(中佛罗里达大学) North South University(南北大学) University of Southern Queensland(南昆士兰大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究工具使用型大语言模型智能体运行时安全问题,提出NEXUS结构化计划安全监控器,结合多种方法进行分级升级。在多个基准测试中表现出色,如合成基准测试F1分数达0.949等,还具有低延迟、低开销特点,相关成果已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19967 2026-07-23 physics.soc-ph cs.AI cs.CY 新提交 57%

When Shippers Become Algorithms: Candidate Exposure, Information Design, and the Concentration of LLM-Mediated Freight Markets

当托运人成为算法:候选者曝光、信息设计与大语言模型介导的货运市场集中度

Takahiro Ezaki, Naoto Imura, Katsuhiro Nishinari

机构 * Research Center for Advanced Science and Technology, The University of Tokyo(东京大学先进科学与技术研究中心) Department of Aeronautics and Astronautics, School of Engineering, The University of Tokyo(东京大学工学部航空宇宙学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究托运人委托大语言模型代理选择承运人对货运市场的影响及平台设计应对策略,通过基于代理的模拟发现代理趋同、集中度随候选列表数量变化等风险,披露承运人剩余日运力可有效应对,凸显平台信息设计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19281 2026-07-22 cs.LG 新提交 57%

A Reinforcement-Learning-Augmented Liquid-Fueled Reactor Network Model for Predicting Lean Blowout in Gas Turbine Combustors

一种用于预测燃气轮机燃烧室贫油熄火的强化学习增强型液体燃料反应器网络模型

Philip John, Eloghosa Ikponmwoba, Pinaki Pal, Opeoluwa Owoyele

机构 * Louisiana State University(路易斯安那州立大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究提出强化学习框架预测燃气轮机燃烧室贫油熄火,采用多阶段聚类-分类策略,借助初始聚类和演员-评论家RL智能体生成优化反应器区域,验证研究显示该框架预测保真度高、速度快,有潜力作为降阶建模技术辅助高保真模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18665 2026-07-22 cs.AI 新提交 57%

SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

SciHazard:一种通过分解危害评分来衡量科学安全风险的基准

Chunxiao Li, Yuan Xiong, Lijun Li, Tianyi Du, Wenlong Zhang, Lei Bai, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 研究针对大型语言模型可能传播有害科学知识的问题,引入SciHazard基准及评估框架,含多学科问题。开发分解评估程序计算DeHarm-Score,经专家验证和模型测试,显示该方法能有效衡量风险,还发现深度研究代理存在安全盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18659 2026-07-22 cs.CR cs.AI cs.MA 新提交 57%

Broken Gates: Re-evaluating Web Bot Defenses in the Age of LLM Agents

破碎的大门:在大语言模型代理时代重新评估网络机器人防御

Behzad Ousat, Nikita Turkmen, Lalchandra Rampersaud, Dillan Bailey, Amin Kharraz

机构 * Florida International University(佛罗里达国际大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在大语言模型代理时代网络机器人防御的有效性,通过系统测量研究评估基于交互式挑战与非交互式信任的防御对商业验证码解决服务和大语言模型代理的弹性,发现非交互式防御安全边界在环境层,影响机器人管理系统设计评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18432 2026-07-22 cs.CL 新提交 57%

Building a European Multilingual Evaluation Dataset: The MMLU Localisation Project within the EMT Network

构建欧洲多语言评估数据集:EMT网络中的MMLU本地化项目

Pilar Sánchez-Gijón, Susana Valdez, Sofía Calvo Del Barrio, Florence Bellemont, Anna Kokkinidou, Mihai Cristian Brasoveanu

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 DGT与EMT合作将MMLU数据集本地化至11种欧洲语言,既为大语言模型评估打造更具包容性基准,又为硕士生提供专业培训,还突显了相关方法、管理及工作流程方面的挑战。

Journal ref Proceedings of the 3rd International Conference on New Trends in Translation and Interpreting Technology, June 24 - 27, 2026, Dubrovnik, Croatia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18294 2026-07-22 cs.LG 新提交 57%

Uncertainty Quantification for AI-Driven Crash Simulation Surrogates: A Comparative Study of Monte Carlo Dropout and Deep Ensemble on Open-Source Bumper Beam Benchmark

人工智能驱动的碰撞模拟代理的不确定性量化:基于开源保险杠梁基准的蒙特卡洛随机失活和深度集成的比较研究

Sudeep Chavare

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 研究人工智能驱动碰撞模拟代理的不确定性量化,对蒙特卡洛随机失活和深度集成两种方法在开源管道上比较,用具体随机失活解决常见批评,经汽车碰撞模拟实验,揭示权衡,表明可低成本实现良好校准和无超参数的不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18272 2026-07-22 cs.GT cs.AI cs.SY eess.SY 新提交 57%

Market Strategy Evaluation for Prosumers in Local Electricity Markets

本地电力市场中 prosumer 的市场策略评估

Lukas Peter Wagner, Raoul Bisson, Felix Gehlhoff

机构 * Federal Ministry for Economic Affairs and Climate Action(经济事务和气候行动部) Projektträger Jülich GmbH(尤利奇项目载体)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究本地电力市场中 prosumer 的市场策略,开发基于代理的模拟平台,比较四种市场策略,通过模拟发现基于规则的资源控制可降社区能源支出,市场自适应策略收益最高,策略有效性取决于多种因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18240 2026-07-22 cs.AI 新提交 57%

Calibrated Selective Fact-Checking via Evidence Chain Evaluation

通过证据链评估进行校准的选择性事实核查

Dekun Yang

机构 * Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对大语言模型事实核查的可靠性问题,提出证据链评估框架ECE,通过网络搜索等收集证据并返回结构化裁决。在ECE - Bench上有较好表现,虽总体校准指标未超最强基线,但实现了选择性预测权衡,弃权可处理弱证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19334 2026-07-22 stat.ML cs.IT cs.LG math.IT math.ST stat.TH 新提交 57%

Fundamental limits of distributed multiclass classification from simple binary decisions

基于简单二元决策的分布式多类分类的基本限制

Ioannis Papageorgiou, Srinivas Nomula, Ayalvadi Ganesh, Sidharth Jaggi, Parimal Parag

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究从\(O(\log K)\)个简单二元分类器组合构建\(K\)类分类器的问题,当二元分类器为超平面时,在高斯设置下得出性能界限,并通过模拟实验验证理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17927 2026-07-21 cs.SE 新提交 57%

(Over)Reliance on Test Agents in AI-Assisted Software Testing

人工智能辅助软件测试中对测试代理的(过度)依赖

Eduard Paul Enoiu

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 探讨人工智能辅助软件测试中对测试代理的过度依赖问题,通过软件测试作为认知问题解决等三个理论视角阐述,提出收集过度依赖数据的框架及识别模式,旨在支持加速测试且不削弱测试判断与证据价值。

Comments Accepted @ ORCAS'2026, co-located with SAFECOMP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17701 2026-07-21 cs.AI 新提交 57%

ProEvent: An Event-centric Benchmark for Proactive Agents

ProEvent:面向主动智能体的以事件为中心的基准测试

Guanzhen Li, Liangming Pan, Leye Wang

机构 * School of Computing, Peking University(北京大学计算机学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对主动智能体研究忽视事件中心协助及评估难的问题,引入ProEvent基准测试,基于即时通讯聊天评估智能体维护用户时间表能力,实验发现当前智能体存在过度反应和事件取消处理难等问题,揭示了大语言模型的根本局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17250 2026-07-21 cs.CL 新提交 57%

EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

EvolvingWorld:用于交互式文学世界中角色与世界模型协同进化的开放架构框架

Qing Zong, Yue Guo, Mengxin Yang, Yiwen Guo, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) LIGHTSPEED(光速) Huazhong University of Science and Technology(华中科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究交互式文学世界中角色与世界协同进化问题,提出EvolvingWorld框架,含角色智能体和世界模型两个耦合模块,制定7个可训练任务,构建数据集并引入评估协议,实验证明其能有效改进长期模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16351 2026-07-21 cs.CV cs.AI 新提交 57%

Privacy-Aware Synthetic Video Benchmarking and Relational Evaluation for Worker-Under-Suspended-Load Detection

用于悬吊负载下工人检测的隐私感知合成视频基准测试与关系评估

Anshu Singh, Alejandro Seif

机构 * Government Technology Agency of Singapore(新加坡政府科技局)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 研究悬吊负载下工人检测的隐私问题,引入SynthSite合成视频基准测试及隐私感知混合生成工作流程,在五种隐私条件下评估相关指标,发现保留结构的模糊处理效用更好,强调建筑安全分析隐私评估需兼顾外观抑制和几何线索保留。

Comments Accepted at the 3rd Workshop on Synthetic Data for Computer Vision (SynData4CV), CVPR 2026. OpenReview: https://openreview.net/forum?id=dMfhFmDWsg . Dataset and code: https://huggingface.co/datasets/govtech/SynthSite

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16194 2026-07-21 cs.LG econ.GN q-fin.EC 新提交 57%

Reinforcement Learning-Guided NSGA-II Enhanced with Gray Relational Coefficient for Multi-Objective Optimization: Application to NASDAQ Portfolio Optimization

基于灰色关联系数增强的强化学习引导的NSGA-II在多目标优化中的应用:以纳斯达克投资组合优化为例

Zhiyuan Wang, Qinxu Ding, Ding Ding, Siying Zhu, Jing Ren, Yue Wang, Chong Hui Tan

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文针对投资组合优化中的约束多目标优化问题,提出RL-NSGA-II-GRC方法,结合强化学习智能体与灰色关联系数,通过自适应控制参数及设计综合指标引导搜索,在基准测试和纳斯达克案例中提升收敛性,得到密集前沿及有效投资组合。

Journal ref Mathematics 14(2), 296 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17012 2026-07-21 cs.SE cond-mat.mtrl-sci physics.ins-det 新提交 57%

Schema-Bound LLM Control of Scientific Instrumentation through Model Context Protocol Skills

通过模型上下文协议技能对科学仪器进行模式绑定的大语言模型控制

Roberto dos Reis, Vinayak P. Dravid

专题命中 Agent评测 :agentic(abstract);分类 cs.SE

AI总结 研究如何通过模型上下文协议将本地大语言模型与科学仪器相连,结合多种技术实现连接,开源服务器展示相关工具等,通过软件验证,为闭环智能仪器研究提供基础。

Comments 36 pages, 8 figures, 7 tables. Open-source reference implementation, physics-plausible simulator, and validation suite. Software-only validation; live-instrument validation is not reported

详情

展开后加载摘要…

URL PDF HTML 收藏