Crystalyse: a multi-tool agent for materials design
Crystalyse:一种用于材料设计的多工具代理
专题命中 Agent评测 :agent(title,abstract);agentic(abstract)
AI总结 Crystalyse是一种用于材料设计的多工具代理,通过三种操作模式在探索速度和验证深度之间进行权衡,提升材料设计的透明性和可重复性。
Comments 23 pages, 4 figures
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
Crystalyse:一种用于材料设计的多工具代理
专题命中 Agent评测 :agent(title,abstract);agentic(abstract)
AI总结 Crystalyse是一种用于材料设计的多工具代理,通过三种操作模式在探索速度和验证深度之间进行权衡,提升材料设计的透明性和可重复性。
Comments 23 pages, 4 figures
使用检索增强型大语言模型代理进行长期形式的新冠事实核查
机构 * New York University, USA(纽约大学) ; Washington University in St. Louis, USA(华盛顿大学圣路易斯分校) ; Shanghai University of Sports, China(上海体育大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 本文提出SAFE系统,结合大语言模型与检索增强生成技术,有效提升长期新冠虚假信息的事实核查能力。
词语进入世界:一种任务自适应代理用于增强现实中的语言引导空间检索
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出一种任务自适应AR代理,结合多模态大语言模型和视觉模型,实现语言引导的空间检索,支持复杂查询和真实世界交互。
RealWebAssist: 一个用于长周期网页协助的基准测试
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 RealWebAssist是一个评估长周期网页协助中连续指令遵循能力的新基准测试,旨在解决现实世界中用户指令模糊性和动态性带来的挑战。
Comments Project Website: https://scai.cs.jhu.edu/projects/RealWebAssist/ Code: https://github.com/SCAI-JHU/RealWebAssist
人类决策易受AI驱动的操控
机构 * The CoAI Group, DCST, Institute for Artificial Intelligence, Tsinghua University, Beijing, China(CoAI小组、DCST、人工智能研究所、清华大学、北京中国) ; State Key Laboratory of Brain and Cognitive Sciences, The University of Hong Kong, Hong Kong SAR, China(脑与认知科学国家重点实验室、香港大学、香港特别行政区中国) ; The LIT Group, Department of Computer Science and Engineering, University of Michigan, Ann Arbor(LIT小组、计算机科学与工程系、密歇根大学、安阿伯) ; Paul G. Allen School of Computer Science and Engineering, University of Washington, Seattle, WA, USA(保罗·G·阿伦计算机科学与工程学院、华盛顿大学、西雅图华盛顿州美国) ; ANT Group(ANT集团)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL
AI总结 研究发现人类在金融和情感决策中易受AI操控,操控代理显著提高了用户对隐藏激励的评分,表明需加强伦理监管以保护自主权。
Comments Work in progress
PromptBridge: 跨模型提示迁移用于大型语言模型
机构 * University of California, Santa Cruz(加州大学圣克ruz分校) ; Center for Advanced AI, Accenture(Accenture高级人工智能研究中心)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 PromptBridge通过跨模型提示迁移技术,解决模型切换时提示效果下降的问题,提升下游任务准确性并减少迁移成本。
Collab-Overcooked: 大语言模型作为协作代理的基准测试与评估
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Li Auto Inc
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出Collab-Overcooked基准测试,评估大语言模型在协作代理中的表现,揭示其在目标解释和协作能力上的优劣。
Comments Accepted to EMNLP 2025 Main Conference. Camera-Ready Version. 30 pages, 17 figures
样本高效的目标导向自博弈用于离线鲁棒强化学习
机构 * Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学) ; Edith Cowan University(埃迪斯·科温大学) ; University of New South Wales(新南威尔士大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG
AI总结 本文提出RTZ-VI-LCB算法,通过乐观鲁棒值迭代和数据驱动的伯恩斯坦惩罚项,实现离线鲁棒双人零和马尔可夫游戏的最优样本复杂性保证。
Comments NeurIPS 2025
对GPTs安全漏洞的实证研究
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.SE
AI总结 本研究通过实证分析揭示GPTs的安全漏洞,设计攻击套件并提出防御机制,旨在提升其安全性和应用责任感。
AerialMind:迈向无人机场景中的指称多目标跟踪
专题命中 Agent评测 :agent(abstract);planning(abstract)
AI总结 AerialMind是首个针对无人机场景的RMOT基准,通过COALA框架和HETrack方法提升无人机的自然语言交互能力与多目标跟踪性能。
Comments AAAI 2026
基于大语言模型的生成性错误校正:语音识别、说话人标注和情感识别的挑战与基线
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出GenSEC挑战,通过大语言模型提升语音识别、说话人标注和情感识别任务的准确性与实用性。
Comments IEEE SLT 2024. The initial draft version has been done in December 2023. Post-ASR Text Processing and Understanding Community and LlaMA-7B pre-training correction model: https://huggingface.co/GenSEC-LLM/SLT-Task1-Llama2-7b-HyPo-baseline
SynthStrategy: 从有机化学中提取并形式化大语言模型中的潜在战略洞察
机构 * \'Ecole Polytechnique F\' e d\' e rale de Lausanne (EPFL)
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 SynthStrategy通过将大语言模型中的合成策略转化为可验证代码,实现了基于自然语言的路线检索,并在基准测试中达到75%的Top-3准确率。
BackportBench: 一种多语言的自动化补丁回退基准测试
机构 * The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳))
专题命中 Agent评测 :agentic(abstract);分类 cs.CL、cs.SE
AI总结 BackportBench是一个多语言基准测试,用于评估自动化补丁回退技术,展示了代理方法在处理复杂补丁回退任务中的优越性。
Comments Under review
统计自然语言处理用于药理研发中临床试验成功预测的优化
专题命中 Agent评测 :planning(abstract);分类 cs.CL、cs.LG
AI总结 本文利用统计自然语言处理技术开发了基于BioBERT的模型,以优化神经科学领域临床试验成功预测,提升研发决策效率。
Comments Doctor of Engineering Praxis Dissertation, The George Washington University. 122 pages. Present affiliation: Iambic Therapeutics
OPOR-Bench:评估大型语言模型在在线公共舆论报告生成中的表现
机构 * Communication University of China(中国传媒大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; China Academy of Railway Sciences Corporation Limited(中国铁道科学研究院集团有限公司) ; School of Engineering, Santa Clara University(圣克拉拉大学工程学院)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 OPOR-Bench通过定义自动在线公共舆论报告生成任务,构建了包含463个危机事件的数据集,并提出OPOR-EVAL框架评估生成报告质量,为该领域研究提供基础。
Comments 27 pages, accepted by CMC-Computers, Materials & Continua, 2025
力学建模自动化:LLM作为物理约束神经网络的设计者,用于材料本构建模
机构 * Institute of Material Systems Modeling, Helmholtz-Zentrum Hereon(材料系统建模研究所,海德堡中心) ; Institute for Continuum and Material Mechanics, Hamburg University of Technology(连续力学与材料力学研究所,汉堡技术大学) ; Helmholtz-Zentrum Hereon(海德堡中心) ; Hamburg University of Technology(汉堡技术大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.LG
AI总结 本文提出利用LLM自动设计物理约束神经网络,用于材料本构建模,实现建模自动化和高效准确的本构模型生成。
Comments Currently under review
利用LLMs进行设计构思:一种辅助创造力的AI工具
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种名为ALIA的AI工具,利用LLMs通过语音交互提升设计构思阶段的创造性潜力。
Comments 9 pages, 4 figures
Journal ref Responsible and Resilient Design for Society, Volume 4. ICoRD 2025, pp 579 to 589
增殖活性物质中机械弛豫的有序性和形状依赖性
专题命中 Agent评测 :agent(abstract)
AI总结 研究揭示了增殖活性物质中机械弛豫的有序性和形状依赖性,通过分析粒子形状对生长和对齐机制的影响,发现椭圆生长可逆转经典对齐并改变微域动态。
Comments 9 pages, 5 figures
协商高速公路交汇车道的去中心化不稳定性驱动CBF算法
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种去中心化不稳定性驱动的CBF算法,用于高效处理高速公路交汇车道的换道问题,通过控制器调节和不稳定性速度优化车辆群的性能。
Comments 7 pages, 7 figures, 2 tables
带有恶意代理的机制设计
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究了恶意代理在机制设计中的影响,证明了在匿名性或效率前提下,任何满足个体理性和激励相容的机制都会退化为不分配物品的空机制。
熵正则化的信念报告
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出熵正则化的信念报告模型,通过最小化Kullback-Leibler散度和熵正则化来解释代理在不同分区下的信念报告行为,并应用于实验数据进行实证分析。
微机器人之间磁力的建模与控制
机构 * Robotic Engineering, School of Engineering, Pontificia Universidad Católica de Chile(机器人工程系,工程学院,Pontificia Universidad Católica de Chile) ; Department of Electrical Engineering, School of Engineering, Pontificia Universidad Católica de Chile(电气工程系,工程学院,Pontificia Universidad Católica de Chile)
专题命中 Agent评测 :agent(abstract)
AI总结 本研究提出了一种基于全局磁场角度的级联控制方法,用于精确调节微机器人之间的径向距离,提高了控制精度和响应速度。
Comments 38 pages, 10 figures
DREAMer-VXS:一种用于在随机、未观测环境中高效样本AGV探索的潜在世界模型
机构 * Department of Power Engineering, Jadavpur University(功率工程系,贾瓦德普尔大学)
专题命中 Agent评测 :agent(abstract)
AI总结 DREAMer-VXS通过高效样本利用和潜在世界模型,实现AGV在随机未观测环境中的高效探索与鲁棒导航
对抗混淆攻击:破坏多模态大语言模型
机构 * Warsaw University of Technology(华沙技术大学)
专题命中 其他Agent :AI agent(abstract);分类 cs.CL
AI总结 本文提出对抗混淆攻击,通过生成扰动破坏多模态大语言模型的可靠性,展示其在不同模型上的有效性。
粒子加速器的核心本体:跨设施的数据与工作流互操作性
专题命中 其他Agent :agentic(abstract)
AI总结 本文提出了一种粒子加速器核心本体,用于实现跨设施的数据与工作流互操作性,通过共享语义支持标准化描述和可重用工具。
Comments 11 pages, 3 figures, glossary