arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-02 至 2025-12-02 共收录 145 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 25 篇

2512.00977 2025-12-02 cond-mat.mtrl-sci 82%

Crystalyse: a multi-tool agent for materials design

Crystalyse:一种用于材料设计的多工具代理

Ryan Nduma, Hyunsoo Park, Aron Walsh

专题命中 Agent评测 :agent(title,abstract);agentic(abstract)

AI总结 Crystalyse是一种用于材料设计的多工具代理,通过三种操作模式在探索速度和验证深度之间进行权衡,提升材料设计的透明性和可重复性。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00007 2025-12-02 cs.IR cs.AI cs.CL 81%

Use of Retrieval-Augmented Large Language Model Agent for Long-Form COVID-19 Fact-Checking

使用检索增强型大语言模型代理进行长期形式的新冠事实核查

Jingyi Huang, Yuyi Yang, Mengmeng Ji, Charles Alba, Sheng Zhang, Ruopeng An

机构 * New York University, USA(纽约大学) Washington University in St. Louis, USA(华盛顿大学圣路易斯分校) Shanghai University of Sports, China(上海体育大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出SAFE系统,结合大语言模型与检索增强生成技术,有效提升长期新冠虚假信息的事实核查能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00294 2025-12-02 cs.CV cs.AI cs.HC 79%

Words into World: A Task-Adaptive Agent for Language-Guided Spatial Retrieval in AR

词语进入世界:一种任务自适应代理用于增强现实中的语言引导空间检索

Lixing Guo, Tobias Höllerer

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出一种任务自适应AR代理,结合多模态大语言模型和视觉模型,实现语言引导的空间检索,支持复杂查询和真实世界交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10445 2025-12-02 cs.AI cs.CL cs.CV cs.LG 75%

RealWebAssist: A Benchmark for Long-Horizon Web Assistance with Real-World Users

RealWebAssist: 一个用于长周期网页协助的基准测试

Suyu Ye, Haojun Shi, Darren Shih, Hyokun Yun, Tanya Roosta, Tianmin Shu

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 RealWebAssist是一个评估长周期网页协助中连续指令遵循能力的新基准测试,旨在解决现实世界中用户指令模糊性和动态性带来的挑战。

Comments Project Website: https://scai.cs.jhu.edu/projects/RealWebAssist/ Code: https://github.com/SCAI-JHU/RealWebAssist

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07663 2025-12-02 cs.AI cs.CL cs.CY cs.HC 73%

Human Decision-making is Susceptible to AI-driven Manipulation

人类决策易受AI驱动的操控

Sahand Sabour, June M. Liu, Siyang Liu, Chris Z. Yao, Shiyao Cui, Xuanming Zhang, Wen Zhang, Yaru Cao, Advait Bhat, Jian Guan, Wei Wu, Rada Mihalcea, Hongning Wang, Tim Althoff, Tatia M. C. Lee, Minlie Huang

机构 * The CoAI Group, DCST, Institute for Artificial Intelligence, Tsinghua University, Beijing, China(CoAI小组、DCST、人工智能研究所、清华大学、北京中国) State Key Laboratory of Brain and Cognitive Sciences, The University of Hong Kong, Hong Kong SAR, China(脑与认知科学国家重点实验室、香港大学、香港特别行政区中国) The LIT Group, Department of Computer Science and Engineering, University of Michigan, Ann Arbor(LIT小组、计算机科学与工程系、密歇根大学、安阿伯) Paul G. Allen School of Computer Science and Engineering, University of Washington, Seattle, WA, USA(保罗·G·阿伦计算机科学与工程学院、华盛顿大学、西雅图华盛顿州美国) ANT Group(ANT集团)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 研究发现人类在金融和情感决策中易受AI操控,操控代理显著提高了用户对隐藏激励的评分,表明需加强伦理监管以保护自主权。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01420 2025-12-02 cs.CL cs.AI 73%

PromptBridge: Cross-Model Prompt Transfer for Large Language Models

PromptBridge: 跨模型提示迁移用于大型语言模型

Yaxuan Wang, Quan Liu, Zhenting Wang, Zichao Li, Wei Wei, Yang Liu, Yujia Bao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Center for Advanced AI, Accenture(Accenture高级人工智能研究中心)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 PromptBridge通过跨模型提示迁移技术,解决模型切换时提示效果下降的问题,提升下游任务准确性并减少迁移成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20073 2025-12-02 cs.CL cs.AI cs.MA 73%

Collab-Overcooked: Benchmarking and Evaluating Large Language Models as Collaborative Agents

Collab-Overcooked: 大语言模型作为协作代理的基准测试与评估

Haochen Sun, Shuwen Zhang, Lujie Niu, Lei Ren, Hao Xu, Hao Fu, Fangkun Zhao, Caixia Yuan, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto Inc

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Collab-Overcooked基准测试,评估大语言模型在协作代理中的表现,揭示其在目标解释和协作能力上的优劣。

Comments Accepted to EMNLP 2025 Main Conference. Camera-Ready Version. 30 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00352 2025-12-02 cs.LG stat.ML 70%

Sample-Efficient Tabular Self-Play for Offline Robust Reinforcement Learning

样本高效的目标导向自博弈用于离线鲁棒强化学习

Na Li, Zewu Zheng, Wei Ni, Hangguan Shan, Wenjie Zhang, Xinyu Li

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Edith Cowan University(埃迪斯·科温大学) University of New South Wales(新南威尔士大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出RTZ-VI-LCB算法,通过乐观鲁棒值迭代和数据驱动的伯恩斯坦惩罚项,实现离线鲁棒双人零和马尔可夫游戏的最优样本复杂性保证。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00136 2025-12-02 cs.CR cs.SE 70%

An Empirical Study on the Security Vulnerabilities of GPTs

对GPTs安全漏洞的实证研究

Tong Wu, Weibin Wu, Zibin Zheng

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.SE

AI总结 本研究通过实证分析揭示GPTs的安全漏洞,设计攻击套件并提出防御机制,旨在提升其安全性和应用责任感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21053 2025-12-02 cs.RO cs.CV 67%

AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios

AerialMind:迈向无人机场景中的指称多目标跟踪

Chenglizhao Chen, Shaofeng Liang, Runwei Guan, Xiaolou Sun, Haocheng Zhao, Haiyun Jiang, Tao Huang, Henghui Ding, Qing-Long Han

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 AerialMind是首个针对无人机场景的RMOT基准,通过COALA框架和HETrack方法提升无人机的自然语言交互能力与多目标跟踪性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09785 2025-12-02 cs.CL cs.AI cs.LG cs.SD eess.AS 67%

Large Language Model Based Generative Error Correction: A Challenge and Baselines for Speech Recognition, Speaker Tagging, and Emotion Recognition

基于大语言模型的生成性错误校正:语音识别、说话人标注和情感识别的挑战与基线

Chao-Han Huck Yang, Taejin Park, Yuan Gong, Yuanchao Li, Zhehuai Chen, Yen-Ting Lin, Chen Chen, Yuchen Hu, Kunal Dhawan, Piotr Żelasko, Chao Zhang, Yun-Nung Chen, Yu Tsao, Jagadeesh Balam, Boris Ginsburg, Sabato Marco Siniscalchi, Eng Siong Chng, Peter Bell, Catherine Lai, Shinji Watanabe, Andreas Stolcke

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出GenSEC挑战,通过大语言模型提升语音识别、说话人标注和情感识别任务的准确性与实用性。

Comments IEEE SLT 2024. The initial draft version has been done in December 2023. Post-ASR Text Processing and Understanding Community and LlaMA-7B pre-training correction model: https://huggingface.co/GenSEC-LLM/SLT-Task1-Llama2-7b-HyPo-baseline

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01507 2025-12-02 cs.AI cs.LG 62%

SynthStrategy: Extracting and Formalizing Latent Strategic Insights from LLMs in Organic Chemistry

SynthStrategy: 从有机化学中提取并形式化大语言模型中的潜在战略洞察

Daniel Armstrong, Zlatko Jončev, Andres M Bran, Philippe Schwaller

机构 * \'Ecole Polytechnique F\' e d\' e rale de Lausanne (EPFL)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 SynthStrategy通过将大语言模型中的合成策略转化为可验证代码,实现了基于自然语言的路线检索,并在基准测试中达到75%的Top-3准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01396 2025-12-02 cs.SE cs.CL cs.CR 62%

BackportBench: A Multilingual Benchmark for Automated Backporting of Patches

BackportBench: 一种多语言的自动化补丁回退基准测试

Zhiqing Zhong, Jiaming Huang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳))

专题命中 Agent评测 :agentic(abstract);分类 cs.CL、cs.SE

AI总结 BackportBench是一个多语言基准测试,用于评估自动化补丁回退技术,展示了代理方法在处理复杂补丁回退任务中的优越性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00586 2025-12-02 cs.LG cs.CL q-bio.QM 62%

Statistical NLP for Optimization of Clinical Trial Success Prediction in Pharmaceutical R&D

统计自然语言处理用于药理研发中临床试验成功预测的优化

Michael R. Doane

专题命中 Agent评测 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本文利用统计自然语言处理技术开发了基于BioBERT的模型,以优化神经科学领域临床试验成功预测,提升研发决策效率。

Comments Doctor of Engineering Praxis Dissertation, The George Washington University. 122 pages. Present affiliation: Iambic Therapeutics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01896 2025-12-02 cs.CL 57%

OPOR-Bench: Evaluating Large Language Models on Online Public Opinion Report Generation

OPOR-Bench:评估大型语言模型在在线公共舆论报告生成中的表现

Jinzheng Yu, Yang Xu, Haozhen Li, Junqi Li, Yifan Feng, Ligu Zhu, Hao Shen, Lei Shi

机构 * Communication University of China(中国传媒大学) Harbin Institute of Technology(哈尔滨工业大学) China Academy of Railway Sciences Corporation Limited(中国铁道科学研究院集团有限公司) School of Engineering, Santa Clara University(圣克拉拉大学工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 OPOR-Bench通过定义自动在线公共舆论报告生成任务,构建了包含463个危机事件的数据集,并提出OPOR-EVAL框架评估生成报告质量,为该领域研究提供基础。

Comments 27 pages, accepted by CMC-Computers, Materials & Continua, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01735 2025-12-02 cs.LG 57%

Automating modeling in mechanics: LLMs as designers of physics-constrained neural networks for constitutive modeling of materials

力学建模自动化:LLM作为物理约束神经网络的设计者,用于材料本构建模

Marius Tacke, Matthias Busch, Kian Abdolazizi, Jonas Eichinger, Kevin Linka, Christian Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling, Helmholtz-Zentrum Hereon(材料系统建模研究所,海德堡中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(连续力学与材料力学研究所,汉堡技术大学) Helmholtz-Zentrum Hereon(海德堡中心) Hamburg University of Technology(汉堡技术大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 本文提出利用LLM自动设计物理约束神经网络,用于材料本构建模,实现建模自动化和高效准确的本构模型生成。

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00010 2025-12-02 cs.HC cs.AI 57%

Leveraging LLMs for Design Ideation: An AI Tool to Assist Creativity

利用LLMs进行设计构思:一种辅助创造力的AI工具

Rutvik Kokate, Pranati Kompella, Prasad Onkar

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种名为ALIA的AI工具,利用LLMs通过语音交互提升设计构思阶段的创造性潜力。

Comments 9 pages, 4 figures

Journal ref Responsible and Resilient Design for Society, Volume 4. ICoRD 2025, pp 579 to 589

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01950 2025-12-02 cond-mat.soft physics.bio-ph 50%

Order and shape dependence of mechanical relaxation in proliferating active matter

增殖活性物质中机械弛豫的有序性和形状依赖性

Jonas Isensee, Lukas Hupe, Philip Bittihn

专题命中 Agent评测 :agent(abstract)

AI总结 研究揭示了增殖活性物质中机械弛豫的有序性和形状依赖性,通过分析粒子形状对生长和对齐机制的影响,发现椭圆生长可逆转经典对齐并改变微域动态。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01098 2025-12-02 eess.SY cs.SY 50%

Negotiating Highway Interchange Traffic with a Decentralized Instability-Driven CBF-based Algorithm

协商高速公路交汇车道的去中心化不稳定性驱动CBF算法

Mrdjan Jankovic, Shreshta Rajakumar Deshpande, Gopika Ajaykumar

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种去中心化不稳定性驱动的CBF算法,用于高效处理高速公路交汇车道的换道问题,通过控制器调节和不稳定性速度优化车辆群的性能。

Comments 7 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01021 2025-12-02 cs.GT math.OC 50%

Mechanism Design with Spiteful Agents

带有恶意代理的机制设计

Aditya Aradhye, David Lagziel, Eilon Solan

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了恶意代理在机制设计中的影响,证明了在匿名性或效率前提下,任何满足个体理性和激励相容的机制都会退化为不分配物品的空机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22649 2025-12-02 econ.TH 50%

Entropy Regularized Belief Reporting

熵正则化的信念报告

Elchin Suleymanov

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出熵正则化的信念报告模型,通过最小化Kullback-Leibler散度和熵正则化来解释代理在不同分区下的信念报告行为,并应用于实验数据进行实证分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00051 2025-12-02 cs.RO cs.SY eess.SY 50%

Modeling and Control of Magnetic Forces between Microrobots

微机器人之间磁力的建模与控制

Amelia Fernández Seguel, Alejandro I. Maass

机构 * Robotic Engineering, School of Engineering, Pontificia Universidad Católica de Chile(机器人工程系,工程学院,Pontificia Universidad Católica de Chile) Department of Electrical Engineering, School of Engineering, Pontificia Universidad Católica de Chile(电气工程系,工程学院,Pontificia Universidad Católica de Chile)

专题命中 Agent评测 :agent(abstract)

AI总结 本研究提出了一种基于全局磁场角度的级联控制方法,用于精确调节微机器人之间的径向距离,提高了控制精度和响应速度。

Comments 38 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00005 2025-12-02 cs.RO 50%

DREAMer-VXS: A Latent World Model for Sample-Efficient AGV Exploration in Stochastic, Unobserved Environments

DREAMer-VXS:一种用于在随机、未观测环境中高效样本AGV探索的潜在世界模型

Agniprabha Chakraborty

机构 * Department of Power Engineering, Jadavpur University(功率工程系,贾瓦德普尔大学)

专题命中 Agent评测 :agent(abstract)

AI总结 DREAMer-VXS通过高效样本利用和潜在世界模型,实现AGV在随机未观测环境中的高效探索与鲁棒导航

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2511.20494 2025-12-02 cs.CL 57%

Adversarial Confusion Attack: Disrupting Multimodal Large Language Models

对抗混淆攻击:破坏多模态大语言模型

Jakub Hoscilowicz, Artur Janicki

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 其他Agent :AI agent(abstract);分类 cs.CL

AI总结 本文提出对抗混淆攻击,通过生成扰动破坏多模态大语言模型的可靠性,展示其在不同模型上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00868 2025-12-02 physics.acc-ph cs.DL 50%

A Core Ontology for Particle Accelerators: Interoperable Data and Workflows Across Facilities

粒子加速器的核心本体:跨设施的数据与工作流互操作性

Chris Tennant

专题命中 其他Agent :agentic(abstract)

AI总结 本文提出了一种粒子加速器核心本体,用于实现跨设施的数据与工作流互操作性,通过共享语义支持标准化描述和可重用工具。

Comments 11 pages, 3 figures, glossary

详情

展开后加载摘要…

URL PDF HTML 收藏