Seed1.8 Model Card: Towards Generalized Real-World Agency
Seed1.8 模型卡:迈向通用的现实世界代理
机构 * Bytedance Seed(字节跳动Seed)
专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI
AI总结 Seed1.8 模型旨在实现通用的现实世界代理能力,支持多轮交互、工具使用和多步骤执行,同时保持大语言模型和视觉语言性能,并提供统一的代理接口。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
Seed1.8 模型卡:迈向通用的现实世界代理
机构 * Bytedance Seed(字节跳动Seed)
专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI
AI总结 Seed1.8 模型旨在实现通用的现实世界代理能力,支持多轮交互、工具使用和多步骤执行,同时保持大语言模型和视觉语言性能,并提供统一的代理接口。
COMPASS:评估LLM代理在约束优化中的表现
机构 * Harvard University(哈佛大学) ; Apple(苹果公司) ; Virginia Tech(弗吉尼亚理工学院) ; UIUC(伊利诺伊大学香槟分校) ; UC Berkeley(加州大学伯克利分校)
专题命中 工具调用 :tool use(abstract);planning(abstract);分类 cs.LG
AI总结 COMPASS基准测试评估LLM代理在真实旅行规划中的约束优化能力,揭示当前模型在可行性与最优性之间存在显著差距,表明搜索空间探索不足是核心限制,编码代理提供潜在解决方案。
Evo-MedAgent:超越单次诊断的具有记忆、反思和改进能力的代理
机构 * Technical University of Munich(慕尼黑技术大学) ; TUM University Hospital(TUM大学医院) ; LMU Munich(慕尼黑大学) ; National University of Singapore(新加坡国立大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Imperial College London(伦敦帝国理工学院)
专题命中 工具调用 :agent(abstract);tool-use(abstract);分类 cs.AI
AI总结 Evo-MedAgent通过引入自我进化记忆模块,使医疗代理在测试时实现跨案例学习,提升多选题准确率,无需额外训练,适用于任何冻结模型。
MARCA:基于检查表的多语言网络搜索基准
机构 * Maritaca AI ; Jusbrasil
专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.CL
AI总结 MARCA是一个双语(英语和葡萄牙语)基准,用于评估LLM在基于网络的信息检索中的能力,通过手动编写的多实体问题和检查表式评分标准,评估答案的完整性和正确性,并发现任务分解框架能提升覆盖范围,模型在英语到葡萄牙语的迁移中存在显著差异。
MCP-Flow:帮助LLM代理掌握现实世界、多样且可扩展的MCP工具
机构 * TikTok ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; University of Illinois at Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 MCP-Flow通过自动化流程提升LLM在现实世界MCP环境中的能力,通过大规模服务器发现、数据合成和模型训练,生成高质量指令-功能调用对和轨迹,推动代理任务性能提升。
Comments ACL 2026 Main, Camera Ready
谁掌控机器?面向跨企业与地缘政治边界的AI系统机器身份治理分类(MIGT)
专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出AI身份风险分类(AIRT)和机器身份治理分类(MIGT),解决AI系统中机器身份治理的空白,涵盖37个风险子类,同时应对技术、合规和跨司法管辖区协调的缺口。
Comments 75 pages (excl. references), 2 tables. Addresses policy makers, regulators, and practitioners at the intersection of AI governance, cybersecurity, and geopolitical risk
搜索,不要猜测:教小语言模型成为有效的搜索代理
机构 * New York University(纽约大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Nanyang Technological University(南洋理工大学)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文通过评估复杂多跳推理任务,发现小语言模型(SLMs)虽参数较少,但检索工具使用更少且易产生幻觉。提出轻量级微调方法\policy,使SLMs能可靠检索并生成基于证据的答案,提升Bamboogle和HotpotQA性能17.3和15.3分,达到LLM水平。
Comments 13 pages, 5 figures
检测和纠正商业大语言模型和深度研究代理中的参考幻觉
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.CL
AI总结 研究通过评估10种模型和代理在DRBench和ExpertQA上的引用URL可靠性,发现3-13%的URL存在幻觉,5-18%无法解析。提出urlhealth工具可有效减少非解析URL,验证引用URL的有效性与可纠正性。
Comments 25 pages
代理如何以及为何能够识别引入缺陷的提交
专题命中 工具调用 :workflow(abstract);agentic(abstract);分类 cs.SE
AI总结 本文探讨了基于LLM的代理如何通过搜索候选提交提升识别引入缺陷提交的性能,提出了一种简单的代理工作流程,并揭示了代理在搜索中的有效性及对缺陷检测的潜在影响。
MCP安全基准(MSB):针对LLM代理中模型上下文协议的攻击评估
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 工具调用 :tool-use(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出MSB,首个端到端评估套件,系统评估LLM代理在MCP全流程中的抗攻击能力,包含12种攻击类型及性能指标NRP,评估九种主流LLM代理在10个领域405种工具上的表现。
Comments Accepted by ICLR 2026
MMSearch-Plus:面向多模态浏览代理的溯源感知基准测试
机构 * The University of Hong Kong (HKU)(香港大学) ; Huawei Inc(华为公司)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 MMSearch-Plus是一个包含311个任务的基准测试,通过迭代图像-文本检索和交叉验证在噪声下强制多模态理解,提供模型无关的代理框架和集中标记模块,提升多步推理的鲁棒性。
Comments Project Page: https://mmsearch-plus.github.io
Journal ref ICLR 2026
VisBrowse-Bench:多模态浏览代理的视觉原生搜索基准测试
机构 * CASIA ; Ant Digital Technologies Ant Group(蚂蚁集团数字技术部) ; RUC(清华大学) ; FZU(福建师范大学) ; THU(清华大学) ; USTB(北京科技大学) ; PKU(北京大学)
专题命中 工具调用 :agent(abstract);workflow(abstract);分类 cs.AI
AI总结 本文提出VisBrowse-Bench,用于评估多模态浏览代理的视觉推理能力,通过文本-图像检索和联合推理进行多模态证据交叉验证,验证了不同模型在搜索过程中的表现。
Kestrel: 为降低LVLM幻觉而引入自反思
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; UC Berkeley(加州大学伯克利分校) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Apple(苹果公司)
专题命中 工具调用 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 Kestrel提出一种无需训练的框架,通过显式视觉 grounding 与证据验证自反思机制减少LVLM幻觉,实验显示在POPE和MME-Hallucination基准上性能提升,同时提供透明的验证轨迹。
Comments 16 pages, 11 figures, 5 tables
人机协作自主实验与代理建模用于比较观察
专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.LG
AI总结 本文提出代理建模贝叶斯优化方法,通过人机协作提升材料空间探索效率,结合人类判断与AI代理实现更精确的实验优化。
Comments 14 pages, 7 figures
对话式AI增强的探索系统用于查询自然历史博物馆大规模数字化收藏
机构 * School of Computer Science, University of Technology Sydney(技术科技大学计算机科学学院) ; School of Design, University of Technology Sydney(技术科技大学设计学院) ; Australian Museum Research Institute, Australian Museum(澳大利亚博物馆研究 institute, 澳大利亚博物馆) ; Australian Museum(澳大利亚博物馆)
专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本文提出利用对话式AI查询自然历史博物馆大规模数字化收藏的系统,通过交互式地图和自然语言代理实现高效的数据检索与探索。
Comments 25 pages, 9 figures
超越最大令牌:通过工具调用链实现隐秘的资源放大
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; University of Illinois Urbana-Champaign, United States(伊利诺伊大学厄巴纳-香槟分校,美国) ; The Hong Kong University of Science and Technology, Hong Kong(香港科学与技术大学,香港) ; Shanghai Jiao Tong University, China(上海交通大学,中国)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出了一种基于工具调用链的隐秘DoS攻击,通过多轮交互显著提升LLM的资源消耗,挑战现有安全防护机制。
AgentA/B: 基于交互式LLM代理的自动化和可扩展的网页A/B测试
机构 * Northeastern University(东北大学) ; Pennsylvania State University(宾夕法尼亚州立大学) ; Amazon USA(亚马逊美国)
专题命中 工具调用 :agent(abstract);autonomous agent(abstract);分类 cs.CL
AI总结 AgentA/B通过交互式LLM代理实现自动化和可扩展的网页A/B测试,模拟用户行为以评估网页设计效果。
一种轻量级交通图用于高效任何时间LaCAM*
机构 * Monash University, Faculty of Information Technology(莫纳什大学信息科技学院)
专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出了一种基于动态轻量级交通图的改进方法,用于提升LaCAM*在多智能体路径寻找中的解决方案质量。
具身化伴侣:视觉叙事中的交互伙伴
机构 * Goldsmiths, University of London(伦敦大学金史密斯学院) ; DeepMind(深度Mind)
专题命中 工具调用 :tool use(abstract);agentic(abstract);分类 cs.AI
AI总结 Companion通过结合绘图机器人与大语言模型,实现人机协同创作,推动视觉叙事的创新与美学探索。
Comments 35 pages, 18 figures
LAPIS:轻量级智能系统API规范
专题命中 工具调用 :agent(abstract);autonomous agent(abstract);分类 cs.SE
AI总结 LAPIS是一种为LLM优化的轻量级API规范格式,通过减少token使用并保留语义信息,提升智能系统对API的处理效率。
TabTracer:基于大语言模型的复杂表格推理的蒙特卡洛树搜索
机构 * Beijing Institute of Technology, Zhuhai(北京理工大学(珠海)) ; Beijing Institute of Technology(北京理工大学) ; Shenzhen University(深圳大学)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 TabTracer通过多步工具调用和显式状态跟踪,提升复杂表格推理的准确率并降低token成本。
pixelLOG:用于认知研究的在线游戏日志记录
专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 pixelLOG是一种用于认知研究的高性能数据收集框架,通过混合方法跟踪多人游戏中的行为,实现高分辨率分析。
Comments 9 pages, 1 figure
知道你所知道的并不足够:大型语言模型的置信度与行为不一致
机构 * Vanderbilt University(范德比大学) ; MIT(麻省理工学院) ; Columbia University(哥伦比亚大学)
专题命中 工具调用 :tool-use(abstract);agentic(abstract);分类 cs.LG
AI总结 研究发现大型语言模型的置信度与行为不一致,静态校准无法预测动态设置中的表现。
安全关键型LLM助手中的Agent2Agent威胁:以人为中心的分类
机构 * BMW Group Research(宝马集团研究) ; Technical University Munich(慕尼黑技术大学)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出AgentHeLLM框架,通过分离资产识别与攻击路径分析,为安全关键型LLM助手提供以人为中心的威胁建模方法。
不要轻信你所读到的:在误导性工具描述下理解和测量MCP行为
机构 * School of Computer Science and Technology(计算机科学与技术学院)
专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究揭示MCP协议中描述与代码不一致的问题,发现13%的服务器存在潜在安全风险,强调需加强透明度和审计
在无需人类知识的情况下学习可证明正确的分布式协议
机构 * The Ohio State University(俄亥俄州立大学) ; University of Florida(佛罗里达大学)
专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 GGMS框架通过结合蒙特卡洛树搜索、变压器编码器和模型检查器反馈,实现了无需人类知识的正确分布式协议学习。
$G^2$-Reader: 双重演化图式用于多模态文档问答
机构 * Shanghai Jiao Tong University(上海交通大学) ; Intelligent Game and Decision Laboratory(智能游戏与决策实验室)
专题命中 工具调用 :planning(abstract);agentic(abstract);分类 cs.CL
AI总结 $G^2$-Reader通过双重图式解决多模态文档问答中的结构破坏和检索失效问题,实现66.21%的高准确率。
我应该何时搜索更多:基于强化学习的自适应复杂查询优化
机构 * Tencent Youtu Lab(腾讯云图实验室) ; The University of Hong Kong(香港大学) ; Nanyang Technological University(南洋理工大学)
专题命中 工具调用 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出自适应复杂查询优化框架ACQO,通过强化学习解决复杂查询优化中的子查询数量确定、文档排序与合并问题,实现更稳定高效的查询处理。
Comments 16 pages, 7 figures
Doc2AHP: 通过语义树利用LLMs推断结构化的多准则决策模型
机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室)
专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 Doc2AHP通过结合AHP原理和LLMs,实现结构化多准则决策模型的高效推断,提升决策模型的逻辑完整性和准确性。
Mxplainer: 通过模仿麻将代理解释和学习洞察
机构 * Peking University, Beijing 100871, China(北京大学)
专题命中 工具调用 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 Mxplainer通过模仿麻将代理,利用参数化搜索算法学习并解释黑箱代理的决策过程,提升动作预测准确率和可解释性。
Comments https://doi.org/10.3390/a18120738
Journal ref Algorithms 2025, 18(12), 738