M^3-Bench: Multi-Modal, Multi-Hop, Multi-Threaded Tool-Using MLLM Agent Benchmark
M^3-Bench: 多模态、多跳、多线程工具使用 MLLM agent 评估基准
机构 * Rutgers University(新泽西罗格斯大学)
专题命中 多模态Agent :multi-modal(title);MLLM(title);multimodal(abstract);分类 cs.AI
AI总结 M^3-Bench是首个评估多模态工具使用下模型上下文协议的基准,通过多跳、多线程工作流和可追溯的一对一对应关系,揭示了多模态大语言模型在论点保真度和结构一致性方面的持续差距。