arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-27 至 2026-08-27 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 3 篇

2608.25417 2026-08-27 cs.AI 新提交 79%

Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents

绘制你所见:多模态智能体的灵巧视觉工具使用基准测试

Shudong Liu, Dongyang Chen, Enci Zhang, Jinwei Liang, Zheng Ma, Lewei Lu

机构 * Peking University(北京大学) Tsinghua University(清华大学) SenseTime Research(商汤科技研究院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出名为EASEL的基准测试,结合44万样本的EASEL-Data数据集与EASEL-9B模型,评估多模态智能体的灵巧视觉工具使用能力,发现现有25个模型在该任务上表现不佳,EASEL-9B相对基础模型提升6.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25198 2026-08-27 cs.AI 新提交 57%

Tunable Tool-Call Rates in LLM Agents via Representation Steering

通过表示调控实现LLM智能体中可调节的工具调用率

Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

机构 * UC Santa Cruz(圣克鲁兹加利福尼亚大学) UC Berkeley(加利福尼亚大学伯克利分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本研究提出通过调控LLM残差流的线性方向,可在推理时无需额外训练调节工具调用率,使开放域问答准确率近翻倍,且能泛化到多种模型与工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25039 2026-08-27 cs.AI 新提交 57%

LifePlanner: Evaluating LLM Agents for Geo-spatial Planning with Social Media Data

LifePlanner:利用社交媒体数据评估LLM智能体的地理空间规划能力

Zhen Dong, Yuning Peng, Yutao Shi, Lei Zhong, Yongsen Mao, Yuan Liu, Haiping Wang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 该研究推出LifePlanner基准测试,结合社交媒体数据评估LLM智能体的地理空间规划能力,发现前沿LLM在简单检索中表现好但复杂规划通过率仅40.2%,失败源于证据获取、工具使用及约束整合问题,需改进实际规划能力而非单纯扩大模型规模。

Comments 25 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏