arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-27 至 2026-08-27 共收录 84 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 12 篇

2511.05393 2026-08-27 cs.CV 版本更新 57%

PreResQ-R1: Response-Preference Disentangled Ranking-and-Scoring Reinforcement Optimization for Robust Visual Quality Assessment

PreResQ-R1:用于鲁棒视觉质量评估的响应偏好解耦排序与评分强化优化

Zehui Feng, Weichuan Wang, Xiaohan Chen, Ting Han

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PreResQ-R1框架,通过解耦响应偏好的强化学习统一评分与排序目标,结合GRPO优化,在IQA和VQA基准上取得最优结果,推理轨迹更贴合人类感知。

Comments 27 pages, 16 figures, Accepted as EMNLP 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25625 2026-08-27 cs.IR 新提交 50%

RetrievalRouter: Joint Modality and Architecture Selection for Document Retrieval

RetrievalRouter:面向文档检索的联合模态与架构选择

Emre Kuru, Mehmet Onur Keskin, Reza Farahbakhsh, Noel Crespi

专题命中 跨模态检索 :multimodal(abstract)

AI总结 RetrievalRouter是一种轻量级查询感知路由模型,仅从查询文本为每个文档检索任务匹配合适流程,在金融、科学语料库基准测试中,其准确率较最佳静态基准高2.5%、速度快12.4倍,且优于现有自适应策略选择方法。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 8 篇

2510.20803 2026-08-27 cs.CV 版本更新 84%

ARGenSeg: Image Segmentation with Autoregressive Image Generation Model

ARGenSeg:基于自回归图像生成模型的图像分割

Xiaolong Wang, Lixiang Ru, Ziyuan Huang, Kaixiang Ji, Dandan Zheng, Jingdong Chen, Jun Zhou

机构 * Ant Group(蚂蚁集团)

专题命中 多模态生成 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 该研究提出ARGenSeg框架,将图像生成融入MLLM,通过并行生成视觉令牌实现高效图像分割,在多数据集上性能优于现有方法且推理速度显著提升。

Comments Accepted to NeurIPS 2025, 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25855 2026-08-27 cs.CE cs.AI 新提交 79%

Unlocking Multimodal Protein Language Models at Inference Time

在推理阶段解锁多模态蛋白质语言模型

Yi Zhou, Qipeng Wang, Yunqing Liu, Jun Xia, Qing Li, Wenqi Fan

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文建立三阶段研究框架,在不更新多模态蛋白质语言模型参数的前提下,通过优化推理阶段采样策略,揭示默认推理协议的次优性并提升其任务性能,得出与现有共识不同的基础模型相关结论。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21450 2026-08-27 cs.CE q-bio.BM 版本更新 71%

CMADiff: Cross-Modal Aligned Diffusion for Controllable Protein Generation

CMADiff: 用于可控蛋白质生成的跨模态对齐扩散

Changjian Zhou, Yuexi Qiu, Jiafeng Li, Jia Song, Wensheng Xiang

专题命中 多模态生成 :cross-modal(title)

AI总结 提出CMADiff框架,通过条件变分自编码器整合理化特征,并利用对比学习模块BioAligner对齐文本描述与蛋白质特征,实现基于文本驱动的可控蛋白质序列生成。

Comments Further improvement is needed in the content

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25138 2026-08-27 cs.LG cs.AI 新提交 57%

Drift Variation Autoencoder: Unifying Generation and Representation Learning through Conditional Posterior Flow Matching

漂移变分自编码器:通过条件后验流匹配统一生成与表示学习

Jiarui Cao

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出漂移变分自编码器,通过条件后验流匹配统一生成与表示学习,在CrossGeom-4基准上实现了高表示精度与模态一致性,完成多模态概念验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18227 2026-08-27 cs.CV 版本更新 57%

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成及模态模仿

Dingyun Zhang, Lixue Gong, Wei Liu

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 研究探索在单一模型中整合视频和图像模态的生成与编辑能力,开发像素对时间扭曲流场实时生成视频编辑样本,设计模态模仿损失对齐模态能力,引入相关任务及损失让模型内化基于语言的视觉编辑能力。

Comments Due to file size constraints, the figures in the arXiv file have been heavily lossy-compressed. Please visit the uncompressed file at: this https URL (https://huggingface.co/datasets/FlowMimic/Uncompressed/blob/main/main.pdf)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10918 2026-08-27 cs.AI 版本更新 57%

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

CSPO:缓解结构化表格到LaTeX生成中的奖励模糊性

Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出CSPO框架,通过分离LaTeX表格组件的优化,缓解奖励模糊性,提升结构化生成的可靠性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26076 2026-08-27 cs.RO 新提交 50%

Fast Generative Grasping via Lie Group-Constrained MeanFlow

基于李群约束MeanFlow的快速生成式抓取

S. Talha Bukhari, Yi Wei, Ruiqi Ni, Zachary Kingston, Aniket Bera

机构 * Purdue University(普渡大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 该研究提出基于李群约束MeanFlow的快速生成式抓取方法,可在≤5次网络评估内采样可靠抓取,在ACRONYM数据集上性能与SOTA模型相当,推理延迟达毫秒级,且无需额外训练即可迁移到真实机器人抓取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04235 2026-08-27 cs.ET 版本更新 50%

Scale-CDA: A Scalable Aftermarket Platform to Democratize Cooperative Driving Automation in Production Cars

Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)

Hao Zhou, Shengming Yuan, Yuhang Wang, Alina Hagen, Haibin Wen

专题命中 多模态生成 :MLLM(abstract_cn)

AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 18 篇

2608.24934 2026-08-27 cs.CV cs.AI 新提交 89%

Fusing Perceptual Vision Experts with Multimodal Large Language Models for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation

融合感知视觉专家与多模态大语言模型的可解释植物病害诊断:从基准图像到真实世界机器人现场验证

Ranjan Sapkota, Konstantinos I. Roumeliotis, Pengyao Xie, Nikolaos D. Tselikas, Lirong Xiang, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(伯罗奔尼撒大学) Agricultural University of Athens(雅典农业大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究提出H²MAF框架,结合EfficientNet-B3、ConvNeXt-Tiny与Gemma、Qwen等MLLM,在PlantDoc及Cornell机器人田间数据集上实现高准确率可解释植物病害诊断,验证了MLLM仲裁的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03890 2026-08-27 cs.CV 版本更新 87%

OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

OVO-S-Bench:多模态大语言模型中流式空间智能的分层基准

Yifei Li, Pengyiang Liu, Yuhang Zang, Zhongyue Shi, Qi Fu, Hongye Hao, Jiwen Lu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 提出OVO-S-Bench,一个完全人工标注的流式空间智能基准,包含1680个问题,涵盖四个抽象层次,评估38个MLLM,发现Gemini-3.1-Pro落后人类专家27分,流式空间微调MLLM表现不如其骨干模型。

Comments Accepted to EMNLP 2026 Main Conference. 55 pages, 12 figures, 20 tables. Project page: this https URL (https://internlm.github.io/OVO-S-Bench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25490 2026-08-27 cs.CR cs.AI cs.MM 新提交 84%

MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities

MMJailBench:用于解耦多模态越狱漏洞的因子化基准

Tianshi Wang, Jingsong Wang, Yafei Huang, Fengling Li, Xin Li, Lei Zhu

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 研究人员推出MMJailBench因子化基准,对16个MLLMs评估后揭示其越狱漏洞特征异质且依赖模型,明确提示框架等关键影响因素,开发出模块化多模态越狱评估套件用于高效审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25520 2026-08-27 cs.CV 新提交 83%

Asymmetric Cross-Modal Fine-Grained Visual Categorization: ACF-Net and the BirdPro Benchmark

非对称跨模态细粒度视觉分类:ACF-Net与BirdPro基准

Bohan Deng, Shuo Ye, Zitong Yu

机构 * Great Bay University(大湾区大学)

专题命中 多模态评测 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 针对非对称跨模态细粒度视觉分类的挑战,提出ACF-Net框架并构建BirdPro基准,实验显示其在融合与不匹配设置中均优于基线方法。

Comments Accepted by the 9th Chinese Conference on Pattern Recognition and Computer Vision (PRCV 2026). 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25367 2026-08-27 cs.CV 新提交 83%

RSFusionDet: Underwater RGB-Sonar Multimodal Object Detection

RSFusionDet:水下RGB-声呐多模态目标检测

Zhuoyan Liu, Yihan Wang, Bo Wang, Bing Wang, Ye Li

机构 * Harbin Engineering University(哈尔滨工程大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对水下单模态目标检测的传感器成像缺陷,本文构建RSFusion数据集并提出RSFusionDet模型,通过CAFusion模块与OMHead、OMLoss实现跨模态特征融合与目标匹配,在RSFusion数据集上性能优于基线模型DINO。

Comments 18 pages, 13 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22084 2026-08-27 cs.CV 版本更新 83%

MObyGaze: a film dataset of multimodal objectification densely annotated by experts

MObyGaze:由专家密集标注的多模态客体化电影数据集

Julie Tores, Elisa Ancarani, Lucile Sassatelli, Hui-Yin Wu, Clement Bergman, Lea Andolfi, Victor Ecrement, Remy Sun, Frederic Precioso, Thierry Devars, Magali Guaresi, Virginie Julliard, Sarah Lecossais

机构 * Université Côte d’Azur, CNRS, I3S, France(法国里沃利大学、法国国家科学研究中心、I3S研究所) Université Côte d’Azur, CNRS, Inria, I3S, France(法国里沃利大学、法国国家科学研究中心、法国国家科学研究院、I3S研究所) Institut Universitaire de France(法国大学研究院) Université Côte d’Azur, Inria, France(法国里沃利大学、法国国家科学研究院、法国) Université Côte d’Azur, CNRS, BCL, France(法国里沃利大学、法国国家科学研究中心、BCL研究所) Sorbonne Université, GRIPIC(索邦大学、GRIPIC研究所) Université Sorbonne Paris Nord, LabSIC(巴黎-索邦大学北校区、LabSIC研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究引入新AI任务以量化电影中多模态客体化模式,构建含20部电影的MObyGaze数据集并完成标注,通过基准测试证明任务可行性,公开代码与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25097 2026-08-27 cs.AI cs.MM math-ph 新提交 82%

PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems?

PhysElite:大型语言模型在解决奥林匹克级物理问题上的表现差距有多大?

Ruoran Xu, Wending Gao, Liyunfeng Chen, Aixin Shi, Haoyu Cheng, Zixiang Fang, Yiqiang Zou, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出PhysElite基准,含11586道奥林匹克级物理题及配套资源,测试18款MLLM发现最强者准确率仅33.7%,还开展分步流程评估诊断推理失败环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25973 2026-08-27 cs.AI cs.LG 新提交 79%

SciMIF: Understanding Multimodal Instruction Following in Scientific Domains

SciMIF:理解科学领域中的多模态指令遵循

Ye Shen, Yuting Zheng, Dun Pei, Zijian Chen, Wenlong Zhang, Qi Jia, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出用于评估多模态大语言模型科学指令遵循能力的SciMIF基准,揭示模型在科学领域性能差异及规模提升未对应改善约束遵循等问题,填补相关评估空白。

Comments 21pages, 9 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25398 2026-08-27 cs.CL 新提交 79%

OmniPhys: A Unified Multimodal Benchmark for Physics Understanding and Generation from Chinese Educational Corpora

OmniPhys:面向中文教育语料库的物理理解与生成统一多模态基准

Hao Chen, Yumin Lin, Nadila Yushanjiang, Xin Lin, Min Zhang

机构 * East China Normal University(华东师范大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 研究人员推出OmniPhys这一覆盖中文教育语料库中中学至大学物理问题的大规模多模态基准,含15246个问题与19850张图像,可评估MLLMs的物理理解、推理及结构化图表生成能力,发现当前模型存在复杂推理与视觉生成差距,将推进物理领域多模态智能发展。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24910 2026-08-27 cs.HC cs.AI 新提交 79%

From Plots to Words: Model-Aware Multimodal Explanations as a Foundation for Accessible, Non-Visual Interaction

从图表到文本:模型感知的多模态解释作为可访问非视觉交互的基础

Nur Keleşoğlu, Łukasz Sobczak, Joanna Domańska

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究提出多智能体框架,将时间序列预测的视觉输出转为模型感知文本解释,可提升非视觉交互的可访问性,其可解释配置使解释质量最高提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07445 2026-08-27 cs.AI 版本更新 79%

StarDojo: Benchmarking Open-Ended Behaviors of Agentic Multimodal LLMs in Production-Living Simulations with Stardew Valley

StarDojo:基于Stardew Valley的多模态大语言模型在生产-生活模拟中的开放性行为基准测试

Weihao Tan, Changjiu Jiang, Yu Duan, Mingcong Lei, Jiageng Li, Yitian Hong, Xinrun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China University of Science and Technology(华东理工大学) Singapore Management University(新加坡管理大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 StarDojo通过Stardew Valley模拟评估多模态大语言模型在生产与社交活动中的综合能力,包含1000个任务,发现GPT-4.1在视觉理解与多模态推理方面存在显著不足。

Comments Accepted by ECCV 2026. Project website: this https URL (https://weihaotan.github.io/StarDojo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25316 2026-08-27 cs.HC 新提交 78%

AVI-Personality: A Trait-Activated Multimodal Dataset for Personality and Competency Assessment in Asynchronous Video Interviews

AVI-Personality:用于异步视频面试中人格与能力评估的特质激活多模态数据集

Tianyi Zhang, Jinwenxi Shang, Antonis Koutsoumpis, Yuan Zong, Reinout E. de Vries, Wenming Zheng

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出AVI-Personality数据集,包含646名参与者的3876段异步视频面试,经多维度验证,可用于开发评估人格与能力的AI模型,多模态方法性能最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25126 2026-08-27 cs.LG 新提交 78%

Multimodal Injury Risk Prediction in Tennis

网球中的多模态损伤风险预测

Francisco Erramuspe Alvarez, Shobharani Polasa, Weihao Qu, Jay Wang, Ling Zheng

机构 * Monmouth University(蒙茅斯大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出多模态网球运动员准备度预测框架PART,整合多源数据,可评估网球运动员健康、损伤风险等,在大学生网球运动员数据上表现良好,也适用于业余选手。

Comments 7 pages, 2 figures, 5 tables. Published in the 2025 IEEE 5th International Conference on Human-Machine Systems (ICHMS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24903 2026-08-27 cs.HC cs.LG 新提交 78%

Evidence-Grounded Mapping of Multimodal Human Sensing Psychological Transdiagnostic Dimensions

基于证据的多模态人体感知心理跨诊断维度映射

Xiyun Hu, Xiangyuan Xue, Yuting Lyu, Hanya Shao, Jingping Nie

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究提出临床医生参与的基准,评估LLMs能否从多模态证据生成B-HiTOP条目画像,发现两阶段预测可提升部分证据的兼容性,但语义抽象会成为间接行为传感的信息瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24931 2026-08-27 eess.IV cs.AI cs.CV cs.LG 新提交 62%

Modality Contribution Score - A Per-Patient Framework for Quantifying the Relative Diagnostic Contribution of Structural MRI and Amyloid PET in Alzheimer's Disease

模态贡献分数——一种用于量化阿尔茨海默病中结构MRI与淀粉样PET相对诊断贡献的患者专属框架

Dawa Chyophel Lepcha, Aaliya Ali, Sophie A. Martin, Deepika Koundal, Pierrick Coupe, Shabbir Syed-Abdul

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出患者专属框架MCNet与MCS,量化AD中结构MRI与淀粉样PET的相对诊断贡献,在ADNI-3与OASIS-3队列中验证了其分期性能、单调梯度及跨队列泛化性,为痴呆护理可信AI奠定基础。

Comments 15 pages, 7 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25981 2026-08-27 cs.CV cs.AI cs.LG 新提交 62%

FRAME: separating sampling variation from representational cause in medical imaging fairness

FRAME:在医学影像公平性中分离采样变异与表征成因

Mahshad Lotfinia, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡弗里德里希-亚历山大大学) RWTH Aachen University(亚琛工业大学) University Hospital RWTH Aachen(亚琛工业大学医院)

专题命中 多模态评测 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 FRAME是用于医学影像公平性审计的两步框架,可分离采样变异与表征成因,能解释部分性能差异,辅助区分需机制解释的差异与采样变异可解释的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01287 2026-08-27 cs.CV cs.AI 版本更新 62%

Beyond Visual Memory: Mechanistic Diagnostics of Latent Visual Reasoning

超越视觉记忆:潜在视觉推理的机制诊断

Jiawei Guo, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Shuai Dong, Feifei Zhai, Yu Zhou

机构 * Amap, Alibaba Group(阿里集团亚马通) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 通过分解潜在令牌为三个可测试组件,发现边界标记和格式而非潜在槽贡献了主要性能提升,揭示了潜在视觉推理的真正机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24940 2026-08-27 cs.LG cs.AI 新提交 57%

When Does Frequency Decomposition Benefit Physics-Informed Neural Networks? A Preliminary Ablation Study

频率分解何时有益于物理信息神经网络?一项初步消融研究

Shubham Rai

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出双分支频谱门控架构DBSG-PINN,通过消融实验发现频率分解仅在频谱复杂的物理信息神经网络基准问题上可显著降低误差,在平滑问题上益处有限。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态Agent 3 篇

2608.25417 2026-08-27 cs.AI 新提交 79%

Paint What You See: Benchmarking Dexterous Visual Tool Use in Multimodal Agents

绘制你所见:多模态智能体的灵巧视觉工具使用基准测试

Shudong Liu, Dongyang Chen, Enci Zhang, Jinwei Liang, Zheng Ma, Lewei Lu

机构 * Peking University(北京大学) Tsinghua University(清华大学) SenseTime Research(商汤科技研究院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出名为EASEL的基准测试,结合44万样本的EASEL-Data数据集与EASEL-9B模型,评估多模态智能体的灵巧视觉工具使用能力,发现现有25个模型在该任务上表现不佳,EASEL-9B相对基础模型提升6.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25198 2026-08-27 cs.AI 新提交 57%

Tunable Tool-Call Rates in LLM Agents via Representation Steering

通过表示调控实现LLM智能体中可调节的工具调用率

Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

机构 * UC Santa Cruz(圣克鲁兹加利福尼亚大学) UC Berkeley(加利福尼亚大学伯克利分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本研究提出通过调控LLM残差流的线性方向,可在推理时无需额外训练调节工具调用率,使开放域问答准确率近翻倍,且能泛化到多种模型与工具。

详情

展开后加载摘要…

URL PDF HTML 收藏