EAA: Automating materials characterization with vision language model agents
EAA: 用视觉语言模型代理自动化材料表征
Ming Du, Yanqi Luo, Srutarshi Banerjee, Michael Wojcik, Jelena Popovic, Mathew J. Cherukara
机构
*
Argonne National Laboratory(阿贡国家实验室)
;
Advanced Photon Source(先进光子源)
;
Data Science and Learning Division(数据科学与学习 division)
;
Department of Radiation Oncology(放射肿瘤学系)
;
Northwestern University(西北大学)
On the Out-of-Distribution Generalization of Reasoning in Multimodal LLMs for Simple Visual Planning Tasks
在简单视觉规划任务中多模态大语言模型推理的分布外泛化
Yannic Neuhaus, Nicolas Flammarion, Matthias Hein, Francesco Croce
机构
*
Tübingen AI Center -- University of Tübingen(图宾根人工智能中心 -- 图宾根大学)
;
EPFL(瑞士联邦理工学院)
;
ELLIS Institute Finland -- Aalto University(芬兰ELLIS研究所 -- 阿尔托大学)
How Vision Becomes Language: A Layer-wise Information-Theoretic Analysis of Multimodal Reasoning
视觉如何转化为语言:多模态推理的逐层信息论分析
Hongxuan Wu, Yukun Zhang, Xueqing Zhou
机构
*
Duke kunshan University, Duke University(杜克昆山大学、杜克大学)
;
The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)
;
Fudan University, Shanghai, China(复旦大学)
EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use
EventMemAgent: 基于分层事件中心记忆的在线视频理解与自适应工具使用
Siwei Wen, Zhangcheng Wang, Xingjian Zhang, Lei Huang, Wenjun Wu
机构
*
Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学)
;
Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学)
;
Paradigm Inc.(4Paradigm公司)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV