PhyCritic: Multimodal Critic Models for Physical AI
PhyCritic:面向物理AI的多模态批评模型
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 PhyCritic通过双阶段RLVR流程优化,提升物理AI任务中的感知和推理能力,实现对物理任务的高效评估和改进。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
PhyCritic:面向物理AI的多模态批评模型
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 PhyCritic通过双阶段RLVR流程优化,提升物理AI任务中的感知和推理能力,实现对物理任务的高效评估和改进。
多模态制造安全聊天机器人:知识库设计、基准开发及多种RAG方法的评估
机构 * Farmer School of Business, Miami University(Miami大学农业商学院) ; Department of Computer Science and Software Engineering, Miami University(Miami大学计算机科学与软件工程系) ; Department of Engineering Technology, Miami University(Miami大学工程技术系) ; Department of Mechanical and Manufacturing Engineering, Miami University(Miami大学机械与制造工程系) ; Department of Industrial and Systems Engineering, University at Buffalo(University at Buffalo工业与系统工程系)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出了一种多模态制造安全聊天机器人,通过RAG方法实现高准确率、低延迟和低成本的安全培训,展示了其在工业5.0环境中的应用价值。
Comments 25 pages, 5 figures
PhysUniBench: 一个面向本科生层面的多模态物理推理基准测试
机构 * The University of Sydney(悉尼大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学) ; Michigan State University(密歇根州立大学) ; Tsinghua University(清华大学) ; Beihang University(北航大学)
专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.AI
AI总结 PhysUniBench是一个面向本科生层面的多模态物理推理基准测试,旨在评估和提升多模态大语言模型在物理问题上的推理能力。
多模态无线:一种大规模数据集用于传感与通信
专题命中 多模态评测 :multimodal(title,abstract)
AI总结 本文提出多模态无线数据集,用于多模态传感与通信研究,包含高分辨率CSI与多种传感器数据,支持通信与协同感知应用。
秩序从混沌:从 glitchy 游戏视频中理解物理世界
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Peking University(北京大学) ; University of Toronto(多伦多大学) ; Sun Yat-sen University(孙中山大学)
专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
AI总结 本文提出 PhysGame 数据集和 GameBench 基准,通过利用游戏视频中的 glitch 异常,提升物理推理能力,实验显示在多个基准上取得显著提升。
Comments Accepted by TMLR
城市真实环境中的导航:探索从大规模知识中涌现的导航
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出稀疏关联视觉导航任务,通过CityNav基准评估MLLMs在真实城市环境中的导航能力,并提出VoP方法提升导航性能。
Comments Accepted at EACL 2026 (ORAL)
GENIUS:生成性流体智能评估套件
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 GENIUS通过评估生成性流体智能,揭示模型在动态推理和上下文适应上的不足,并提出无需训练的注意力干预策略。
TwiFF (Think With Future Frames): 一个大规模动态视觉推理数据集
机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院) ; School of Computer and Computing Science, Hangzhou City University, Hangzhou, China(杭州市城市大学计算机与计算科学学院) ; Henan Academy of Innovations in Medical Science (AIMS), Zhengzhou, China(河南省医学创新研究院) ; School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 TwiFF提出一个大规模动态视觉推理数据集及模型,通过整合视频生成与图像理解能力,提升动态场景下的视觉问答性能。
Comments preprint
MetaphorStar: 基于端到端视觉强化学习的图像隐喻理解与推理
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Huazhong University of Science and Technology(华中科技大学) ; The Chinese University of Hong Kong MMLab(香港中文大学MMLab)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 MetaphorStar通过端到端视觉强化学习框架提升图像隐喻理解与推理能力,显著优于现有模型。
Comments 14 pages, 4 figures, 11 tables; Code: https://github.com/MING-ZCH/MetaphorStar, Model & Dataset: https://huggingface.co/collections/MING-ZCH/metaphorstar
MITI:腹腔手术的SLAM基准测试
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 MITI基准测试提供了一套用于评估微创手术中SLAM算法性能的高质量数据集,包含多模态传感器信息和校准数据,旨在推动视觉-惯性算法的发展。
Comments This submission is withdrawn because it is a duplicate of "Constrained Visual-Inertial Localization With Application And Benchmark in Laparoscopic Surgery" (arXiv:2202.11075). The withdrawn version contains less complete information. Readers are directed to the full version
MapVerse:一个用于在多样化真实世界地图上进行地理问答的基准测试
机构 * University of Southern California(南加州大学) ; University of California Los Angeles(加州大学洛杉矶分校) ; University of Utah(犹他大学) ; Arizona State University(亚利桑那州立大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 MapVerse是一个基于真实世界地图的大规模基准测试,用于评估地理问答任务中的多模态推理能力,揭示了当前VLMs在复杂空间推理任务上的不足。
VeriSciQA:一个用于科学视觉问答的自动验证数据集
机构 * Sun Yat-sen University(中山大学) ; Alibaba Group(阿里巴巴集团)
专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV
AI总结 VeriSciQA通过跨模态验证框架生成并验证高质量科学视觉问答数据集,显著提升开源模型在科学图表问答任务上的表现。
绘制你的程序:探索视觉提示与生成式AI在教学与评估中的应用
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文探讨利用视觉提示与生成式AI在编程教学与评估中的应用,通过学生构建的分解图提示GPT-4.1生成代码,展示多模态提示在编程教育中的潜力。
迈向低成本、非侵入式实时低血糖检测的可穿戴传感器信号
机构 * Department of Computer Science, Old Dominion University, Norfolk, VA, USA(计算机科学系,旧 Dominion 大学) ; Virginia Digital Maritime Center (VDMC), Old Dominion University, Norfolk, VA, USA(弗吉尼亚数字水路中心(VDMC),旧 Dominion 大学)
专题命中 多模态评测 :multimodal(abstract)
AI总结 本研究提出了一种多模态深度学习方法,利用可穿戴传感器信号实现低成本、非侵入式实时低血糖检测,通过融合皮肤电反应和心率信号提升检测性能。
见、计划、快照:评估Scratch中的多模态GUI代理
机构 * Tongji University(同济大学) ; East China Normal University(华东师范大学)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出ScratchWorld基准,用于评估多模态GUI代理在Scratch中的程序构建能力,揭示了推理与执行之间的显著差距。
分割、调和、然后征服:利用多模态语言模型解决多商品流问题
机构 * Zhejiang University(浙江大学) ; Hefei University of Technology(合肥工业大学) ; Co-corresponding authors(共同通讯作者)
专题命中 多模态Agent :multimodal(title,abstract)
AI总结 Pram利用多模态语言模型解决多商品流问题,通过分解和调和子问题实现高效优化,性能接近线性规划求解器且运行时间显著降低。
Comments Published as a conference paper at ICLR 2026
生成性肌肉刺激:通过将多模态AI与具身知识相结合,为用户提供物理帮助
专题命中 多模态Agent :multimodal(title)
AI总结 本研究提出通过结合多模态AI与具身知识生成肌肉刺激指令,实现更通用的物理辅助系统。
Comments 22 pages, 29 figures
Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26)
TableDART: 表格理解的动态自适应多模态路由
机构 * The University of Queensland, Australia(昆士兰大学) ; Griffith University, Australia(格里菲斯大学) ; University of Notre Dame, USA(诺丁汉大学)
专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);MLLM(abstract);cross-modal(abstract)
AI总结 TableDART通过动态选择文本、图像或融合视角,提升表格理解的准确性和效率,避免昂贵的多模态模型微调。
Comments Accepted to ICLR 2026. 26 pages, 11 figures
多模态信息融合用于图表理解:MLLMs的综述——演变、局限与认知增强
机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) ; Engineering Research Center of Machine Learning(机器学习工程研究中心) ; China Telecom Institute of AI(中国电信人工智能研究院)
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文综述了多模态大语言模型在图表理解中的应用,分析了其演变、局限及未来发展方向,旨在推动更稳健的系统发展。
正交解缠与投影特征对齐用于对话中多模态情绪识别
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM
AI总结 本文提出OD-PFA框架,通过正交解缠与投影特征对齐技术提升对话中多模态情绪识别性能。
Comments 5 pages, 1 figure
GaussianCross: 通过高斯点撒技术实现跨模态自监督3D表示学习
机构 * Hong Kong Polytechnic University(香港理工大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 GaussianCross通过高斯点撒技术实现跨模态自监督3D表示学习,提升3D点云的表示质量和泛化能力。
Comments 14 pages, 8 figures, accepted by MM'25
跨模态冲突下的全方位安全:漏洞、动态机制和高效对齐
机构 * Nanyang Technological University(南洋理工大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Renmin University of China(中国人民大学)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CL、cs.AI
AI总结 本文提出OmniSteer方法,通过提取黄金拒绝向量和轻量级适配器提升多模态模型的安全性与通用能力。
CoRe3D:协作推理作为3D智能的基础
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 CoRe3D通过协作推理框架实现3D内容生成,结合语义和空间推理提升3D输出的一致性与描述一致性。
大语言模型的进展:聚焦推理、适应性、效率和伦理
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CL
AI总结 本文综述了大语言模型在推理、适应性、效率和伦理方面的进展,探讨了关键技术和挑战,提出未来研究方向。
地理空间表示学习:从深度学习到大语言模型时代的一次综述
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; The University of New South Wales(新南威尔士大学) ; Southwest Jiaotong University(西南交通大学) ; Institute for Infocomm Research (I$^2$R), A*STAR(信息通信研究院(I$^2$R),A*STAR)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文综述了从深度学习到大语言模型时代的地理空间表示学习,探讨了其方法、应用及未来发展方向。
SynergyKGC: 通过拓扑感知协同解决知识图谱补全中的拓扑异质性
机构 * School of Future Science and Engineering, Soochow University(未来科学与工程学院,苏州大学) ; School of Mathematical Sciences, Soochow University(数学科学学院,苏州大学)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI
AI总结 SynergyKGC通过拓扑感知协同解决知识图谱补全中的拓扑异质性问题,提升KGC命中率。
Comments 10 pages, 5 tables, 7 figures. This work introduces the Active Synergy mechanism and Identity Anchoring for Knowledge Graph Completion. Code: https://github.com/XuechengZou-2001/SynergyKGC-main
强化课程预对齐用于领域自适应视觉-语言模型
机构 * Tencent(腾讯)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 本文提出RCPA方法,通过课程意识的渐进调节机制,在领域自适应中平衡领域知识获取与通用能力保持。
Canvas-of-Thought:通过可变的结构化状态进行推理
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Peking University(北京大学) ; New York University(纽约大学) ; Westlake University(西湖大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL
AI总结 Canvas-CoT通过引入HTML Canvas实现可变结构化状态,提升多模态推理效率与精度。
DiCo: 用于文本到图像人物重识别的解耦概念表示
机构 * organization= Department of Imaging Science, Graduate School of Advanced Imaging Science, Multimedia \& Film, Chung-Ang University , addressline= , city= Seoul , postcode= 06974 , state= , country= South Korea ; organization= Department of Metaverse Convergence, Graduate School of Advanced Imaging Science, Multimedia \& Film, Chung-Ang University , addressline= , city= Seoul , postcode= 06974 , state= , country= South Korea
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 DiCo通过解耦概念表示方法,提升文本到图像人物重识别的跨模态对齐和可解释性。
从像素到图像:深度学习在遥感图像语义分割中的结构调查
机构 * College of Science and Engineering and Centre for AI and Data Science Innovation, James Cook University(科学与工程学院和人工智能与数据科学创新中心,詹姆斯库克大学) ; Department of Forest and Wildlife Ecology, University of Wisconsin-Madison(森林与野生动物生态学系,威斯康星大学麦迪逊分校) ; School of Computing, Engineering and Mathematical Sciences, La Trobe University(计算、工程与数学科学学院,拉特罗布大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 本文系统回顾了深度学习在遥感图像语义分割中的结构演变,从像素到图像的层次化方法,涵盖多种技术并提供可复现的代码库。
Comments 34 pages, 9 figures, 5 tables