A Fourier-enhanced multi-modal 3D small object optical mark recognition and positioning method for percutaneous abdominal puncture surgical navigation
专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI
Comments 19 pages, 6 figures,
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI
Comments 19 pages, 6 figures,
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI
Comments 14 pages
专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI
专题命中 多模态评测 :image-text(title);分类 cs.CV、cs.CL
Comments NeurIPS Datasets and Benchmarks 2023. Data and code available at https://github.com/oxai/visogender
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI
专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI
Comments 2022 Fourth International Conference on Transdisciplinary AI (TransAI)
Journal ref Fourth International Conference on Transdisciplinary AI (TransAI), Laguna Hills, CA, USA, 2022, pp. 79-82
专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI
Comments 7 pages, Accepted at IEEE-IV 2023
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL
专题命中 多模态评测 :multi-modal(title);分类 cs.CL、cs.AI
Comments Accepted by AAAI 2023 (Student Abstract). Dataset available in https://zjunlp.github.io/project/ProteinKG65/
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL
Comments EMNLP 2022
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI
Comments Submitted to ICRA2023
专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.CL
Comments CIKM2022 camera ready version
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL
Comments Accepted to LREC 2022
Journal ref Proceedings of the 13th Conference on Language Resources and Evaluation (LREC 2022), pages 6829-6836
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL
Comments Computer Vision and Image Understanding (CVIU)
专题命中 多模态评测 :multi-modal(title);分类 cs.CL、cs.AI
Comments Proceedings of the 25th International Conference on Pattern Recognition (ICPR 2020)
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.MM
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI
专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.AI
Comments submitted to IEEE International Symposium on Safety, Security, and Rescue Robotics (SSRR)
专题命中 多模态评测 :multimodal(title);分类 cs.AI、cs.MM
专题命中 多模态评测 :multi-modal(title);分类 cs.CV、cs.CL
Comments Proceedings of the International Workshop on Semantic Evaluation (SemEval)
专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL
Comments In ACL 2019 BlackboxNLP workshop
专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI
OmniPath: 用于审计轮椅可达性的多模态智能体框架
机构 * Causal AI Lab, Department of Information Systems, University of Maryland Baltimore County(因果AI实验室,信息系统系,马里兰大学巴尔的摩分校) ; Department of Computer Science & Software Engineering, Miami University(计算机科学与软件工程系,迈阿密大学)
专题命中 多模态评测 :multi-modal(title,comments);分类 cs.AI
AI总结 提出OmniPath框架,融合OSM网络拓扑与机载LiDAR数据,通过虚拟遍历量化坡度、横坡等物理摩擦点,按ADA标准分级评估轮椅可达性,经实地验证有效识别标准地图遗漏的障碍。
Comments 10 pages, 13 figures. Submitted to IEEE COMPSAC 2026. OmniPath: A Multi-Modal Agentic Framework for Auditing Wheelchair Accessibility
专题命中 多模态评测 :multi-modal(title,comments);分类 cs.CL
Comments NAACL 2024, dataset at https://github.com/amazon-science/m3t-multi-modal-translation-bench
缓解生成式人工智能(GenAI)驱动的证据污染以检测脱离上下文的虚假信息
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 该研究针对GenAI污染证据削弱OOC多模态虚假信息检测的问题,提出跨模态证据重排序与声明-证据推理策略,在基准数据集上验证了其对现有检测器鲁棒性的提升效果。
Comments 15 pages, 11 figures
MCBench:面向全能大语言模型的多上下文安全评估基准
机构 * Monash University(墨尔本大学) ; Defence Science and Technology Group(国防科学与技术集团)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS
AI总结 针对现有多模态安全基准仅处理视觉输入的局限,提出MCBench基准,包含1196个跨四类安全场景的测试,要求整合多模态信息进行安全评估,揭示当前全能大语言模型在跨模态安全推理上的不足。
LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准
机构 * The University of Hong Kong(香港大学)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。
从失败中学习:计算机使用代理的推理时自我改进
机构 * Stanford University(斯坦福大学) ; Tsinghua University(清华大学)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 提出失败驱动的自我改进循环,利用LLM诊断失败模式并生成代码补丁,在OSWorld基准上将OpenCUA-72B模型成功率从42.3%提升至48.9%,无需额外训练成本。
Comments Published in ECCV 2026
当提示误导:多模态大语言模型中的文本主导与诊断偏差
专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract)
AI总结 研究揭示在医学多模态大语言模型中,文本提示会主导视觉线索,导致诊断偏差,即使模型具备空间定位能力,提示策略仍可能不安全。
Comments Accepted to the CVPR 2026 MMFM-BIOMED Workshop