arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-10 至 2025-12-10 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 4 篇

2512.08233 2025-12-10 cs.RO 82%

Semantic-Metric Bayesian Risk Fields: Learning Robot Safety from Human Videos with a VLM Prior

语义-度量贝叶斯风险场:从人类视频中学习机器人安全性的方法

Timothy Chen, Marcus Dominguez-Kuhne, Aiden Swann, Xu Liu, Mac Schwager

机构 * Stanford University(斯坦福大学) California Institute of Technology(加州理工学院)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract)

AI总结 本文提出基于贝叶斯框架的语义-度量风险场,通过人类视频学习机器人安全风险模型,实现类人风险评估与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23856 2025-12-10 cs.CL cs.AI cs.HC cs.LG 62%

OMNIGUARD: An Efficient Approach for AI Safety Moderation Across Languages and Modalities

OMNIGUARD:一种跨语言和模态的高效AI安全审查方法

Sahil Verma, Keegan Hines, Jeff Bilmes, Charlotte Siska, Luke Zettlemoyer, Hila Gonen, Chandan Singh

机构 * University of Washington(华盛顿大学) Microsoft(微软公司)

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.AI、cs.LG

AI总结 Omniguard提出了一种跨语言和模态的高效方法,通过构建语言或模态无关的分类器提升有害提示检测的准确率,并在多语言、图像和音频提示任务中取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07497 2025-12-10 cs.AI cs.SE 57%

How Do LLMs Fail In Agentic Scenarios? A Qualitative Analysis of Success and Failure Scenarios of Various LLMs in Agentic Simulations

大型语言模型在代理场景中为何失败?对各种LLM在代理模拟中成功与失败场景的定性分析

JV Roig

机构 * Kamiwaza AI

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 研究分析了LLM在代理任务中的失败原因,发现模型规模不决定鲁棒性,强调训练和设计对可靠性的重要性。

Comments 48 pages, 3 tables, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08653 2025-12-10 cs.RO 50%

A Sensor-Aware Phenomenological Framework for Lidar Degradation Simulation and SLAM Robustness Evaluation

一种面向传感器的现象学框架用于激光雷达退化仿真和SLAM鲁棒性评估

Doumegna Mawuto Koudjo Felix, Xianjia Yu, Zhuo Zou, Tomi Westerlund

机构 * Turku Intelligent Embedded and Robotic Systems (TIERS) Lab , University of Turku(图尔库智能嵌入与机器人系统实验室,图尔库大学) School of Information Science and Technology, Fudan University(信息科学与技术学院,复旦大学)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出一种面向传感器的现象学框架,用于模拟激光雷达退化并评估SLAM系统的鲁棒性,通过保留点云结构并应用多种退化方法,实现可控的仿真测试。

详情

展开后加载摘要…

URL PDF HTML 收藏