arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 242 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 242 篇

2606.15139 2026-06-16 cs.GT cs.RO 新提交 50%

Self-Driving Negotiator: An interactive, verifiable benchmark for social negotiation and theory of mind under hidden intent

自动驾驶谈判者:一个在隐藏意图下进行社会谈判和心理理论的交互式可验证基准

Ashutosh Kumar

机构 * Owl Autonomous Imaging, Inc(Owl 自动成像公司)

专题命中 视觉问答 :visual question answering(abstract)

AI总结 提出一个文本多轮程序化生成环境,用于衡量自动驾驶中基于隐藏意图推断的隐式社会协调能力,通过特权模拟器状态计算奖励和诊断,当前最佳模型平均成功率仅0.68。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11212 2026-06-11 cs.CL 新提交 50%

EverydayGPT: Confidence-Gated Routing for Efficient and Safe Hybrid GPT-RAG Conversational QA

EverydayGPT: 用于高效安全混合GPT-RAG对话问答的置信门控路由

Jaspreet Singh Nahal

机构 * Dr. A.P.J. Abdul Kalam Technical University(阿卜杜尔·卡拉姆技术大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 提出置信门控路由机制,通过联合策略决定检索与生成路径,使85%的查询使用快速RAG提取,延迟降低120倍以上,同时保持答案质量。

Comments 12 pages, 10 figures, 6 tables. Code and evaluation scripts available at: https://github.com/merciless-admiral-3083/EverydayGPT. This paper studies routing strategies for hybrid GPT-RAG systems under resource constraints, focusing on efficiency-safety tradeoffs rather than state-of-the-art accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏