arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19037 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19037 篇

2606.02459 2026-06-02 cs.CV 78%

Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models

像鸽子一样主动探索:通过智能视觉语言模型强化空间推理

Wei Deng, Xianlin Zhang, Mengshi Qi

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 提出一种受鸽子认知地图启发的智能视觉语言模型管道,通过动态认知地图和空间断言代码提供密集奖励信号,在MindCube基准上实现80.5%的总体准确率,在Rotation子集上相对提升53.2%。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00415 2026-06-02 astro-ph.GA astro-ph.IM 78%

Vision-Language Model Ensembles Achieve Human-Expert Accuracy for Galaxy Merger Classification

视觉-语言模型集成达到人类专家精度的星系合并分类

Marco Chiaberge, Elias Stengel-Eskin, Massimo Stiavelli, Colin Norman

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本研究通过贝叶斯统计框架集成15种视觉-语言模型配置,在星系合并形态分类中达到与训练有素的人类专家相当的准确率(83.3%),并恢复了合并分数。

Comments This work used LLMs as research assistants for code development, statistical analysis, and drafting under close human supervision; the workflow is described in Appendix A. Submitted to the Astronomical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30587 2026-06-01 cs.CV 78%

ReGuLaR: Relation-Grounded Latent Reasoning for Large Vision-Language Models

ReGuLaR:面向大型视觉语言模型的基于关系的潜在推理

Zihu Wang, Karthik Somayaji N. S, Peng Li

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 提出ReGuLaR框架,通过训练时的ReGFormer将潜在推理显式地锚定在视觉证据中的对象和关系上,在多种基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30506 2026-06-01 cs.RO cs.CV 78%

VLM-GLoc: Vision-Language Model Enhanced Monte Carlo Localization for Robust Semantic Global Localization in Cluttered Quasi-Static Environments

VLM-GLoc:视觉语言模型增强的蒙特卡洛定位,用于杂乱准静态环境中的鲁棒语义全局定位

Shivendra Agrawal, Bradley Hayes

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 提出VLM-GLoc方法,利用开放词汇视觉语言模型作为统一语义观测前端,通过逆语义提议机制和文本到地图检索,在几何模糊和语义歧义的准静态环境中实现鲁棒全局定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16940 2026-06-01 cs.CV cs.CR 78%

MultiPriv: Benchmarking Individual-Level Privacy Reasoning in Vision-Language Models

MultiPriv: 视觉语言模型中个体级隐私推理的基准测试

Xiongtao Sun, Hui Li, Jiaming Zhang, Yujie Yang, Kaili Liu, Ruxin Feng, Wen Jun Tan, Wei Yang Bryan Lim

机构 * Xidian University(西安电子科技大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 针对视觉语言模型通过层次化链式推理关联多模态数据识别个体的隐私风险,提出首个系统评估个体级隐私推理的基准MultiPriv,包含隐私感知与推理框架、双语多模态数据集和九项挑战任务,对50多个开源和商业模型评估发现60%的模型能以高达80%的准确率进行个体级隐私推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30307 2026-05-29 cs.CV 78%

Grounded 3D-Aware Spatial Vision-Language Modeling

基于三维感知的空间视觉语言建模

An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

机构 * UCSD(加州大学圣迭戈分校) MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 提出GR3D模型,通过显式2D定位、隐式2D定位和单目3D定位三种互补定位能力,在单一框架内实现空间链式推理,并在定位与非定位空间基准上取得一致提升。

Comments CVPR 2026 https://www.anjiecheng.me/gr3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29858 2026-05-29 cs.CV 78%

Masked Diffusion Vision-Language Models for Temporal Action Localization

用于时序动作定位的掩码扩散视觉语言模型

Fengshun Wang, Zhengbo Zhang, Zhigang Tu

机构 * Wuhan University(武汉大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 提出掩码扩散视觉语言模型(MDVLM)用于时序动作定位,通过双向注意力迭代去噪联合优化语义和边界,并引入边界感知掩码和步级IoU奖励解决训练不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29565 2026-05-29 cs.CV cs.RO 78%

From General Vision to Reliable Traversability Estimation: Adapting Vision Foundation Models for Unstructured Outdoor Environments

从通用视觉到可靠的可通行性估计:适应视觉基础模型用于非结构化户外环境

Ji-Hoon Hwang, Jisung Bae, Dong-Wook Kim, Yeonkyu Lee, Seung-Woo Seo

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 提出ViTA框架,通过可学习提示、视角多样化训练和几何知识蒸馏,将视觉基础模型适应于非结构化户外环境的可靠可通行性估计,显著降低误报并提升跨域泛化。

Comments 8 pages, 5figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27894 2026-05-28 cs.CV 78%

Towards Unified Vision-Language Models with Incomplete Multi-Modal Inputs

面向不完整多模态输入的统一视觉-语言模型

Xiang Fang, Wanlong Fang, Changshuo Wang, Keke Tang, Daizong Liu, Siyi Wang, Wei Ji

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) University College London(伦敦大学学院) Guangzhou University(广州大学) Wuhan University(武汉大学) Nanjing University(南京大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 针对视频-语言模型在传感器失效导致模态不完整数据下的训练-测试不一致问题,提出首个统一的不完整视频-语言模型作为即插即用模块,提升多模态任务性能。

Comments Published in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25901 2026-05-26 cs.CV cs.RO 78%

AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models

AgentGrounder:使用多模态语言模型的零样本3D视觉点云定位

Cuong Huynh, Maxim Popov, Denis Gridusov, Sergey Kolyubin

机构 * Biomechatronics and Energy-Efficient Robotics (BE2R) Lab, ITMO University(生物机械与高效能机器人实验室,ITMO大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 提出AgentGrounder框架,通过两阶段设计(离线构建对象查找表和在线工具驱动代理)实现零样本3D视觉定位,在ScanRefer和Nr3D上分别提升2.5%和6.3%的准确率。

Comments Code: https://github.com/be2rlab/AgentGrounder

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14845 2026-05-15 cs.CV 78%

Exploring Vision-Language Models for Online Signature Verification: A Zero-Shot Capability Study

探索用于在线签名验证的视觉-语言模型:零样本能力研究

Marta Robledo-Moreno, Ruben Vera-Rodriguez, Ruben Tolosana, Javier Ortega-Garcia

机构 * BiometricsAI, School of Engineering, Universidad Autonoma de Madrid, Spain(生物识别AI,工程学院,马德里自治大学,西班牙)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文研究了最新视觉-语言模型在在线签名验证任务中的零样本性能,发现信号质量和伪造类型对性能有显著影响,尤其在高难度伪造场景中,基于链式推理的模型表现下降。

Comments Accepted at the 14th International Workshop on Biometrics and Forensics

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11809 2026-05-15 cs.CV 78%

From Street View to Visual Network: Mapping the Visibility of Urban Landmarks with Vision-Language Models

从街景到视觉网络:利用视觉语言模型映射城市地标可见性

Zicheng Fan, Kunihiko Fujiwara, Pengyuan Liu, Fan Zhang, Filip Biljecki

机构 * organization= Department of Architecture, National University of Singapore , country= Singapore organization= Research \& Development Institute, Takenaka Corporation , country= Japan organization= Urban Analytics Subject Group, Urban Studies \& Social Policy Division, University of Glasgow , country= United Kingdom organization= Institute of Remote Sensing GIS, Peking University , country= China organization= Department of Real Estate, National University of Singapore , country= Singapore

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出利用视觉语言模型将地标可见性分析转化为图像空间中的视觉搜索问题,通过街景图像实现高效可见性评估,构建异构可见性图以表示地标、街景位置及城市空间之间的视觉连接,实验表明方法在数据受限情况下具有较高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13233 2026-05-14 cs.HC 78%

Doppler Prompting for Stable mmWave-based Human Pose Estimation

多普勒提示用于稳定的毫米波基人体姿态估计

Shuntian Zheng, Jiaqi Li, Xiaoman Lu, Shuai He, Yu Guan

专题命中 推理与问题求解 :prompting(title,abstract)

AI总结 本文提出PULSE方法,通过将多普勒信号转化为置信度感知的运动提示,改进毫米波人体姿态估计的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12888 2026-05-14 cs.HC 78%

Seed Bank, Co-op, Stoop Swap: Metaphors for Governing Language Model Data for Creative Writing

种子库、合作、巷子交换:语言模型数据治理的隐喻

Alicia Guo, Carly Schnitzler, Katy Gero

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文探讨如何通过隐喻指导语言模型用于创意写作,提出四个主题:同意的重要性、社区边界定义、贡献者认可方式及模型规模的权衡,倡导开放的小型模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11061 2026-05-13 cs.CV cs.MM 78%

HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer

HiDream-O1-Image:一种原生统一的图像生成基础模型,具有像素级统一的Transformer

Qi Cai, Jingwen Chen, Chengmin Gao, Zijian Gong, Yehao Li, Yingwei Pan, Yi Peng, Zhaofan Qiu, Kai Yu, Yiheng Zhang, Hao Ai, Siying Bai, Yang Chen, Zhihui Chen, Fengbin Gao, Ying Guo, Dong Li, Zhen Shen, Leilei Shi, Jing Wang, Siyu Wang, Yimeng Wang, Rui Zheng, Ting Yao, Tao Mei

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 本文提出HiDream-O1-Image,通过像素空间扩散Transformer实现多模态输入的结构统一,无需外部VAE或离散文本编码器,提升生成和编辑任务的性能,实验表明其在多种生成任务中表现优异。

Comments Source codes and models are available at Github: https://github.com/HiDream-ai/HiDream-O1-Image and Huggingface: https://huggingface.co/HiDream-ai/HiDream-O1-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10744 2026-05-12 cs.CV cs.RO 78%

C-CoT: Counterfactual Chain-of-Thought with Vision-Language Models for Safe Autonomous Driving

C-CoT:基于视觉-语言模型的反事实链式推理用于安全自动驾驶

Kefei Tian, Yuansheng Lian, Kai Yang, Xiangdong Chen, Shen Li

机构 * College of Transportation, Tongji University(同济大学交通运输学院) Department of Civil Engineering, Tsinghua University(清华大学土木工程系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Department of Civil and Environmental Engineering, National University of Singapore(新加坡国立大学土木与环境工程系)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出C-CoT框架,利用视觉-语言模型将驾驶决策分解为五个阶段,通过反事实推理提升自动驾驶在复杂环境中的安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22003 2026-05-12 cs.RO 78%

VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models

VP-VLA:作为视觉语言动作模型接口的视觉提示

Zixuan Wang, Yuxin Chen, Yuqi Liu, Jinhui Ye, Pengguang Chen, Changsheng Lu, Shu Liu, Bei Yu, Jiaya Jia

机构 * HKUST(香港科技大学) CUHK(香港大学) SmartMore(SmartMore公司)

专题命中 推理与问题求解 :prompting(title,abstract)

AI总结 VP-VLA通过结构化视觉提示接口解耦高层推理与低层执行,提升空间精度和鲁棒性,实验证明优于现有端到端基线。

Comments Project page: https://visualprompt-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07877 2026-05-11 cs.RO 78%

Melding LLM and temporal logic for reliable human-swarm collaboration in complex scenarios

将大语言模型与时序逻辑融合以实现复杂场景中可靠的人-群智协作

Junfeng Chen, Yuxiao Zhu, An Zhuo, Xintong Zhang, Shuo Zhang, Guanghui Wen, Xiwang Dong, Meng Guo, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Division of Natural and Applied Sciences, Duke Kunshan University(杜克昆山大学自然与应用科学学院) School of Automaton, Southeast University(东南大学自动化学院) School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院)

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 本文提出一种神经符号框架,结合时序逻辑与大语言模型,实现长周期人-群智协作,通过形式化任务规划与上下文感知推理,提升动态环境中任务规划的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05377 2026-05-08 cs.CV 78%

Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation

无人机视角下视觉语言模型能否思考?统一无人机推理与生成

Jintao Sun, Gangyi Ding, Donglin Di, Hu Zhang, Zhedong Zheng

机构 * Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织 Data61 分部) University of Macau(澳门大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出UAVReason数据集,用于研究无人机视角下的统一推理与生成,通过改进模型在高海拔场景下的表现,提升视觉语言模型在复杂环境中的能力。

Comments 21 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19652 2026-04-28 cs.CV 78%

Self-Rewarding Vision-Language Model via Reasoning Decomposition

通过推理分解实现自奖励视觉-语言模型

Zongxia Li, Wenhao Yu, Chengsong Huang, Zhenwen Liang, Rui Liu, Fuxiao Liu, Jingxi Che, Dian Yu, Jordan Boyd-Graber, Haitao Mi, Dong Yu

机构 * Tencent AI Seattle Lab(腾讯AI西雅图实验室) University of Maryland(马里兰大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出Vision SR1,通过分解视觉与语言推理,提升视觉推理能力,减少视觉幻觉和语言捷径依赖,效率优于需外部视觉奖励模型的方法。

Comments 16 pages, two figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00161 2026-04-22 cs.CV 78%

Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models

Q-Mask:面向OCR的视觉语言模型中基于查询的因果遮罩用于文本锚定

Longwei Xu, Feng Feng, Shaojie Zhang, Xin Chen, Hang Li, Anan Du, Hailong Yu, Pei Fu, Zhenbo Luo, Jian Luan

机构 * MiLM Plus(小米公司)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出Q-Mask框架,通过因果查询驱动的遮罩解码器提升OCR任务中文本锚定的准确性与稳定性,结合大规模标注数据集提升视觉语言模型对文本区域的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17241 2026-04-21 cs.RO 78%

GaLa: Hypergraph-Guided Visual Language Models for Procedural Planning

GaLa:基于超图的视觉语言模型用于程序规划

Kun Wang, Yiming Li, Mingcheng Qu, Aqiang Zhang, Guang Yang, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Chongqing Research Institute of HIT(重庆哈尔滨工业大学研究院)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 GaLa通过超图表示学习,有效捕捉物体间的隐含语义关系和功能区域的层次结构,提升多模态程序规划的性能。

Comments 14pages, 7figures

Journal ref ACL 2026(Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16857 2026-04-21 cs.CV cs.RO 78%

BOP-ASK: Object-Interaction Reasoning for Vision-Language Models

BOP-ASK:面向视觉-语言模型的对象交互推理

Vineet Bhat, Sungsu Kim, Valts Blukis, Greg Heinrich, Prashanth Krishnamurthy, Ramesh Karri, Stan Birchfield, Farshad Khorrami, Jonathan Tremblay

机构 * New York University(纽约大学) NVIDIA(英伟达)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出BOP-ASK数据集,用于训练和评估视觉-语言模型的对象交互推理能力,包含15万张图像和3300万对问题答案,涵盖六个任务,验证了模型在复杂环境中的空间推理能力。

Comments Accepted at CVPR 2026. Code, Datasets & Benchmark available at https://bop-ask.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04334 2026-04-21 cs.CV 78%

GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models

GeoArena:在大视觉-语言模型中评估开放世界地理推理

Pengyue Jia, Yingyi Zhang, Xiangyu Zhao, Sharon Li

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出GeoArena框架,通过人偏好评估动态图像中的地理推理能力,评估17种前沿LVLM,分析模型行为与人类偏好可靠性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17010 2026-04-21 cs.CL cs.AI cs.LG cs.PL 78%

Improving LLM Code Reasoning via Semantic Equivalence Self-Play with Formal Verification

通过形式验证的语义等价自博弈提升大语言模型代码推理

Antonio Valerio Miceli Barone, Poon Tsz Nok

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于形式验证的语义等价自博弈框架,利用对抗训练提升代码推理能力,通过验证等价性与非等价性,释放OpInstruct-HSx数据集,实验显示在EquiBench上提升13.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16348 2026-04-21 cs.HC cs.CY 78%

Beyond the Townhall: Spatial Anchoring and LLM Agents for Scalable Participatory Urban Planning

超越市政厅:空间锚定与大语言模型代理用于可扩展的参与式城市规划

Carina I Hausladen, Javier Argota Sánchez-Vaquerizo, Michael Siebenmann, Arthur Capozzi, Sachit Mahajan, Dirk Helbing

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 本文提出一种可扩展的数字参与平台,通过空间锚定和大语言模型代理提升公众在可持续城市规划中的参与度,实验显示沉浸式展示提高了信息回忆并促进集体可持续发展反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16248 2026-04-20 cs.CV 78%

Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization

视觉-语言模型在何处失效?面向图像地理定位的世界尺度分析

Siddhant Bharadwaj, Ashish Vashist, Fahimul Aleem, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文评估了多种先进视觉-语言模型在国家层面图像地理定位中的表现,揭示了模型在粗粒度地理定位中的潜力及当前模型在细粒度地理线索捕捉上的局限。

Comments Accepted to the CVPR EarthVision 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10946 2026-04-16 cs.CV 78%

Abstract 3D Perception for Spatial Intelligence in Vision-Language Models

抽象3D感知用于视觉-语言模型中的空间智能

Yifan Liu, Fangneng Zhan, Kaichen Zhou, Yilun Du, Paul Pu Liang, Hanspeter Pfister

机构 * Tsinghua University(清华大学) Harvard University(哈佛大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出SandboxVLM框架,通过抽象边界框编码几何结构和物理动力学,提升视觉-语言模型在3D任务中的空间智能,实验证明其在零样本设置下显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12833 2026-04-15 cs.CV 78%

Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks

用可部署的多模态语义照明攻击挑战视觉-语言模型

Yingying Zhao, Chengyin Hu, Qike Zhang, Xin Li, Xin Wang, Yiwei Wei, Jiujiang Guo, Jiahuan Long, Tingsong Jiang, Wen Yao

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出MSLA攻击框架,通过可控对抗性照明攻击视觉-语言模型的多模态语义理解,揭示其在现实世界中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11177 2026-04-14 cs.CV 78%

Do Thought Streams Matter? Evaluating Reasoning in Gemini Vision-Language Models for Video Scene Understanding

推理流是否重要?评估Gemini视觉-语言模型在视频场景理解中的推理能力

Shivam Sharma, Sankalp Nagaonkar, Ashish Choithani, Ashutosh Trivedi

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 研究评估了Gemini视频语言模型中推理流对视频场景理解的影响,提出三个评估指标,并发现增加推理量对输出质量的提升迅速达到平台期,Flash Lite在质量和token使用之间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏