Detection and characterisation of two VLM binaries: LP 1033-31 and LP 877-72
专题命中 视觉定位与Grounding :VLM(title)
Comments 14 pages, 6 figures, accepted for publication in MNRAS
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :VLM(title)
Comments 14 pages, 6 figures, accepted for publication in MNRAS
专题命中 视觉定位与Grounding :grounding(title)
Comments Accepted for Publishing at SemDial 2020
专题命中 视觉定位与Grounding :grounding(title)
Comments Accepted by WWW2020. Code available at https://github.com/INK-USC/NERO
专题命中 视觉定位与Grounding :grounding(title)
专题命中 视觉定位与Grounding :grounding(title)
Comments 44 pages including 12 figures
专题命中 视觉定位与Grounding :grounding(title)
Comments 16 pages, 5 figures, Accepted at EMNLP 2018
专题命中 视觉定位与Grounding :grounding(title)
Comments Accepted to ICASSP 2019
专题命中 视觉定位与Grounding :grounding(title)
Comments ICASSP 2019
专题命中 视觉定位与Grounding :grounding(title)
Comments In PEOPLES2018 short papers (NAACL workshop), 6 pages, 5 figures, 1 table
专题命中 视觉定位与Grounding :grounding(title)
Comments in: Pham, D.-N. and Park, S.-B., editors, PRICAI 2014: Trends in Artificial Intelligence, volume 8862 of Lecture Notes in Computer Science, pages 958-971. Springer
专题命中 视觉定位与Grounding :grounding(title)
Comments 21 pages, 1 figure
专题命中 视觉定位与Grounding :grounding(title)
Comments 22 pages, 5 figures; talk presented at the 2nd international symposium on "Emergent Quantum Mechanics" (Vienna, Austria, 3-6 October, 2013), http://www.emqm13.org/. To be published in J. Phys.: Conf. Ser. (2014)
Journal ref J. Phys.: Conf. Ser. (2014) 504 012006
专题命中 视觉定位与Grounding :grounding(title)
Comments 6 pages, LATEX
Journal ref Nucl. Instr. and Meth. A448 (2000) 81-84
专题命中 视觉定位与Grounding :grounding(title)
Comments 11 pages
Journal ref New J. Phys. 9 165 (2007)
基于范例的、使用最少标注的鲁棒异常检测:Exemplar Med-DETR
机构 * Friedrich-Alexander-Universität(弗里德里希-亚历山大大学) ; Siemens Healthineers(西门子医疗) ; Siemens Medical Solutions(西门子医疗解决方案)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对医学目标检测标注需求高的问题,扩展EM-DETR框架提出Exemplar Med-DETR方法,结合基于范例的特征生成与领域感知对比优化,用不足10%标注数据实现接近SOTA的胸部X射线异常检测性能,适配新疾病发现且无需大量重训练。
NeoWorld-Pro:从单目图像编程交互式场景以实现具身仿真
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 针对具身AI中图像转仿真场景的物理与交互性不足问题,提出NeoWorld-Pro框架,通过MLLMs将单目图像转为可执行程序,结合物理在环机制优化,性能优于现有方法并支持复杂下游任务。
跨模态物体计数:分类体系、基准、应用及开放挑战
机构 * University of Wyoming(怀俄明大学) ; Geometric Intelligence Research Lab.(几何智能研究实验室)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 本综述针对跨模态物体计数领域,提出五轴分类体系,梳理应用领域挑战,给出路线图,强调需构建稳健评估基础设施区分开放世界泛化与基准优化。
FOVEA:面向缓存友好型多模态推测解码的聚焦式按需视觉证据适配
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 FOVEA是一种缓存友好型多模态推测解码方法,通过动态检索视觉记忆子集提升草稿接受率,使多模态生成速度最高提升2.13倍。
从主观判断到可审计标准:协议引导的网站冗余度AI审计
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出CORA审计方法,通过多维度测量分离网站冗余的不同含义,在测试台上表现优于基线,对不达标工具弃权自动评分,是受控基准的可审计候选程序。
语言训练深度伪造检测器的正则化能力
机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)
专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。
在真实环境中进行具有长时域的任务规划
机构 * Korea University(韩国大学) ; Microsoft Research(微软研究院) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI
AI总结 本文提出了一种基于空间的规划任务,引入了GroundedPlanBench基准,评估机器人在真实环境中的长时域动作规划能力,并通过V2GP框架提升空间接地规划性能。
Comments 9 pages, 7 figures
Journal ref 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
STAR-OPD:面向ABSA四元组抽取的结构化级联感知在线策略奖励蒸馏
机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 该研究针对ABSA四元组抽取中蒸馏模型的结构错误问题,提出STAR-OPD方法,通过在线策略蒸馏结合级联感知集结构奖励,在多个数据集上优于基线,缩小了学生-教师差距并提升了推理效率。
当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入
机构 * Wuhan University(武汉大学) ; University at Buffalo(布法罗大学)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。
Comments submitted to USENIX Security 2027
神经符号具身智能体
机构 * Imperial College London(帝国理工学院) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; City, University of London(伦敦城市大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI
AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。
反事实敏感性不等于可修复性:针对视频证据的重播探针审计
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 本研究提出黑盒反事实探针 CARVE,通过对比 SHAM 与 DESTROY 重播下的答案变化,审计视频智能体的证据依赖,在 LVBench 上取得准确率提升,验证了反事实敏感性与可修复性的差异。
Comments 23 pages, 2 figures. Code: https://github.com/KurbanIntelligenceLab/CARVE
基准测试用于小样本医学图像分割的基础模型与大语言模型
专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究推出统一基准FAME,涵盖四类模型,含14958个样本,评估得出小样本分割的关键规律,助力开发更有效的小样本医学分割方法。
视觉输入中指代目标对象的多语言表达式理解
机构 * Instituto Superior Técnico(技术高等学院)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 本研究针对多语言指代表达式理解问题,构建了含10种语言的统一多语言数据集,提出基于多语言SigLIP2编码器的注意力锚定高效架构,验证了该模型在多语言视觉定位任务上的竞争力与稳定性。
SCVIB:面向多轮个性化定位的可编辑状态条件视觉实例绑定
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV
AI总结 该研究提出多轮个性化定位设置SCVIB,结合TT-VG与VEGA方法构建测试平台,解决多轮定位中支持证据利用不足问题,相关指标优于对比方法。
NEURON:一种面向临床可解释性的神经符号系统
机构 * University of North Texas(北卡罗来纳大学达顿分校) ; Texas Tech University Health Sciences Center(德克萨斯农工大学健康科学中心)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 NEURON结合医学本体和机器学习模型,提升预测可靠性与临床可解释性,通过RAG层生成自然语言解释,在MIMIC-IV数据集上提升AUC至0.84-0.88。
大型语言模型中的数字能力:基本局限与改进路径
机构 * University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI
AI总结 本研究针对LLMs在基础数值任务中的不可靠性,提出数值基础框架(NGF)并结合三大基准评估前沿模型,给出改进数值能力的部署建议与研究方向。