arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-09-01 至 2026-09-01 共收录 7
2608.30294 2026-09-01 cs.CV 新提交

Dynamic Hub-and-Spoke Memory for Streaming Video Understanding

用于流视频理解的动态轮辐式记忆

Xinru Jiang, Lin Zhao, Xi Xiao, Yunbei Zhang, Janet Wang, Chenrui Ma, Haolin Li, Yanzhi Wang, Yifan Gong, Octavia Camps

机构 * Northeastern University(东北大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Tulane University(杜兰大学) University of Virginia(弗吉尼亚大学) Adobe Research(奥多比研究院)

AI总结 针对流视频理解需同时紧凑记忆长程历史与高效检索相关证据的挑战,提出动态轮辐式记忆(D-HSM)框架,结合结构化文本记忆与近期视觉标记,在基准上提升VLM性能并优于现有基线。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29459 2026-09-01 cs.AI 新提交

Toward Latent Language Model Skills Steering and Optimization: An Empirical Study

面向潜在语言模型技能的引导与优化:一项实证研究

Xunyi Jiang, Junda Wu, Yuxin Xiong, Sheldon Yu, Tong Yu, David Arbour, Ritwik Sinha, Julian McAuley, Hongyi Wen

机构 * New York University(纽约大学) Adobe Research(奥多比研究院) UC San Diego(加州大学圣迭戈分校)

AI总结 本研究通过实证探究发现大型语言模型(LLM)的过程技能可表征为激活空间中的向量方向,且可通过向量操作实现技能引导与优化,为LLM过程技能的潜在空间操控提供了表征级视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29063 2026-09-01 cs.AI 新提交

Agent2UCB: Agentic System for Generative Engine Optimization

Agent2UCB:用于生成式引擎优化的智能系统

Sheldon Yu, Rui Wang, Tong Yu, Sungchul Kim, Doga Dogan, Junda Wu, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(奥多比研究院)

AI总结 该研究提出智能GEO系统Agent2UCB,通过评估9种策略并结合多臂老虎机策略优化内容,在GEO-Bench实验中实现可见性提升且保留SEO质量,还提供SEO评估与演示功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28696 2026-09-01 cs.CV 新提交

Instruction Distillation: Text Instructions as Visual Examples

指令蒸馏:将文本指令作为视觉示例

Hardik Jindal, Soumyabrata Pal, Sayak Ray Chowdhury

机构 * IIT Kanpur(印度理工学院坎普尔分校) Adobe Research(奥多比研究院)

AI总结 该研究针对视觉上下文学习的高成本问题,提出指令蒸馏方法,为每个训练图像生成结构化指令,在细粒度视觉分类任务中提升性能并降低推理成本,且视觉与文本ICL信号互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22875 2026-09-01 cs.CV cs.AI 版本更新

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(阿伯拉罕大学) Adobe Research(Adobe研究)

AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。

Comments Accepted at EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09025 2026-09-01 cs.CL cs.LG

Lizard: An Efficient Linearization Framework for Large Language Models

Lizard:一种高效的大型语言模型线性化框架

Chien Van Nguyen, Huy Nguyen, Ruiyi Zhang, Hanieh Deilamsalehy, Puneet Mathur, Viet Dac Lai, Haoliang Wang, Jayakumar Subramanian, Ryan A. Rossi, Trung Bui, Nikos Vlassis, Franck Dernoncourt, Thien Huu Nguyen

机构 * University of Oregon(俄勒冈大学) Adobe Research(Adobe研究院)

AI总结 Lizard提出一种高效线性化框架,将预训练的Transformer大型语言模型转换为亚二次架构,通过亚二次注意力机制提升计算效率,实现模型质量与内存控制的平衡。

Comments ACL 2026 (Main)

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 34935-34948 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13392 2026-09-01 cs.CV 版本更新

A Study of the Design Space of Motion and Disocclusion Control in Video Generation

超越可见范围:通过代理动态图实现的遮挡感知编辑

Anran Qi, Changjian Li, Adrien Bousseau, Niloy J. Mitra

机构 * Inria - Université Côte d’Azur(法国国家信息与自动化技术研究院-埃克塞特大学) University of Edinburgh(爱丁堡大学) Adobe Research(Adobe研究部) UCL(伦敦大学学院)

AI总结 通过代理动态图实现遮挡感知编辑,结合运动规范与外观合成,实现可控的图像到视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏