Span-Level Machine Translation Meta-Evaluation
段级机器翻译元评估
机构 * Sapienza University of Rome(罗马萨皮恩扎大学) ; Amazon(亚马逊)
AI总结 本文研究了段级精度、召回率和F值的不同实现,发现看似相似的方法会产生显著不同的排名,某些常用技术不适合评估机器翻译错误检测。提出MPP与微平均相结合的元评估策略,并评估了当前机器翻译错误检测的最新状态。
Comments 18 pages, 4 figures
大厂专区
段级机器翻译元评估
机构 * Sapienza University of Rome(罗马萨皮恩扎大学) ; Amazon(亚马逊)
AI总结 本文研究了段级精度、召回率和F值的不同实现,发现看似相似的方法会产生显著不同的排名,某些常用技术不适合评估机器翻译错误检测。提出MPP与微平均相结合的元评估策略,并评估了当前机器翻译错误检测的最新状态。
Comments 18 pages, 4 figures
Vision-TTT: 高效的视觉表征学习与测试时间训练
机构 * Zhejiang University(浙江大学) ; Amazon Web Services(亚马逊网络服务)
AI总结 本文提出Vision-TTT,通过测试时间训练方法提升视觉表征效率与表达能力,在ImageNet分类中达到77.7%的Top-1准确率,同时在计算效率和内存消耗上显著优于现有方法。
重新思考流匹配生成模型的测试时间扩展
机构 * Australian National University(澳大利亚国立大学) ; Amazon Research(亚马逊研究院)
AI总结 本文提出DOG-Trim方法,通过Repel和NARF提升测试时间扩展效果,解决流匹配模型中全局搜索的挑战,实现性能提升。
CompAgent:一种用于视觉合规验证的代理框架
机构 * Generative AI Innovation Center(生成式人工智能创新中心) ; Amazon Web Services(亚马逊网络服务)
AI总结 本文提出CompAgent,一种基于代理的视觉合规验证框架,通过集成视觉工具和规划代理,提升多模态推理能力,在公开基准测试中取得76%的F1分数,优于现有方法。
Comments Accepted to IEEE CVPR 2026 GRAIL-V Workshop
ZOO-Prune:基于零阶梯度估计的训练自由token剪枝方法用于视觉-语言模型
机构 * Amazon(亚马逊公司) ; Sungkyunkwan University(成均馆大学) ; Inha University(inha大学)
AI总结 本文提出ZOO-Prune方法,通过零阶梯度估计在视觉-语言模型中实现无需训练的token剪枝,实验表明其在剪枝94.4%token的同时保持精度,并提升推理效率2.3倍。
叙事对齐的长视频问答
机构 * Purdue University(普渡大学) ; Amazon(亚马逊)
AI总结 本文提出NA-VQA基准,评估长视频中的深度时间与叙事推理能力,通过88部完整电影和4.4K开放性问题测试模型整合分散叙事信息的能力,提出Video-NaRA框架提升远距离推理性能。
审查审查者:图增强的大语言模型用于电商争议裁决
机构 * Purdue University(普渡大学) ; Amazon(亚马逊)
AI总结 本文提出图增强的大语言模型,通过显式动作建模和冲突建模解决电商争议裁决中的信息不对称问题,提升裁决一致性。
Comments 10 pages, 3 figures, KDD 2026 Applied Data Science Track