arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

JET:Transformer中的论证评估

JET: Justification Evaluation in Transformer

Shenghao Ding

arXiv 2609.33874首次发表:更新:

发表机构

Yet Another AI(Yet Another AI)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

JET利用预训练模型无需额外训练即可从有限答案中选择,通过直接评估候选可能性并共享计算,在CPU和GPU上实现高准确率与吞吐量,支持本地决策推理。

AI 中文摘要

JET利用预训练的语言和视觉-语言模型,在无需额外训练的情况下从有限答案集中进行选择。它直接评估候选答案的可能性,并在候选答案之间共享计算。在桌面CPU和消费级GPU上的实验评估了决策准确性和执行成本。Qwen3.6-35B-A3B在完整MMLU测试集上达到87.48%的准确率,在单独计时的MMLU子集上达到每秒3.69个请求。准确率-吞吐量比较涵盖了模型、硬件和推理选择,并以Jev作为外部参考。受控执行实验显示,通过前缀重用和缓存管理实现了2.18-2.23倍的加速,通过输入准备优化使处理时间减少了30.8%,且输出不变。可选推理存在任务相关的准确率-吞吐量权衡。这些结果支持从现有模型进行本地决策推理。

英文摘要

JET uses pretrained language and vision-language models to select among a finite set of answers without additional training. It evaluates candidate likelihoods directly and shares computation across candidates. Experiments on desktop CPUs and consumer GPUs assess decision accuracy and execution cost. Qwen3.6-35B-A3B achieves 87.48% accuracy on the full MMLU test set and 3.69 requests per second on a separately timed MMLU subset. The accuracy-throughput comparison covers model, hardware, and reasoning choices, with Jev as an external reference. Controlled execution experiments show 2.18-2.23-fold speedups from prefix reuse and cache management, and a 30.8% reduction in process time from input preparation optimizations, with unchanged outputs. Optional reasoning has a task-dependent accuracy-throughput trade-off. These results support local decision inference from existing models.

Comments11 pages, 2 figures. Code: https://github.com/yet-another-ai/jet

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑