LoGo: Token-Level Dynamic Local-Global Attention
尚未评估计划受阻研究发现claim-matched-budget

In the controlled 1.5B comparison, LoGo reports the best language-modeling loss and Lambada perplexity among the listed full-attention and matched-budget static hybrid variants, with a higher commonsense-reasoning average than the full Transformer.

来源:paper-fixed:Section 4.2 and Table 2, p. 7

报告指标与观测值

train_loss

m-table2-logo-loss

论文报告 2.112 loss

实际观测 — loss

lambada_perplexity

m-table2-logo-lambada-ppl

论文报告 7.5 perplexity

实际观测 — perplexity

commonsense_reasoning_average

m-table2-logo-csr

论文报告 56.3 percentage_points

实际观测 — percentage_points

Assessment(0)

这条 Claim 暂无已发布的不可变 Assessment。

关联运行(0)

这条 Claim 暂无关联执行。