LoGo: Token-Level Dynamic Local-Global Attention
尚未评估计划受阻研究发现claim-matched-budget
In the controlled 1.5B comparison, LoGo reports the best language-modeling loss and Lambada perplexity among the listed full-attention and matched-budget static hybrid variants, with a higher commonsense-reasoning average than the full Transformer.
来源:paper-fixed:Section 4.2 and Table 2, p. 7
报告指标与观测值
train_loss
m-table2-logo-loss
论文报告 2.112 loss
实际观测 — loss
lambada_perplexity
m-table2-logo-lambada-ppl
论文报告 7.5 perplexity
实际观测 — perplexity
commonsense_reasoning_average
m-table2-logo-csr
论文报告 56.3 percentage_points
实际观测 — percentage_points
Assessment(0)
这条 Claim 暂无已发布的不可变 Assessment。
关联运行(0)
这条 Claim 暂无关联执行。