Model
1 entry · 29 March 2022
Existing large models were badly under-trained: for a fixed compute budget, parameters and training tokens should scale together.
Ideas & essays · Benchmarks & progress · Models & capabilities