Cite
Notes
Only stored in your browser.
Attribution
Vanishing Gradients in Reinforcement Finetuning of Language Models
arXiv 2023
Stabilizing Transformer Training by Preventing Attention Entropy Collapse
When can transformers reason with abstract symbols?
from 3 papers
Joshua Susskind
Omid Saremi
Arwen Bradley
Dan Busbridge
Emmanuel Abbe
Enric Boix-Adsera
Hattie Zhou
Jason Ramapuram
Jiatao Gu
Josh Susskind