default nheads: 2 n_layers: 2 dropout: 0 token_dim: ${model.token_dim} max_seq_len: ${model.max_seq_len} vocab_size: ${data.vocab_size} get_last_token: true use_cls_token: false postpend_token: none model_type: null