BHARGAV REDDY commited on
Commit
c064d58
·
verified ·
1 Parent(s): d0d47a8

Upload train_continue_english_1b.yaml with huggingface_hub

Browse files
Files changed (1) hide show
  1. train_continue_english_1b.yaml +44 -0
train_continue_english_1b.yaml ADDED
@@ -0,0 +1,44 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # LUNA 100M — English continuation pretraining
2
+ # Uses same LR schedule as original 3B-token pretrain (lr=6e-4, cosine -> 6e-5)
3
+ # auto_config: true => dynamic micro_batch via VRAM probe, auto workers, precision
4
+
5
+ auto_config: true
6
+
7
+ data_path: "Base/data/litdata_english_1b"
8
+ out_dir: "out/pretrain/luna-100m-english-1b"
9
+ tokenizer_dir: "Base/checkpoints/EleutherAI/pythia-160m"
10
+ init_model_path: "Base/out/pretrain/luna_100m/final/lit_model.pth"
11
+
12
+ model:
13
+ vocab_size: 50304
14
+ seq_len: 1024
15
+ n_layer: 10
16
+ n_embd: 768
17
+ n_head: 12
18
+
19
+ train:
20
+ max_tokens: 420000000
21
+ lr_warmup_steps: 500
22
+ save_interval: 500
23
+ log_interval: 10
24
+ max_norm: 1.0
25
+
26
+ optimizer:
27
+ lr: 0.0006
28
+ min_lr: 0.00006
29
+ weight_decay: 0.1
30
+ betas: [0.9, 0.95]
31
+ eps: 1.0e-8
32
+
33
+ batch:
34
+ global_batch: 120
35
+ micro_batch: 12
36
+ grad_accum: 10
37
+
38
+ dataloader:
39
+ num_workers: -1
40
+ pin_memory: true
41
+
42
+ hardware:
43
+ precision: "bf16"
44
+ compile: true