add merge_weights.json
Browse files- merge_weights.json +72 -0
merge_weights.json
ADDED
|
@@ -0,0 +1,72 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"merged": "/home/elie/anthropic-research-jspace/runs/E7_inkling/fits/Inkling-NVFP4_jacobian_lens.pt",
|
| 3 |
+
"merge_rule": "exact n_prompts-weighted mean: J = (n0*J0 + n1*J1)/(n0+n1); code/merge_lens.py -> jlens.lens.JacobianLens.merge",
|
| 4 |
+
"shards": {
|
| 5 |
+
"shard0": {
|
| 6 |
+
"path": "/home/elie/anthropic-research-jspace/runs/E7_inkling/fits/shard0/Inkling-NVFP4_shard0of2_jacobian_lens.pt",
|
| 7 |
+
"n_prompts": 125,
|
| 8 |
+
"weight": 0.5
|
| 9 |
+
},
|
| 10 |
+
"shard1": {
|
| 11 |
+
"path": "/home/elie/anthropic-research-jspace/runs/E7_inkling/fits/shard1/Inkling-NVFP4_shard1of2_jacobian_lens.pt",
|
| 12 |
+
"n_prompts": 125,
|
| 13 |
+
"weight": 0.5
|
| 14 |
+
}
|
| 15 |
+
},
|
| 16 |
+
"n_prompts_merged": 250,
|
| 17 |
+
"storage_dtype": "float32 (shards are fp32; fp16 default overridden so the merged artifact is the exact mean)",
|
| 18 |
+
"n_valid_positions_per_prompt": 111,
|
| 19 |
+
"note": "every prompt in both shards has seq_len=128 / n_valid=111, so n_prompts-weighting == n_valid/pair-count weighting exactly; weights 0.5/0.5",
|
| 20 |
+
"prompt_partition": "global wikitext prompts [0..249]; shard0 = prompts[0::2] (even), shard1 = prompts[1::2] (odd) via fit_moe.py --prompt_offset/--prompt_stride",
|
| 21 |
+
"sanity_spot_checks_norm_over_sqrt_d": {
|
| 22 |
+
"0": {
|
| 23 |
+
"norm_shard0": 200.0007228777548,
|
| 24 |
+
"norm_shard1": 189.64136021348878,
|
| 25 |
+
"norm_merged": 169.12728229765082,
|
| 26 |
+
"max_abs_dev_from_elementwise_mean": 3.0517578125e-05,
|
| 27 |
+
"norm_le_mean_of_shard_norms": true
|
| 28 |
+
},
|
| 29 |
+
"1": {
|
| 30 |
+
"norm_shard0": 174.78741660064878,
|
| 31 |
+
"norm_shard1": 165.39693347753584,
|
| 32 |
+
"norm_merged": 145.8192053089544,
|
| 33 |
+
"max_abs_dev_from_elementwise_mean": 1.52587890625e-05,
|
| 34 |
+
"norm_le_mean_of_shard_norms": true
|
| 35 |
+
},
|
| 36 |
+
"2": {
|
| 37 |
+
"norm_shard0": 91.02883490107857,
|
| 38 |
+
"norm_shard1": 84.2912555172821,
|
| 39 |
+
"norm_merged": 71.81201800576076,
|
| 40 |
+
"max_abs_dev_from_elementwise_mean": 7.62939453125e-06,
|
| 41 |
+
"norm_le_mean_of_shard_norms": true
|
| 42 |
+
},
|
| 43 |
+
"16": {
|
| 44 |
+
"norm_shard0": 31.045034931439393,
|
| 45 |
+
"norm_shard1": 30.615423000958657,
|
| 46 |
+
"norm_merged": 27.741454332323375,
|
| 47 |
+
"max_abs_dev_from_elementwise_mean": 1.52587890625e-05,
|
| 48 |
+
"norm_le_mean_of_shard_norms": true
|
| 49 |
+
},
|
| 50 |
+
"32": {
|
| 51 |
+
"norm_shard0": 1.8632074850435494,
|
| 52 |
+
"norm_shard1": 1.8687422843306152,
|
| 53 |
+
"norm_merged": 1.8487818109309748,
|
| 54 |
+
"max_abs_dev_from_elementwise_mean": 4.76837158203125e-07,
|
| 55 |
+
"norm_le_mean_of_shard_norms": true
|
| 56 |
+
},
|
| 57 |
+
"48": {
|
| 58 |
+
"norm_shard0": 1.1597017330407198,
|
| 59 |
+
"norm_shard1": 1.1585713935619513,
|
| 60 |
+
"norm_merged": 1.158697635730552,
|
| 61 |
+
"max_abs_dev_from_elementwise_mean": 4.76837158203125e-07,
|
| 62 |
+
"norm_le_mean_of_shard_norms": true
|
| 63 |
+
},
|
| 64 |
+
"64": {
|
| 65 |
+
"norm_shard0": 1.0228682650302547,
|
| 66 |
+
"norm_shard1": 1.0229844817991904,
|
| 67 |
+
"norm_merged": 1.0229251080730173,
|
| 68 |
+
"max_abs_dev_from_elementwise_mean": 1.1920928955078125e-07,
|
| 69 |
+
"norm_le_mean_of_shard_norms": true
|
| 70 |
+
}
|
| 71 |
+
}
|
| 72 |
+
}
|