{ "experiment": "llm_moe_hard", "master_seed": 1, "git_commit": "e433e48860322161b7a67677f5817d76535ef69c", "python": "3.14.5", "libraries": { "numpy": "2.5.0", "scipy": "1.18.0", "pandas": "3.0.3", "pyarrow": "24.0.0", "torch": "2.12.1", "transformers": "5.13.0", "peft": "0.19.1" }, "rows": 47, "results_sha256": "a0bd6f8abaa9c8b4581340ec60789900063b67d1f2b348553d9cf7f4c6368750", "layer": "2", "tier": "llm", "base_model": "Qwen/Qwen2.5-0.5B-Instruct", "hard": true, "operators": [ "soup", "ties", "moe_oracle", "moe_learned", "max_merge" ] }