mirror of
https://github.com/zenlm/zen4-ultra-trainer.git
synced 2026-07-25 18:31:37 +00:00
QLoRA fine-tuning for Kimi K2.5 (1.04T MoE) with gate/router unfreezing. Standard abliteration fails on MoE — backprop through router instead. - train_zen4_ultra.py: SFT + DPO training modes - merge_and_upload.py: Merge LoRA adapters into base - generate_compliance_data.py: Generate compliance training data - app.py: HuggingFace Spaces Gradio app - data/: Identity training data (736 examples)