allenai
/

Llama-3.1-Tulu-3-70B-SFT

Text Generation

text-generation-inference

Inference Endpoints

Model card Files Files and versions Community

vwxyzjn commited on 13 days ago

Commit

f8ef341

·

verified ·

1 Parent(s): 0c898d4

Update README.md

Files changed (1) hide show

README.md +2 -1

README.md CHANGED Viewed

@@ -140,7 +140,8 @@ Tülu3 is designed for state-of-the-art performance on a diversity of tasks in a
 |-----------|-------------------|
 | **Base Model** | [meta-llama/llama-3.1-405B](https://huggingface.co/meta-llama/llama-3.1-405B) |
 | **SFT** | [allenai/llama-3.1-Tulu-3-405B-SFT](https://huggingface.co/allenai/llama-3.1-Tulu-3-405B-SFT) |
-| **Final Model (DPO)** | [allenai/llama-3.1-Tulu-3-405B](https://huggingface.co/allenai/llama-3.1-Tulu-3-405B) |
 | **Reward Model (RM)**| (Same as 8B)

 |-----------|-------------------|
 | **Base Model** | [meta-llama/llama-3.1-405B](https://huggingface.co/meta-llama/llama-3.1-405B) |
 | **SFT** | [allenai/llama-3.1-Tulu-3-405B-SFT](https://huggingface.co/allenai/llama-3.1-Tulu-3-405B-SFT) |
+| **DPO** | [allenai/llama-3.1-Tulu-3-405B-DPO](https://huggingface.co/allenai/llama-3.1-Tulu-3-405B-DPO) |
+| **Final Model (RLVR)** | [allenai/llama-3.1-Tulu-3-405B](https://huggingface.co/allenai/llama-3.1-Tulu-3-405B) |
 | **Reward Model (RM)**| (Same as 8B)