DeepSeek-R1: pure reinforcement learning (RL), no supervised fine-tuning (SFT), no chain-of-thought…
Share

 

 #1minPapersContinue reading on Medium » Read More Llm on Medium 

#AI

By ali