一文读懂 DeepSeek R1:强化学习如何重塑大语言模型推理能力? DeepSeek R1 是 DeepSeek 公司推出的一款基于强化学习的大语言模型,它在推理能力上取得了重大突破,甚至能与 OpenAI 的 o1-1217 相媲美。 DeepSeek R1 强化学习 大语言模型 Jan 24, 2025 · 14 min read