-
Kimi K3 深度拆解:2.8 兆開源模型的三個訓練突破,以及它為什麼是比上一代更大的跳躍
所有報導都在寫「Kimi K3 開源屠榜、超越 Claude」。但真正值得開發者記住的,不是排行榜,是它的訓練架構——用三個新算法把「序列長度/深度/寬度」分開擴展,比上一代 K2 的擴展效率好約 2.5 倍。這篇把 K...
-
DeepSeek-V2:性能逼近 GPT-4-Turbo 的超強 MoE 模型開源!
引言:開啟AI新紀元的DeepSeek-V2 近年來,隨著人工智能技術的飛速發展,大型語言模型(Large Language Models,LLMs)已成為推動這一領域創新的主要力量。尤其值得關注的是混合專家(Mixtu...
-
Qwen 1.5 MoE:突破大模型的性能瓶頸
引言 在 AI 界的一場沉寂之後,阿里巴巴集團最近發布了一款備受矚目的人工智能語言模型——Qwen 1.5 MoE。這款模型以其 2.7 億的啟動參數,在多項基準測試中展現出了與 7B 級別大模型相匹敵的性能,為業界帶來...