所以現在的情況是DeepSeek越強,開源生態越繁榮,跑在國產芯片上的應用越多,英偉達CUDA的鎖定效應就越弱。CUDA鎖定效應越弱,國產芯片越有機會迭代。國產芯片越迭代,DeepSeek下一版就能在更強的國產算力上跑。這是第一個正反饋。 DeepSeek每發布一個新模型,華爾街就重估一次“英偉達未來還有沒有暴利”。股價一哆嗦,幻方量化靠着做空或波動套利,一把收割。收割來的錢不需要分給股東,不需要買遊艇,反手砸進DeepSeek的下一輪研發。這又是一個正反饋。 國家看到了“打掉美國最後一個技術壁壘”的戰略價值,於是默許幻方在金融市場上那些野蠻的套利動作。政策包容換來國產半導體生態的加速度,加速度換來更低的卡脖子風險。三方各取所需,DeepSeek在中間既當發動機又當方向盤。 所以,DeepSeek不是什麼民族英雄式的單點突破。它是一台算法效率驅動的三層正反饋機器。底層是思維鏈和推理時計算改變了模型的“代謝率”,中層是開源和低價抽幹了閉源巨頭的血,外層是資本市場的負反饋為母體持續供血。這三層咬合在一起,比任何單一技術突破或者商業策略都要命。 好了,前面的你都看懂了以後就能理解為什麼Deepseek是個核彈級產品...它從算法、生態和商業三個層面徹底瓦解了美國為維持AI霸權所構築的三大壁壘 - 算力壁壘、生態壁壘和成本壁壘。 DeepSeek最大的衝擊,是挑戰了“AI性能由高端算力數量決定”的信條。DeepSeek R1模型僅用數百萬美元成本,就實現了媲美OpenAI的GPT-5的推理能力。 當西方巨頭在堆參數時,DeepSeek憑藉混合專家模型(MoE) 和DSA稀疏注意力等架構突破,大幅降低了對顯存和算力的需求。這並非簡單的“以小博大”,而是證明通過更高效的算法和工程優化,同樣可以縮短與巨頭成本之間的巨大鴻溝。這也解釋了為何其V4-Flash模型的API調用價格,僅為GPT-5.5的百分之一。 DeepSeek的真正戰略價值,在於它主動完成了最艱難、也最危險的一步 - “去英偉達化”。為了實現從英偉達CUDA生態向華為昇騰CANN架構的底層遷移,DeepSeek-V4不惜硬生生推遲了半年才發布。得益於這種堅持,其V4系列模型在發布首日(Day 0),就完成了對華為昇騰、寒武紀、摩爾線程等8家國產芯片的全量適配。 在所有衝擊中,這一擊最為釜底抽薪。美國政策制定者原本希望,通過對華禁售Nvidia高性能芯片,從根本上鎖死中國的AI能力。DeepSeek的成功,讓這一戰略遭遇了全面失敗。 2025年以後AI大模型有了一個巨大的進步,就是推理能力(thinking mode),aka思維鏈(CoT)和 推理時計算。 從LLM的本質出發,理解思維鏈(CoT)和推理時計算的本質,這裡的關鍵在於看清一個底層矛盾:Transformer的固定深度與複雜問題所需的多步推理之間的不匹配。 Transformer每一層都做一次非線性變換,整個模型有固定層數 LL(如64層)。 自回歸生成時,每產生一個token,模型只做一次深度為 LL 的前向傳播,且不能回頭。 這意味着:對於任何需要超過 LL 步邏輯鏈才能解決的問題,標準LLM只能“猜”,因為它沒有機制在生成下一個詞之前打草稿、做中間計算。 思維鏈的本質:用“時間”換取“深度”,也就是說思維鏈強制模型將推理過程顯式地展開成多個token。 把原本需要單次深度 DD 的計算,拆解為 mm 個深度 LL 的步驟,並通過上下文傳遞中間狀態。整體有效計算深度從 LL 變為 m×Lm×L(因為每一步都基於上一步的輸出重新進Transformer)。 但思維鏈仍是一維的線性鏈,一步錯步步錯。推理時計算更進一步可以進行並行擴展(Self-Consistency)和串行擴展+搜索(Tree-of-Thoughts)。 於是結果就變成了: 推理質量≈模型固有能力+f(推理計算量) 其中 f 在初期近似於對數線性增長,直到邊際收益遞減。推理時計算就是把傳統Scaling Law中的 “訓練計算量” 部分轉移到 “推理計算量” 上,用更靈活的推理時間換取模型體積或訓練成本的降低。 思維鏈和推理時計算,本質上是用算法的時空複雜度(O(步驟數))來補償模型架構的表達深度限制(O(層數))。它們把LLM從“固定深度的直覺機器”變成了“可編程的符號計算引擎” - 雖然底層仍是神經網絡,但行為上已經開始逼近通用圖靈機。 思維鏈和推理時計算擴展了LLM的表達能力(從短路輸出到多步展開),但沒有改變其統計本質(無意圖、無因果、無自我、無價值、無目標創造)。但人的思考是第一人稱的、有意識的、價值驅動的、主動構建的過程;LLM的“推理”是第三人稱的、盲目的、模式驅動的、被動響應的過程。兩者之間存在不可逾越的本質鴻溝,CoT只是讓鴻溝看起來窄了一點。 有了這個錨點你就能理解,模型的能力主要來自參數量、數據量和計算量的統一擴展,這就相當於你的價值觀有了客觀可觀事實根基,而不是純粹的跟風。 從這點來客觀比較中美大模型的話: 參數量:美國模型(OpenAI, Anthropic之類)占優(GPT-5據稱已達12.8萬億),中國模型在追趕。 數據量:公開信息較少,但是中國的數據量天然比美國多得多。 訓練算力:美國暫時占優,中國受制於芯片禁令,國產算力替代是關鍵。 美國頭部模型更像是在“豪賭”規模(Scaling Law),堅信“大力出奇蹟”,中國模型則更像是追求“事半功倍”的效率(Efficiency Law)。 這樣,你在看中美AI競賽的時候多少才能看點門道,而不是純燒Token湊熱鬧 理解LLM算法本質和Transformer架構是接觸AI的“錨點”,因為它為一切上層實踐(提示詞工程、Agent開發、RAG、微調等)提供了統一的因果坐標系。 沒有這個錨點,你很容易在現象層面迷失 - 要麼對模型寄予不切實際的期望,要麼在它出錯時陷入玄學式的歸因(“模型太笨”“提示詞魔法不夠”)。 然後賣課的就盯上你了。
從LLM算法本質來看,這段話切中了當前大模型應用中最容易被忽視的核心矛盾:模型的生成能力不等於人類的思考能力,而模型的輸出質量根本上取決於輸入信號的結構化程度。 LLM的本質是一個自回歸概率模型,給定上文,預測下一個token的概率分布。它的每次生成都依賴於前面的上下文,而上下文完全由你提供。這意味着: - 模型沒有內在的“目標”或“意圖”,它只是在擬合訓練數據中學到的條件概率。 - 你給的信息越碎片、模糊、情緒化(比如vibe coding那種“隨便做點什麼好看的東西”),模型的條件分布就越分散,結果就越隨機、平庸甚至荒謬。 這正是為什麼提示詞工程強調“深度、廣度、顆粒度” - 深度對應因果鏈的清晰(消除歧義),廣度對應相關條件的覆蓋(減少缺失維度),顆粒度對應指令的原子性與可驗證性(讓每一步的概率峰足夠尖銳)。這些本質上是在降低模型生成時的熵,讓最可能的token序列恰好是你想要的。 LLM不是上帝,因為它沒有意圖和規劃;但它可以被驅使,因為它的條件概率對結構化的輸入極其敏感。你沒想明白就幹這在算法上等於主動放棄對條件分布的控制,這在任何工程領域都是災難,在概率生成模型中尤其如此。 你每寫一個提示詞,本質上都是一次對條件概率的逆向工程,如果模型給出了A而不是你想要的B → 說明你提供的條件中,A的概率更高。你要追問:是哪個詞誤導了?缺少了什麼約束?是否存在衝突的指令?這個過程迫使你把自己的模糊直覺拆解為明確、有序、無歧義的語言,這正是深度思考與精確表達的核心訓練。 如果你vibe coding是在讓模型替你去模糊化,結果就是你變得越來越依賴隨機輸出,自己的認知結構卻越發鬆散。換句話說不是你在駕馭AI,是AI在把你變成傻逼。 提示詞工程也好,SKILL也罷,各種對LLM的約束嘗試,最大的啟發不是我們如何調教“無所不知”的大模型,而是讓我們自己先學會思考,深度、廣度和顆粒度--而這一點和vibe coding這種上頭式幼稚不負責的“方法”天生矛盾的。 你可以vibe anything,但不要試圖在沒想明白之前動手。否則,你以為你播下的是龍種,但最後收穫的只能是跳蚤。 靠天吃飯、撒播、不聞不問,那是蠻夷的農耕。而正確的方法應該是華夏農耕的方式:了解天地人,通曉曆法節氣,了解作物習性,揚長避短,因地制宜。 LLM不是無所不知的上帝,它只是個無所不能的瘋孩子。 約束它,然後驅使它---前提是我們知道我們自己要(干)什麼,先了解我們自己。 即使做不出什麼成熟的產品,但經過實踐,我們的思考能力和表達能力會得到極大地提高。
|