智東西8月10日報道,成立兩年多的AI推理公司魔形智慧宣佈完成A輪融資,由毅達資本領投,並引入多家戰略資源方,老股東繼續追加投資,部分股東還進行了超比例跟投。距離該公司今年5月公佈數億元Pre-A輪融資,僅過去三個月。三個月連融兩輪,在當前融資環境下並不多見。更引人注目的是這家公司的體量——成立兩年,日均Token呼叫量已達到數萬億級別,客戶與合作伙伴覆蓋網際網路公司、大模型廠商及各行業頭部企業。
資本追逐的,是一個看起來門檻似乎在降低的市場。DeepSeek、Kimi、GLM、MiniMax等開源模型密集釋出,企業可以直接下載權重,通用推理框架也越來越成熟。有人放言,大模型推理正在變成一門“有卡就能幹”的生意。但事實並非如此。“模型是開源的,但高效的部署方式並不會全部開源。”魔形智慧創始人、CEO徐凌傑告訴智東西,模型能夠執行,只代表生產出了Token;能否在大規模併發下守住延遲、吞吐、成功率和成本,才決定這些Token能不能賣出去。
這正是Token工廠走紅的深層原因。2026年,從晶片廠商、雲服務商到運營商和AI基礎設施公司,幾乎人人都在講Token工廠的故事,大額融資不斷。行業競爭的焦點,正從擁有多少算力,轉向每元錢、每瓦電力究竟能生產多少可用Token。魔形智慧提供了一個頗具代表性的商業樣本。該公司目前每天賣出的Token已經達到數萬億級,收入已達數億元,客戶及合作伙伴包括網際網路頭部企業、大模型廠商等大B企業。其部分模型已經實現盈虧平衡,整體業務正在向規模化盈利靠近。
開源模型提供了共同的原料,高效部署則決定工廠之間的產量、質量和利潤。今年初不到三個月,魔形智慧稱其業務完成了“從1到10”的擴張。Token超級工廠為何突然得到資本追捧?熱門概念怎樣變成一門可以持續增長的生意?人人都能部署開源模型,真正的產業門檻又藏在哪裡?為了探討這些問題,智東西與魔形智慧兩位創始人——CEO徐凌傑、CTO金琛進行了一次深入對話。
Token工廠的走紅,首先源於推理需求的快速膨脹。過去一年,國內開源模型從少數頭部產品一枝獨秀,轉向多家廠商密集釋出。模型能力持續增強,AI程式設計、辦公智慧體等應用也開始進入企業生產流程。模型越好用,消耗的Token越多。徐凌傑告訴智東西,從行業公開資料和魔形智慧自己的業務變化看,Token需求在半年多時間裡經歷了數倍乃至數量級增長。尤其是AI程式設計,已經成為國內外都較為確定的商業方向,Agent對模型的高頻、連續呼叫,又進一步放大了推理需求。“對於Token工廠來說,幾乎每半年都需要實現數倍甚至一個數量級的規模提升。如果沒有這樣的加速度,公司很可能會落後於市場。”徐凌傑說。
這也是魔形智慧連續融資的產業背景。魔形智慧今年5月對外公佈Pre-A輪融資,但該輪融資實際在春節前已經確定。春節之後的幾個月裡,公司的業務又向前跨了一步。徐凌傑將春節前的階段稱為“從0到1”。公司通過技術能力獲得首批大客戶認可,驗證了Token可以作為AI算力的高階產品形態進行大規模售賣,也更確信了能把這套商業模式做大做強。此後的“從1到10”,意味著客戶和業務面同時擴張。魔形智慧開始從一個客戶拓展到多個客戶,在同一客戶內部,又從單個模型延伸到多個模型、多個業務場景。隨著公司增加算力投入,Token銷量和收入同步上升,並出現了營收增速快於算力投入增速的跡象。“我們投入了更多資源,業務帶來了相應比例甚至超比例的增長。投資人關心的核心問題,是資本投入能否帶來更高的回報。”徐凌傑告訴智東西。
新股東的結構也釋放出另一層訊號。多家戰略資源方入局,意味著魔形智慧獲得的不只有財務資金,還可能包括算力、資料中心和區域產業資源。老股東超比例跟投,則體現了早期投資者對公司下一階段增長的預期。融來的錢很快將變成Token產能。據悉,魔形智慧計劃繼續擴充算力資源和技術團隊,迭代自研推理引擎,推進國產超節點及相關硬體研發,同時覆蓋更多開源模型和AI算力晶片的組合。公司下一個目標,是將日均Token產量推向10萬億級。
開源模型的繁榮擴大了Token工廠的市場,也重新劃定了產業分工。模型權重越容易獲得,單純“擁有模型”的稀缺性越低。資本開始把注意力投向模型之後的生產環節,誰能把相同模型執行得更快、更穩、更便宜,誰就更有機會獲得客戶和利潤。這也是魔形智慧三個月內連續完成融資的底層邏輯。
開源模型讓Token生產的原料變得更加充足,卻沒有自動解決生產效率問題。一家企業擁有伺服器和GPU,可以從開源社群下載模型,也可以使用通用推理框架將模型執行起來。但模型成功啟動,只代表能夠生產Token,距離把Token穩定賣給大客戶還有很長一段路。魔形智慧將開源模型、自研推理引擎、算力硬體和運營系統組合起來,再把底層複雜性封裝成企業能夠直接呼叫的Token產品。魔形智慧披露的日均數萬億Token,指客戶已經呼叫併產生收入的實際用量,並非部署完成後的理論產能。按照目前業務增速,公司2026年營收預計將達到數億元。
其市場策略是先服務大B客戶。大型網際網路企業對穩定性和效能的要求極高,供應商通常要經過多輪測試,才能進入正式生產環境。一旦服務質量得到驗證,客戶可能增加採購份額,並將更多模型和業務遷移到同一平台。“從0到1,是用技術實力獲得客戶認可,把商業模式走通。從1到10,是我們有了多個客戶,並且能在一個客戶內部持續擴充套件模型和業務。”徐凌傑告訴智東西。魔形智慧的Token已經進入部分網際網路企業的核心業務,主要用於研發團隊的日常工作、AI程式設計及內部辦公流程。金琛告訴智東西,科技網際網路公司的核心生產力很大一部分來自開發者。Token服務進入開發者的程式設計工具和研發流程,相當於直接支撐企業核心團隊的日常生產。
這類客戶對價格敏感,但質量排在價格之前。首先要守住介面成功率。AI程式設計和白領辦公集中發生在工作時間,一旦介面頻繁失敗,工具就很難真正進入工作流。其次是首Token延遲和解碼速度。如果模型遲遲沒有響應,或者生成速度跟不上人的閱讀和操作節奏,使用效率會大幅下降。金琛認為,首Token延遲超過3秒,很多企業客戶已經難以接受。P50和P99延遲、KV Cache命中率、併發吞吐、模型精度,以及突發流量下的穩定性,也會影響客戶選擇。“質量要求滿足之後,雙方才會進一步談價效比。”徐凌傑說。
以某些公開的專案為例,有人使用80張桌面顯示卡執行最新的大模型,單路速度只能達到每秒20個Token。模型雖然跑起來了,速度難以滿足商業場景要求,成本也很難支撐有競爭力的Token價格。這正是Token生意的關鍵。在部分業務場景中,算力採購和執行成本可以佔Token總成本的八成甚至九成。選擇哪種硬體執行哪種模型,怎樣切分Prefill和Decode任務,如何提高單機吞吐和叢集利用率,都會直接改變毛利。魔形智慧目前已有相當比例的模型已經達到盈虧平衡。模型受歡迎程度也會影響盈利水平。呼叫率高的模型可以充分利用算力,利用率較低的模型則更容易形成閒置。
徐凌傑在採訪中對魔形智慧的盈利預期保持樂觀。他表示,國產算力晶片、國產AI基礎設施、國產大模型已經進入了協同發展的階段,國產生態的良性迴圈已經形成。通過堅定投入國產生態,他們已經獲得了可觀的收入。此外,他認為,AI基礎設施企業只有採取穩健的擴張策略,注重資本效率,迅速實現自我造血,才能支撐起百億營收、千億市值的成功企業。
Token工廠與傳統算力租賃、大模型API平台究竟有什麼區別?徐凌傑認為,真正的差異來自全棧系統最佳化能力。“模型是開源的,模型的高效部署方式並不會全部開源。”他說,簡單採購硬體並部署通用框架,往往很難實現盈利。Token吞吐、響應延遲、穩定性和硬體成本需要同時最佳化,這要求團隊同時理解模型、軟體、晶片、叢集和供應鏈。
第一層門檻是推理引擎。魔形智慧圍繞Prefill和Decode分離、資料傳輸、記憶體管理、負載均衡、KV Cache感知排程及多硬體適配進行最佳化。不同模型的負載特徵差異明顯。有的模型更依賴視訊記憶體頻寬,有的更依賴計算能力。長輸入短輸出和短輸入長輸出的成本結構也不同。Decode階段通常更難提升利用率,短輸入、長輸出任務的單位成本往往更高。魔形智慧會根據模型特點選擇不同硬體,也會將不同的計算任務部署到成本最合適的晶片上。其PD分離方案可以適配不同卡型和叢集規模,排程系統則結合KV Cache狀態和即時負載分配請求,儘量提高快取命中率。對於企業客戶,彈性同樣重要。客戶不願為一個模型同時接入大量供應商,因此供應商既要具備足夠大的初始容量,也要在需求突然上升時快速擴容。新模型釋出後,魔形智慧往往一至兩天、甚至Day0就可以啟動客戶接入。在引入國產晶片時,魔形智慧團隊會深入分析硬體架構、遷移運算元並跑出效能,迅速完成部署。
第二層門檻是超節點。隨著模型引數和Agent任務複雜度增長,單機八卡伺服器逐漸遇到視訊記憶體容量和卡間通訊瓶頸。超節點將更多加速晶片通過高頻寬、低時延互聯組織起來,可以承載更大規模的平行計算。金琛告訴智東西,人機互動場景達到每秒100至200個Token,已經能提供較流暢的體驗。複雜Agent需要連續規劃、呼叫工具和執行任務,未來可能追求每秒上千Token的生成速度。“要面向Agent場景做極致最佳化,超節點是必須研究的硬體平台。我們的目標是達到每秒千Token。”金琛說。魔形智慧目前已有部分模型達到每秒數百Token,每秒千Token仍處於攻關階段。
更強的互聯也會帶來新的問題。傳統八卡伺服器中,一張卡發生故障,影響範圍通常侷限在單台機器。到了數十卡乃至更大規模的超節點,一顆晶片發生故障,可能干擾整個互聯域,金琛將其稱為更大的“爆炸半徑”。因此,超節點的競爭既要拼極致效能,也要拼故障隔離和容錯能力。魔形智慧已經圍繞相關問題推出部分PoC產品,並在真實客戶負載中持續驗證。“很多實驗室裡的最佳化可以宣稱提升40%、50%,甚至兩三倍,但放到真實業務中未必能夠落地。”金琛告訴智東西,“我們有客戶和真實場景,可以直接找到最尖銳的問題,再用較小的代價解決它。”
第三層門檻是軟硬體協同。魔形智慧已經適配多家國產及海外晶片,同時與晶片廠商、AIDC、能源和冷卻方案夥伴共同推進定製硬體。隨著模型繼續變大,硬體採購、互聯、液冷和系統整合能力對Token成本的影響還會提高。這與徐凌傑過去20年的經歷有關。從輝達、AMD到阿里雲GPU基礎設施、壁仞科技,再到創辦魔形智慧,他長期處於晶片、系統和雲端計算交叉地帶。金琛則擁有高效能運算、晶片軟體棧和推理最佳化經驗。
徐凌傑將公司的技術演進總結為三個階段:從0到1主要依靠軟體最佳化,從1到10依靠規模落地和精細運營能力,長期競爭則要落在軟硬體全棧協同上。下一階段,快取系統可能成為新的降本重點。長上下文和Agent任務中,大量輸入內容會被重複使用。相比每次重新計算,將高頻內容寫入快取並提高命中率,可以明顯降低算力消耗。硬體選型、模型路由和超節點架構創新,則會繼續提高單位機器的有效Token產量。模型越大,並行規模越高,超節點的價值也會越明顯。
徐凌傑總結道,全球AI產業的競爭格局已經從單純的模型競賽轉向實際應用部署能力的比拼,作為智慧時代的基礎生產要素,Token生產能力正在成為衡量每個國家AI產業發展水平和競爭力的關鍵指標。未來基於超節點硬體叢集和軟硬體協同最佳化的算力基礎設施將會呈現完全不同的技術範式與市場格局,而牽引這一變革正是魔形智慧的願景與責任所在。
開源模型降低了AI應用的起點,也把競爭推向了更深的基礎設施層。之前,客戶購買伺服器、GPU卡時或算力叢集,而如今他們更希望直接獲得可呼叫、可計量、質量穩定的Token。評價一家Token工廠的標準也隨之改變。它擁有多少張卡依然重要,更重要的是,在相同成本、功耗和服務質量下,這些卡究竟能夠生產多少有效Token。魔形智慧已經完成了第一階段驗證。日均數萬億Token實際銷量、頭部客戶和數億元收入,說明Token可以被加工成一門規模化生意。接下來的考驗仍然具有挑戰。當日均產量邁向10萬億級,模型數量、硬體型別和客戶負載將同步增加。公司能否繼續守住成功率、延遲、成本和穩定性,決定其商業閉環能否持續放大。徐凌傑希望,魔形智慧最終成為一家軟硬體全棧的AI基礎設施公司,在Token供應和超節點產業鏈中同時佔據關鍵位置。Token超級工廠的競爭,已經越過了爭奪概念定義權的階段。真正的較量,是誰能把工廠穩定地開起來,並讓每一台機器持續產出可銷售的智慧。