读懂AI时代 Read AI Time读懂AI时代 Read AI Time繁體

订阅《读懂AI时代》

每早 8 点一封,昨天 AI 圈大事一次读完。免费。

过去十几年,AI 之所以突飞猛进,底层是三件东西在指数级变大:训练用的算力、模型的参数量、喂进去的数据量。这也是「规模定律」和这轮 AI 资本开支狂飙的底层逻辑。 下图收录了 535 个知名 AI 模型——单看训练算力,从最早的神经网络到当下的前沿大模型,已增长约 25 个数量级(1025 倍)。以下只陈述已公开的客观数据,不预测、不构成任何投资建议。

训练算力趋势

训练一个模型消耗的总计算量(浮点运算次数,10^15 FLOP = 1 petaFLOP)。纵轴为对数刻度——每上一格代表大 10 倍。 最新的前沿模型训练算力已达约 5.0×10¹¹ petaFLOP 量级。

10⁻¹²10⁻⁸10⁻⁴110⁴10⁸10¹²1960198020002020发布年份训练算力(petaFLOP,对数轴)Theseus|1950|4.0×10^-14 petaFLOPPerceptron Mark I|1957|6.9×10^-10 petaFLOPPandemonium (morse)|1959|6.0×10^-7 petaFLOPSamuel Neural Checkers|1959|4.3×10^-7 petaFLOPPerceptron (1960)|1960|7.2×10^-7 petaFLOPADALINE|1960|6.6×10^-12 petaFLOPLinear Decision Functions|1962|1.6×10^-9 petaFLOPPrint Recognition Logic|1963|2.2×10^-8 petaFLOPHeuristic Reinforcement Learning|1965|1.1×10^-9 petaFLOPLTE speaker verification system|1966|1.1×10^-7 petaFLOPCognitron|1975|5.2×10^-9 petaFLOPNeocognitron|1980|2.7×10^-7 petaFLOPASE+ACE|1983|3.2×10^-7 petaFLOPDistributed representation NN|1986|3.9×10^-7 petaFLOPMLP with back-propagation|1986|6.7×10^-7 petaFLOPNetTalk (dictionary)|1987|2.8×10^-5 petaFLOPNetTalk (transcription)|1987|2.8×10^-5 petaFLOPTranslation-invariant MLP|1987|1.8×10^-5 petaFLOPMLN-ASR|1988|3.0×10^-7 petaFLOPInvariant image recognition|1989|2.7×10^-5 petaFLOPHandwritten digit recognition network|1989|1.8×10^-4 petaFLOPSpeaker-independent vowel classification|1989|7.5×10^-6 petaFLOPZip CNN|1989|1.5×10^-3 petaFLOPNETtalk reimplementation|1990|3.6×10^-5 petaFLOPBankruptcy-NN|1990|3.1×10^-6 petaFLOPSexNet compression|1990|7.9×10^-5 petaFLOPWeight Decay|1991|7.6×10^-5 petaFLOPTD-Gammon|1992|1.8×10^-2 petaFLOPCancer drug mechanism prediction|1992|5.4×10^-8 petaFLOPSiamese-TDNN|1993|1.3×10^-2 petaFLOPANN Eye Tracker|1993|1.7×10^-5 petaFLOPCeramic-MLP|1994|4.5×10^-6 petaFLOPJPMAX|1994|8.1×10^-8 petaFLOPMixture of linear models|1994|4.5×10^-4 petaFLOPNeuroChess|1994|8.6×10^-4 petaFLOPPredictive Coding NN|1994|1.9×10^-2 petaFLOPLISSOM|1995|2.0×10^-4 petaFLOPMUSIC perceptron|1996|8.8×10^-4 petaFLOPSystem 11|1996|2.6×10^-5 petaFLOPSOM-CNN|1997|3.1×10^-5 petaFLOPLSTM|1997|3.2×10^-2 petaFLOPLeNet-5|1998|2.8×10^-3 petaFLOPRECONTRA-categorized|1999|8.0×10^-3 petaFLOPRECONTRA-uncategorized|1999|3.9×10^-3 petaFLOPNeural LM|2000|6.3×10^0 petaFLOPPoE MNIST|2000|5.2×10^-2 petaFLOPDecision tree (classification)|2001|6.3×10^-2 petaFLOPNPLM (AP News)|2003|1.7×10^0 petaFLOPNPLM (Brown)|2003|1.3×10^-1 petaFLOPInvariant CNN|2004|9.7×10^-4 petaFLOPLMICA|2004|2.8×10^0 petaFLOPHierarchical LM|2005|1.2×10^-1 petaFLOPRankNet|2005|3.5×10^-3 petaFLOPSVM-CNN|2006|7.4×10^-1 petaFLOPKN-LM|2007|7.7×10^2 petaFLOPSB-LM|2007|1.5×10^3 petaFLOPGNN|2008|1.6×10^-6 petaFLOPGPU DBNs|2009|1.0×10^0 petaFLOPTwo Stage Feature Extraction (MNIST)|2009|2.1×10^-2 petaFLOPLCNP LabelMe|2009|3.3×10^0 petaFLOPLCNP MNIST|2009|4.2×10^0 petaFLOPLCNP NORB|2009|2.5×10^0 petaFLOPFeedforward NN|2010|3.5×10^-1 petaFLOPiCCCP|2010|1.1×10^0 petaFLOPPooling CNN (Caltech 101)|2010|1.2×10^0 petaFLOPPooling CNN (NORB)|2010|1.5×10^0 petaFLOPRNN LM|2010|5.4×10^1 petaFLOPDeep Autoencoders|2011|3.7×10^1 petaFLOPHigh Performance CNN (NORB)|2011|2.6×10^1 petaFLOPCNN Committee (MNIST)|2011|5.2×10^1 petaFLOPCNN Committee (NIST)|2011|2.6×10^1 petaFLOPCNN committee (traffic sign)|2011|9.9×10^-1 petaFLOPDropout (CIFAR)|2012|4.3×10^0 petaFLOPDropout (ImageNet)|2012|2.7×10^2 petaFLOPDropout (MNIST)|2012|6.0×10^0 petaFLOPUnsupervised High-level Feature Learner|2012|6.0×10^2 petaFLOPLSTM LM|2012|1.7×10^1 petaFLOPAlexNet|2012|4.7×10^2 petaFLOPDNN EM segmentation|2012|4.8×10^2 petaFLOPDistBelief Speech|2012|3.1×10^2 petaFLOPDistBelief NNLM|2013|2.6×10^3 petaFLOPReLU-Speech|2013|1.3×10^2 petaFLOPHierarchical Scene Labeling (Stanford Background)|2013|2.4×10^2 petaFLOPRCTM|2013|9.3×10^0 petaFLOPRNTN|2013|1.4×10^1 petaFLOPWord2Vec (large)|2013|3.9×10^1 petaFLOPVisualizing CNNs|2013|5.3×10^2 petaFLOPTransE|2013|1.3×10^3 petaFLOPDQN|2013|2.9×10^0 petaFLOPImage generation|2013|4.7×10^-1 petaFLOPGANs|2014|5.2×10^2 petaFLOPSPPNet|2014|3.4×10^3 petaFLOPSmooCT|2014|6.9×10^1 petaFLOPACF-WIDER|2014|7.6×10^-2 petaFLOPRNNsearch-50*|2014|1.6×10^3 petaFLOPVGG16|2014|1.2×10^4 petaFLOPVGG19|2014|1.1×10^4 petaFLOPSeq2Seq LSTM|2014|5.6×10^4 petaFLOPSPN-4+KN5|2014|4.4×10^1 petaFLOPGoogLeNet / InceptionV1|2014|1.5×10^3 petaFLOPTA-CNN|2014|1.1×10^1 petaFLOPSNM-skip|2014|3.0×10^5 petaFLOPFractional Max-Pooling|2014|1.0×10^2 petaFLOPADAM (CIFAR-10)|2014|6.3×10^-1 petaFLOPMSRA (C, PReLU)|2015|2.4×10^4 petaFLOPgenCNN + dyn eval|2015|3.4×10^1 petaFLOPTC-DNN-BLSTM-DNN|2015|1.9×10^2 petaFLOPU-Net|2015|5.1×10^1 petaFLOPDCNN|2015|4.8×10^2 petaFLOPAlphaGo Fan|2015|3.8×10^5 petaFLOPSAF R-CNN|2015|1.2×10^4 petaFLOPInception v3|2015|1.0×10^5 petaFLOPResNet-101 (ImageNet)|2015|7.0×10^3 petaFLOPResNet-152 (ImageNet)|2015|1.0×10^4 petaFLOPVariational (untied weights, MC) LSTM (Large)|2015|5.9×10^0 petaFLOPAlphaGo Lee|2016|1.9×10^6 petaFLOPNamed Entity Recognition model|2016|9.7×10^1 petaFLOPR-FCN|2016|7.2×10^2 petaFLOPResNet-200|2016|3.0×10^4 petaFLOPGNMT|2016|6.6×10^6 petaFLOPPointer Sentinel-LSTM (medium)|2016|7.5×10^0 petaFLOPXception|2016|4.4×10^5 petaFLOPSPIDER2|2016|1.8×10^1 petaFLOPBIDAF|2016|3.5×10^3 petaFLOPNAS with base 8 and shared embeddings|2016|1.1×10^1 petaFLOPNASv3 (CIFAR-10)|2016|2.2×10^6 petaFLOPVD-LSTM+REAL Large|2016|2.1×10^1 petaFLOPResNeXt-101 (64×4d)|2016|1.2×10^4 petaFLOPPolyNet|2016|6.4×10^4 petaFLOPHR-ResNet101|2016|7.1×10^3 petaFLOPEnhanceNet|2016|1.3×10^2 petaFLOPDeepStack|2017|1.5×10^4 petaFLOPMoE-Multi|2017|9.4×10^4 petaFLOPTransformer (2017)|2017|7.4×10^3 petaFLOPDeepLoc|2017|5.8×10^2 petaFLOPJFT|2017|8.4×10^5 petaFLOPConvS2S (ensemble of 8 models)|2017|5.6×10^4 petaFLOPAWD-LSTM - 3-layer LSTM (tied) + continuous cache pointer (WT2)|2017|3.0×10^2 petaFLOPRetinaNet-R101|2017|2.1×10^3 petaFLOPOpenAI TI7 DOTA 1v1|2017|6.1×10^5 petaFLOPEI-REHN-1000D|2017|1.1×10^1 petaFLOPLibratus|2017|5.5×10^5 petaFLOPGL-LWGC-AWD-MoS-LSTM + dynamic evaluation (WT2)|2017|4.6×10^2 petaFLOPPyramidNet|2017|2.3×10^0 petaFLOPISS|2017|3.4×10^0 petaFLOPAWD-LSTM+WT+Cache+IOG (WT2)|2017|3.2×10^0 petaFLOPAlphaGo Zero|2017|6.5×10^5 petaFLOPAlphaGo Master|2017|3.4×10^5 petaFLOPFraternal dropout + AWD-LSTM 3-layer (WT2)|2017|3.1×10^2 petaFLOPAWD-LSTM-MoS + dynamic evaluation (WT2, 2017)|2017|3.4×10^3 petaFLOPAlphaZero|2017|1.1×10^5 petaFLOPELMo|2018|3.3×10^0 petaFLOPQRNN|2018|6.9×10^2 petaFLOPIMPALA|2018|1.7×10^5 petaFLOP4 layer QRNN (h=2500)|2018|5.9×10^2 petaFLOPYOLOv3|2018|1.3×10^4 petaFLOPDropout-LSTM+Noise(Bernoulli) (WT2)|2018|1.3×10^2 petaFLOPResNeXt-101 32x48d|2018|8.7×10^6 petaFLOPaLSTM(depth-2)+RecurrentPolicy (WT2)|2018|7.3×10^1 petaFLOPGPT-1|2018|1.8×10^4 petaFLOPFTW (For The Win)|2018|3.5×10^4 petaFLOPBig-Little Net|2018|2.5×10^2 petaFLOPBig-Little Net (speech)|2018|4.3×10^2 petaFLOPBig Transformer for Back-Translation|2018|4.8×10^5 petaFLOP(ensemble): AWD-LSTM-DOC (fin) × 5 (WT2)|2018|6.7×10^2 petaFLOPTransformer + Simple Recurrent Unit|2018|1.1×10^4 petaFLOPLSTM+NeuralCache|2018|9.8×10^-1 petaFLOPTransformer (Adaptive Input Embeddings) WT103|2018|4.5×10^4 petaFLOPBERT-Large|2018|2.9×10^5 petaFLOPTrellisNet|2018|2.8×10^3 petaFLOPMesh-TensorFlow Transformer 2.9B (translation)|2018|6.8×10^4 petaFLOPMesh-TensorFlow Transformer 4.9B (language)|2018|1.6×10^5 petaFLOPFine-tuned-AWD-LSTM-DOC (fin)|2018|5.2×10^1 petaFLOPMulti-cell LSTM|2018|2.0×10^0 petaFLOPStyleGAN|2018|3.9×10^1 petaFLOPTransformer-XL (257M)|2019|3.8×10^5 petaFLOPHanabi 4 player|2019|4.3×10^3 petaFLOPGPT-2 (1.5B)|2019|1.9×10^6 petaFLOPKataGo|2019|2.3×10^4 petaFLOPSciBERT|2019|8.9×10^4 petaFLOPCross-lingual alignment|2019|2.6×10^3 petaFLOPWeNet (Penn Treebank)|2019|7.3×10^2 petaFLOPBERT-Large-CAS (PTB+WT2+WT103)|2019|1.5×10^5 petaFLOPMuseNet|2019|2.2×10^5 petaFLOPAWD-LSTM-DRILL + dynamic evaluation† (WT2)|2019|4.1×10^2 petaFLOPDLRM-2020|2019|4.0×10^3 petaFLOPXLNet|2019|6.2×10^6 petaFLOPTransformer-XL Large + Phrase Induction|2019|3.8×10^5 petaFLOPAWD-LSTM + MoS + Partial Shuffled|2019|3.2×10^2 petaFLOPRoBERTa Large|2019|8.5×10^6 petaFLOPPluribus|2019|6.6×10^1 petaFLOPtrRosetta|2019|3.8×10^4 petaFLOPUDSMProt|2019|6.4×10^2 petaFLOPMegatron-BERT|2019|2.2×10^7 petaFLOPMegatron-LM (1.2B)|2019|1.1×10^6 petaFLOPMegatron-LM (8.3B)|2019|9.1×10^6 petaFLOPAlphaX-1|2019|8.9×10^2 petaFLOPDistilBERT|2019|1.2×10^4 petaFLOPT5-11B|2019|3.3×10^7 petaFLOPT5-3B|2019|9.0×10^6 petaFLOPAlphaStar|2019|1.1×10^8 petaFLOPBase LM + kNN LM + Continuous Cache|2019|3.1×10^4 petaFLOPXLM-RoBERTa|2019|2.1×10^7 petaFLOPCamemBERT|2019|8.3×10^5 petaFLOPNoisy Student (L2)|2019|2.6×10^7 petaFLOPSandwich Transformer|2019|2.4×10^4 petaFLOPMuZero|2019|4.8×10^4 petaFLOPTransformer-XL DeFINE (141M)|2019|1.7×10^3 petaFLOPMMLSTM (PTB)|2019|5.8×10^1 petaFLOPMMLSTM (WT-2)|2019|1.9×10^2 petaFLOPOpenAI Five|2019|6.7×10^7 petaFLOPOpenAI Five Rerun|2019|1.3×10^7 petaFLOPDD-PPO|2019|7.8×10^5 petaFLOPAlphaFold|2020|1.0×10^5 petaFLOPContextNet + Noisy Student|2020|8.2×10^6 petaFLOPMeena|2020|1.1×10^8 petaFLOPTaLK Convolution|2020|2.7×10^4 petaFLOPALBERT-xxlarge|2020|2.4×10^6 petaFLOPFFN SwiGLU|2020|3.4×10^4 petaFLOPTuring-NLG|2020|1.6×10^7 petaFLOPFeedback Transformer|2020|7.7×10^3 petaFLOPTransformerXL + spectrum control|2020|2.6×10^4 petaFLOPTensor-Transformer(1core)+PN (WT103)|2020|1.6×10^3 petaFLOPELECTRA|2020|3.1×10^6 petaFLOPMetNet|2020|9.5×10^3 petaFLOPOnce for All|2020|6.2×10^5 petaFLOPUnifiedQA|2020|1.7×10^4 petaFLOPDETR|2020|4.0×10^5 petaFLOPGPT-3 175B (davinci)|2020|3.1×10^8 petaFLOPGShard (dense)|2020|4.8×10^7 petaFLOPDeLighT|2020|3.8×10^3 petaFLOPERNIE-GEN (large)|2020|2.0×10^5 petaFLOPProBERTa|2020|9.7×10^3 petaFLOPLUKE|2020|1.8×10^7 petaFLOPConformer + Wav2vec 2.0 + Noisy Student|2020|7.6×10^6 petaFLOPGerman ELECTRA Large|2020|1.4×10^6 petaFLOPmT5-XXL|2020|8.2×10^7 petaFLOPViT-Huge/14|2020|4.3×10^6 petaFLOPwave2vec 2.0 LARGE|2020|3.9×10^6 petaFLOPKEPLER|2020|1.7×10^6 petaFLOPAlphaFold 2|2020|3.0×10^6 petaFLOPCPM-Large|2020|2.6×10^5 petaFLOPESM1b|2020|5.1×10^6 petaFLOPCT-MoS (WT2)|2020|5.4×10^2 petaFLOPDensePhrases|2020|2.1×10^3 petaFLOPERNIE-Doc (247M)|2021|3.0×10^4 petaFLOPCLIP (ViT L/14@336px)|2021|1.1×10^7 petaFLOPDALL-E|2021|4.7×10^7 petaFLOPSwitch|2021|8.2×10^7 petaFLOPDeiT-B|2021|7.9×10^4 petaFLOPDLWP|2021|5.7×10^3 petaFLOPMSA Transformer|2021|5.5×10^6 petaFLOPSRU++ Large|2021|2.1×10^4 petaFLOPMeta Pseudo Labels|2021|4.8×10^7 petaFLOPGenerative BST|2021|1.4×10^7 petaFLOPM6-T|2021|5.5×10^6 petaFLOPPLUG|2021|3.6×10^7 petaFLOPProtBERT-BFD|2021|3.9×10^7 petaFLOPProtT5-XL-U50|2021|1.9×10^7 petaFLOPADM|2021|6.2×10^6 petaFLOPMedBERT|2021|9.5×10^3 petaFLOPByT5-XXL|2021|8.1×10^7 petaFLOPCogView|2021|2.7×10^7 petaFLOPTransformer local-attention (NesT-B)|2021|2.4×10^4 petaFLOPViT-G/14|2021|5.8×10^7 petaFLOPALIGN|2021|2.6×10^7 petaFLOPCoAtNet|2021|4.3×10^7 petaFLOPDeBERTa|2021|2.6×10^7 petaFLOPDenoising Diffusion Probabilistic Models (LSUN Bedroom)|2021|7.8×10^4 petaFLOPEMDR|2021|1.9×10^6 petaFLOPEfficientNetV2-XL|2021|9.6×10^4 petaFLOPStyleGAN3-R|2021|2.4×10^6 petaFLOPStyleGAN3-T|2021|1.7×10^6 petaFLOPFold2Seq|2021|1.4×10^2 petaFLOPAdaptive Input Transformer + RD|2021|8.6×10^4 petaFLOPCodex|2021|7.3×10^7 petaFLOPERNIE 3.0|2021|2.3×10^7 petaFLOPGOAT|2021|2.4×10^7 petaFLOPHuBERT|2021|5.5×10^6 petaFLOPSEER|2021|1.8×10^7 petaFLOPYOLOX-X|2021|6.3×10^5 petaFLOPJurassic-1-Jumbo|2021|3.7×10^8 petaFLOPZidong Taichu|2021|8.0×10^5 petaFLOPDNABERT|2021|1.1×10^5 petaFLOPXLMR-XXL|2021|3.4×10^7 petaFLOPFLAN 137B|2021|2.1×10^9 petaFLOPPermuteFormer|2021|2.8×10^3 petaFLOPHyperCLOVA 204B|2021|2.0×10^8 petaFLOPPLATO-XL|2021|9.9×10^6 petaFLOPTuring ULRv5|2021|2.9×10^7 petaFLOPAlphaFold-Multimer|2021|4.4×10^6 petaFLOPMegatron-Turing NLG 530B|2021|8.6×10^8 petaFLOPYuan 1.0|2021|3.5×10^8 petaFLOPbase LM+GNN+kNN|2021|5.3×10^4 petaFLOPCodeT5-base|2021|1.6×10^6 petaFLOPProjected GAN|2021|1.1×10^4 petaFLOPS4|2021|7.8×10^4 petaFLOPMasked Autoencoders ViT-H|2021|4.6×10^5 petaFLOPBASIC-L|2021|4.1×10^7 petaFLOPSwin Transformer V2 (SwinV2-G)|2021|1.1×10^6 petaFLOPFlorence|2021|4.8×10^7 petaFLOPNÜWA|2021|7.3×10^6 petaFLOPGopher (280B)|2021|6.3×10^8 petaFLOPStudent of Games|2021|3.7×10^7 petaFLOPGLaM|2021|3.6×10^8 petaFLOPContriever|2021|1.6×10^5 petaFLOPXGLM-7.5B|2021|2.3×10^7 petaFLOPERNIE 3.0 Titan|2021|1.0×10^9 petaFLOPDetic|2022|2.3×10^4 petaFLOPInstructGPT 175B|2022|3.2×10^8 petaFLOPAlphaCode|2022|2.4×10^8 petaFLOPRETRO-7B|2022|1.7×10^7 petaFLOPGPT-NeoX-20B|2022|9.3×10^7 petaFLOPLaMDA|2022|3.6×10^8 petaFLOPProteinBERT|2022|6.5×10^4 petaFLOPST-MoE|2022|2.9×10^8 petaFLOPFourCastNet|2022|3.5×10^5 petaFLOPPolyCoder|2022|1.1×10^6 petaFLOPStatement Curriculum Learning|2022|1.8×10^7 petaFLOPViT-G (model soup)|2022|3.4×10^6 petaFLOPGPT-3.5 (davinci-002)|2022|2.6×10^9 petaFLOPMake-A-Scene|2022|6.4×10^6 petaFLOPSegatron-XL large, M=384 + HCP|2022|2.7×10^4 petaFLOPChinchilla|2022|5.8×10^8 petaFLOPPaLM (540B)|2022|2.5×10^9 petaFLOPBERT-RBP|2022|1.4×10^5 petaFLOPDALL·E 2|2022|3.4×10^8 petaFLOPSparse all-MLP|2022|5.3×10^5 petaFLOPStable Diffusion (LDM-KL-8-G)|2022|5.0×10^7 petaFLOPFlamingo|2022|2.2×10^8 petaFLOPOPT-175B|2022|4.3×10^8 petaFLOPUL2|2022|1.2×10^8 petaFLOPGato|2022|4.0×10^6 petaFLOPImagen|2022|1.5×10^7 petaFLOPGPT-2 Medium (FlashAttention)|2022|8.9×10^5 petaFLOPTranception|2022|7.2×10^6 petaFLOPDITTO|2022|3.3×10^3 petaFLOPCoCa|2022|7.3×10^7 petaFLOPParti|2022|5.1×10^8 petaFLOPProGen2-xlarge|2022|1.3×10^7 petaFLOPMinerva (540B)|2022|2.7×10^9 petaFLOPCodeT5-large|2022|2.7×10^6 petaFLOPNLLB|2022|1.8×10^7 petaFLOPBLOOM-176B|2022|3.7×10^8 petaFLOPESM2-15B|2022|7.4×10^7 petaFLOPOmegaPLM|2022|1.0×10^7 petaFLOPAlexaTM 20B|2022|2.0×10^8 petaFLOPGLM-130B|2022|3.6×10^8 petaFLOPBlenderBot 3|2022|4.3×10^8 petaFLOPBEIT-3|2022|7.0×10^4 petaFLOPPaLI|2022|1.7×10^8 petaFLOPWhisper|2022|4.2×10^6 petaFLOPAlphaTensor|2022|7.1×10^5 petaFLOPDiffDock|2022|7.2×10^4 petaFLOPGenSLM|2022|1.4×10^6 petaFLOPFlan-PaLM 540B|2022|2.5×10^9 petaFLOPU-PaLM (540B)|2022|2.5×10^9 petaFLOPMogrifier RLSTM (WT2)|2022|1.4×10^2 petaFLOPeDiff-I|2022|5.5×10^4 petaFLOPInternImage|2022|2.4×10^6 petaFLOPEVA-01|2022|1.5×10^7 petaFLOPGalactica|2022|3.2×10^8 petaFLOPAR-LDM|2022|5.1×10^5 petaFLOPFusion in Encoder|2022|1.3×10^5 petaFLOPDiscriminator Guidance|2022|2.2×10^5 petaFLOPVega v2|2022|7.8×10^7 petaFLOPCaLM|2022|2.9×10^4 petaFLOPHybrid H3-2.7B|2022|6.5×10^6 petaFLOPVALL-E|2023|1.0×10^4 petaFLOPDreamerV3|2023|2.2×10^5 petaFLOPAnkh_large|2023|6.5×10^6 petaFLOPNucleotide Transformer|2023|8.1×10^6 petaFLOPDDPM-IP (CelebA)|2023|3.5×10^5 petaFLOPBLIP-2 (Q-Former)|2023|1.2×10^6 petaFLOPViT-22B|2023|1.9×10^8 petaFLOPLLaMA-65B|2023|5.5×10^8 petaFLOPDiT-XL/2|2023|6.0×10^5 petaFLOPAudioGen|2023|9.5×10^6 petaFLOPFalcon-40B|2023|2.4×10^8 petaFLOPGPT-4 (Mar 2023)|2023|2.1×10^10 petaFLOPPanGu-Σ|2023|4.7×10^8 petaFLOPSigLIP 400M|2023|5.0×10^6 petaFLOPBloombergGPT|2023|2.4×10^8 petaFLOPVideoMAE V2|2023|9.7×10^6 petaFLOPSegment Anything Model|2023|7.8×10^6 petaFLOPIncoder-6.7B|2023|3.0×10^6 petaFLOPDINOv2|2023|7.4×10^6 petaFLOPLLaVA|2023|7.8×10^7 petaFLOPPaLM 2|2023|7.3×10^9 petaFLOPStarCoder|2023|8.5×10^7 petaFLOPInstructBLIP|2023|1.9×10^5 petaFLOPONE-PEACE|2023|1.8×10^5 petaFLOPPaLI-X|2023|5.6×10^8 petaFLOPGPT-4 (Jun 2023)|2023|2.1×10^10 petaFLOPHyenaDNA|2023|1.8×10^6 petaFLOPInternLM|2023|1.0×10^9 petaFLOPPangu-Weather|2023|4.0×10^7 petaFLOPxTrimoPGLM -100B|2023|6.2×10^8 petaFLOPClaude 2|2023|3.9×10^9 petaFLOPLlama 2-70B|2023|8.1×10^8 petaFLOPLlama 2-7B|2023|8.4×10^7 petaFLOPAudioLM|2023|3.9×10^3 petaFLOPGGNN|2023|7.6×10^6 petaFLOPPeptideBERT|2023|4.9×10^1 petaFLOPJais|2023|4.9×10^7 petaFLOPSwift|2023|5.3×10^1 petaFLOPFalcon-180B|2023|3.8×10^9 petaFLOPAmazon Titan|2023|4.8×10^9 petaFLOPFinGPT-13B|2023|1.6×10^8 petaFLOPRoseTTAFold All-Atom (RFAA)|2023|2.1×10^5 petaFLOPCODEFUSION (Python)|2023|7.9×10^3 petaFLOPChatGLM3-6B|2023|5.0×10^7 petaFLOPSkywork-13B|2023|2.5×10^8 petaFLOPGrok-1|2023|2.9×10^9 petaFLOPLLaVA 1.5|2023|7.8×10^7 petaFLOPYi-34B|2023|6.1×10^8 petaFLOPCogVLM-17B|2023|6.3×10^7 petaFLOPMultiBand Diffusion|2023|2.6×10^4 petaFLOPRoFormer|2023|2.2×10^3 petaFLOPGraphCast|2023|2.1×10^7 petaFLOPNemotron-3-8B|2023|1.8×10^8 petaFLOPSPHINX (Llama 2 13B)|2023|3.0×10^7 petaFLOPVolcano 13B|2023|4.6×10^7 petaFLOPInflection-2|2023|1.0×10^10 petaFLOPQwen-72B|2023|1.3×10^9 petaFLOPGemini 1.0 Ultra|2023|5.0×10^10 petaFLOPLlama Guard|2023|1.6×10^8 petaFLOPMixtral 8x7B|2023|7.7×10^8 petaFLOPCogAgent|2023|6.7×10^7 petaFLOPFunSearch|2023|3.9×10^8 petaFLOPVILA-13B|2023|2.3×10^6 petaFLOPnekomata-14b|2023|2.6×10^8 petaFLOPGQA-8-XXL|2023|3.5×10^7 petaFLOPQwen1.5-72B|2024|1.3×10^9 petaFLOPMegaScale (Production)|2024|3.9×10^9 petaFLOPStable Diffusion 3|2024|5.0×10^7 petaFLOPAramco Metabrain AI|2024|1.1×10^10 petaFLOPInflection-2.5|2024|8.0×10^9 petaFLOPMM1-30B|2024|4.9×10^8 petaFLOPDBRX|2024|2.6×10^9 petaFLOPReka Core|2024|8.4×10^9 petaFLOPLlama 3-70B|2024|7.9×10^9 petaFLOPGenCast|2024|8.2×10^5 petaFLOPVILA1.5-13B|2024|2.3×10^6 petaFLOPAlphaFold 3|2024|4.1×10^7 petaFLOPYi-Large|2024|1.8×10^9 petaFLOPOcto-Base|2024|5.9×10^5 petaFLOPALLaM adapted 70B|2024|1.1×10^9 petaFLOPQwen2-72B|2024|3.0×10^9 petaFLOPNemotron-4 340B|2024|1.8×10^10 petaFLOPOpenVLA|2024|1.1×10^8 petaFLOPDeepSeek-Coder-V2 236B|2024|1.3×10^9 petaFLOPClaude 3.5 Sonnet|2024|2.7×10^10 petaFLOPESM3 (98B)|2024|1.1×10^9 petaFLOPLlama 3.1-405B|2024|3.8×10^10 petaFLOPAFM-on-device|2024|4.5×10^8 petaFLOPAFM-server|2024|4.3×10^9 petaFLOPLLaVA-OV-72B|2024|3.0×10^9 petaFLOPGrok-2|2024|3.0×10^10 petaFLOPDeepSeek-V2.5|2024|1.8×10^9 petaFLOPQwen2.5-32B|2024|3.5×10^9 petaFLOPQwen2.5 Instruct (72B)|2024|7.9×10^9 petaFLOPQwen2.5-72B|2024|7.8×10^9 petaFLOPTelechat2-115B|2024|6.9×10^9 petaFLOPLlama 3.2 11B|2024|5.8×10^8 petaFLOPMovie Gen Video|2024|1.7×10^9 petaFLOPRDT-1B|2024|4.1×10^7 petaFLOPLlama-3.1-Nemotron-70B-Instruct|2024|7.9×10^9 petaFLOPCHAI-1|2024|7.8×10^6 petaFLOPYi-Lightning|2024|1.5×10^9 petaFLOPNVLM-D 72B|2024|3.0×10^9 petaFLOPNVLM-H 72B|2024|3.0×10^9 petaFLOPNVLM-X 72B|2024|3.0×10^9 petaFLOPDoubao-pro|2024|2.5×10^10 petaFLOPHunyuan-Large|2024|3.5×10^9 petaFLOPAmazon Nova Pro|2024|6.0×10^9 petaFLOPLlama 3.3 70B|2024|6.9×10^9 petaFLOPEXAONE 3.5 32B|2024|1.3×10^9 petaFLOPDeepSeek-V3|2024|3.3×10^9 petaFLOPDeepSeek-R1|2025|3.5×10^9 petaFLOPEagle 2|2025|4.7×10^7 petaFLOPEurus-2-7B-PRIME|2025|4.0×10^5 petaFLOPGrok 3|2025|3.5×10^11 petaFLOPClaude 3.7 Sonnet|2025|3.4×10^10 petaFLOPGPT-4.5|2025|3.8×10^11 petaFLOPQwQ-32B|2025|3.5×10^9 petaFLOPHunyuan-TurboS|2025|5.4×10^9 petaFLOPEXAONE Deep 32B|2025|1.3×10^9 petaFLOPDeepSeek-V3 (Mar 2025)|2025|3.3×10^9 petaFLOPLlama 4 Behemoth (preview)|2025|5.2×10^10 petaFLOPLlama 4 Maverick|2025|2.2×10^9 petaFLOPLlama 4 Scout|2025|4.1×10^9 petaFLOPPangu Ultra|2025|1.1×10^10 petaFLOPQwen3-235B-A22B|2025|4.8×10^9 petaFLOPSeed1.5-VL|2025|1.4×10^9 petaFLOPDeepSeek-R1 (May 2025)|2025|4.0×10^9 petaFLOPFGN|2025|9.6×10^6 petaFLOPGrok 4|2025|5.0×10^11 petaFLOPKimi K2|2025|3.0×10^9 petaFLOPEXAONE 4.0 (32B)|2025|2.7×10^9 petaFLOPQwen3-Coder-480B-A35B|2025|1.6×10^9 petaFLOPQwen3-235B-A22B (Jul 2025)|2025|4.8×10^9 petaFLOPQwen3-235B-A22B-Thinking (Jul 2025)|2025|4.8×10^9 petaFLOPGLM-4.5|2025|4.4×10^9 petaFLOPgpt-oss-120b|2025|4.9×10^9 petaFLOPgpt-oss-20b|2025|5.5×10^8 petaFLOPGPT-5|2025|6.6×10^10 petaFLOPLongCat-Flash|2025|3.7×10^9 petaFLOPQwen3-Max|2025|1.5×10^10 petaFLOPAgentFounder-30B|2025|6.5×10^8 petaFLOPQwen3-Omni-30B-A3B|2025|3.6×10^7 petaFLOPGLM-4.6|2025|4.4×10^9 petaFLOPLing-1T|2025|6.0×10^9 petaFLOPKimi K2 Thinking|2025|4.2×10^9 petaFLOPOlmo 3|2025|1.1×10^9 petaFLOPNemotron 3-Nano-30B-A3B|2025|4.8×10^8 petaFLOPGLM-4.7|2025|4.4×10^9 petaFLOPK-EXAONE|2026|1.5×10^9 petaFLOPSolar Open 100B|2026|1.4×10^9 petaFLOPKimi K2.5|2026|5.8×10^9 petaFLOPGLM-5|2026|6.8×10^9 petaFLOPComposer 2|2026|2.3×10^10 petaFLOPMolmoAct 2|2026|1.1×10^7 petaFLOPEXAONE 4.5|2026|3.9×10^9 petaFLOPDeepSeek-V4-Flash|2026|2.5×10^9 petaFLOPDeepSeek-V4-Pro|2026|9.7×10^9 petaFLOPMiMo-V2.5-Pro|2026|6.8×10^9 petaFLOPComposer 2.5|2026|3.9×10^10 petaFLOPNemotron 3 Ultra|2026|6.6×10^9 petaFLOPSolar Open2 250B|2026|1.1×10^9 petaFLOPInkling|2026|1.9×10^9 petaFLOPKimi K3|2026|2.0×10^10 petaFLOPA.X K2|2026|1.8×10^9 petaFLOPK-EXAONE 2.0|2026|3.6×10^9 petaFLOPMotif-3|2026|1.1×10^9 petaFLOP其他
每个点为一个知名 AI 模型,横轴=发布年份、纵轴=训练算力(对数轴,单位 petaFLOP=10¹⁵ 次浮点运算),按应用领域着色;共 535 个模型。

参数量趋势

模型的可训练参数数量——参数越多,模型「容量」通常越大。按开发方类型(产业界 / 学术界 / 产学合作)着色,可见近年前沿被产业界主导。

10²10⁴10⁶10⁸10¹⁰10¹²1960198020002020发布年份参数量(个,对数轴)Theseus|1950|4.0×10^1 个参数SNARC|1952|4.0×10^1 个参数Self Organizing System|1955|2.3×10^2 个参数Perceptron Mark I|1957|1.0×10^3 个参数Samuel Neural Checkers|1959|1.6×10^1 个参数Pattern recognition and reading by machine|1959|2.6×10^3 个参数Perceptron (1960)|1960|1.0×10^3 个参数ADALINE|1960|1.7×10^1 个参数LTE speaker verification system|1966|2.1×10^3 个参数Decision tree adaline|1969|2.5×10^3 个参数Piecewise linear model|1973|3.6×10^2 个参数Cognitron|1975|2.2×10^4 个参数Neocognitron|1980|1.1×10^6 个参数Kohonen network|1981|4.1×10^3 个参数Hopfield network|1982|9.9×10^3 个参数ASE+ACE|1983|3.2×10^2 个参数Hierarchical Cognitron|1984|9.3×10^3 个参数Distributed representation NN|1986|4.3×10^2 个参数MLP with back-propagation|1986|7.2×10^2 个参数NetTalk (dictionary)|1987|1.9×10^4 个参数NetTalk (transcription)|1987|1.9×10^4 个参数Translation-invariant MLP|1987|8.2×10^2 个参数MLN-ASR|1988|1.0×10^4 个参数Truck backer-upper|1989|8.1×10^2 个参数Handwritten digit recognition network|1989|2.6×10^3 个参数Speaker-independent vowel classification|1989|3.0×10^3 个参数Zip CNN|1989|9.8×10^3 个参数NETtalk reimplementation|1990|2.8×10^4 个参数Bankruptcy-NN|1990|3.6×10^1 个参数SexNet classification|1990|1.6×10^3 个参数SexNet compression|1990|7.3×10^4 个参数RAAM|1990|1.5×10^3 个参数Weight Decay|1991|8.4×10^3 个参数TD-Gammon|1992|2.5×10^4 个参数Cancer drug mechanism prediction|1992|5.9×10^2 个参数Boosting|1992|2.6×10^3 个参数IBM-5|1993|1.7×10^6 个参数Siamese-TDNN|1993|7.4×10^2 个参数ANN Eye Tracker|1993|5.6×10^3 个参数Ceramic-MLP|1994|1.9×10^3 个参数JPMAX|1994|4.5×10^3 个参数Mixture of linear models|1994|3.8×10^5 个参数NeuroChess|1994|7.2×10^4 个参数Predictive Coding NN|1994|2.1×10^5 个参数Support Vector Machines|1995|1.0×10^8 个参数LISSOM|1995|4.3×10^5 个参数MUSIC perceptron|1996|1.4×10^4 个参数System 11|1996|6.5×10^3 个参数SOM-CNN|1997|3.2×10^4 个参数Deep Blue|1997|8.0×10^3 个参数Bidirectional RNN|1997|1.3×10^4 个参数LSTM|1997|1.1×10^4 个参数LeNet-5|1998|6.0×10^4 个参数LSTM with forget gates|1999|2.8×10^2 个参数RECONTRA-categorized|1999|6.7×10^4 个参数RECONTRA-uncategorized|1999|1.1×10^5 个参数Neural LM|2000|6.9×10^6 个参数PoE MNIST|2000|3.9×10^6 个参数Decision tree (classification)|2001|1.2×10^4 个参数NPLM (AP News)|2003|1.2×10^7 个参数NPLM (Brown)|2003|4.1×10^6 个参数Invariant CNN|2004|9.1×10^4 个参数LMICA|2004|4.1×10^6 个参数RankNet|2005|5.7×10^3 个参数SVM-CNN|2006|9.1×10^4 个参数Deep Belief Nets|2006|1.6×10^6 个参数Dimensionality Reduction|2006|3.8×10^6 个参数KN-LM|2007|2.1×10^10 个参数SB-LM|2007|3.0×10^11 个参数BLSTM for handwriting (2)|2007|1.0×10^5 个参数Deep Multitask NLP Network|2008|1.5×10^6 个参数HLBL|2008|1.9×10^6 个参数GNN|2008|3.0×10^1 个参数BP-DBN|2009|1.8×10^7 个参数RBM Image Classifier|2009|8.0×10^7 个参数GPU DBNs|2009|1.0×10^8 个参数Two Stage Feature Extraction (MNIST)|2009|2.6×10^5 个参数LCNP LabelMe|2009|1.4×10^7 个参数LCNP MNIST|2009|1.2×10^7 个参数LCNP NORB|2009|1.7×10^7 个参数Super-vector coding|2010|1.0×10^3 个参数Feedforward NN|2010|7.1×10^6 个参数ReLU (NORB)|2010|1.6×10^7 个参数Pooling CNN (Caltech 101)|2010|3.0×10^5 个参数Pooling CNN (NORB)|2010|2.7×10^5 个参数RNN LM|2010|7.0×10^7 个参数Deep Autoencoders|2011|1.4×10^8 个参数Vector Space Model|2011|2.6×10^5 个参数High Performance CNN (NORB)|2011|4.9×10^6 个参数CNN Committee (MNIST)|2011|1.2×10^5 个参数CNN Committee (NIST)|2011|1.3×10^5 个参数CNN committee (traffic sign)|2011|1.4×10^6 个参数NLP from scratch|2011|5.0×10^6 个参数Dropout (MNIST)|2012|5.6×10^6 个参数Dropout (TIMIT)|2012|4.9×10^7 个参数Unsupervised High-level Feature Learner|2012|1.0×10^9 个参数LSTM LM|2012|1.0×10^8 个参数AlexNet|2012|6.0×10^7 个参数DNN EM segmentation|2012|2.2×10^5 个参数DistBelief Speech|2012|4.7×10^7 个参数DistBelief Vision|2012|1.7×10^9 个参数RNN+LDA+KN5+cache|2012|9.0×10^6 个参数PreTrans-3L-250H|2013|4.3×10^7 个参数Multilingual DNN|2013|2.1×10^8 个参数ReLU-Speech|2013|1.0×10^8 个参数Hierarchical Scene Labeling (Stanford Background)|2013|5.2×10^7 个参数Word2Vec (large)|2013|6.9×10^8 个参数Word2Vec (small)|2013|2.1×10^8 个参数R-CNN (T-net)|2013|6.9×10^7 个参数TransE|2013|9.4×10^8 个参数RNN for 1B words|2013|2.0×10^10 个参数DQN|2013|8.4×10^5 个参数Image generation|2013|7.8×10^5 个参数OverFeat|2013|1.4×10^8 个参数GloVe (32B)|2014|1.2×10^8 个参数GloVe (6B)|2014|1.2×10^8 个参数HyperNEAT|2014|2.4×10^5 个参数Paragraph Vector|2014|3.2×10^7 个参数AdaRNN|2014|1.3×10^4 个参数Dropout: SVHN|2014|4.8×10^7 个参数Fragment embedding|2014|1.4×10^8 个参数Multiresolution CNN|2014|1.3×10^8 个参数RNN-WER|2014|2.6×10^7 个参数ACF-WIDER|2014|6.1×10^3 个参数NPD|2014|3.1×10^5 个参数VGG16|2014|1.4×10^8 个参数VGG19|2014|1.4×10^8 个参数Seq2Seq LSTM|2014|1.9×10^9 个参数SPN-4+KN5|2014|5.0×10^6 个参数GoogLeNet / InceptionV1|2014|6.8×10^6 个参数LRCN|2014|1.4×10^8 个参数TA-CNN|2014|7.1×10^5 个参数SNM-skip|2014|6.2×10^10 个参数Fractional Max-Pooling|2014|2.7×10^7 个参数ADAM (CIFAR-10)|2014|2.4×10^6 个参数VGG-Face|2015|1.4×10^8 个参数MSRA (C, PReLU)|2015|8.7×10^7 个参数TRPO|2015|3.4×10^4 个参数DQN-2015|2015|1.7×10^6 个参数genCNN + dyn eval|2015|8.0×10^6 个参数TC-DNN-BLSTM-DNN|2015|1.8×10^7 个参数U-Net|2015|3.8×10^7 个参数CFSS|2015|1.7×10^4 个参数YOLO|2015|2.7×10^8 个参数BatchNorm|2015|1.4×10^7 个参数Deep CNN + COTS|2015|5.0×10^6 个参数DCNN|2015|5.0×10^6 个参数AlphaGo Fan|2015|8.2×10^6 个参数SAF R-CNN|2015|1.4×10^8 个参数3DDFA|2015|5.4×10^6 个参数Inception v3|2015|2.4×10^7 个参数ResNet-101 (ImageNet)|2015|4.5×10^7 个参数ResNet-110 (CIFAR-10)|2015|1.7×10^6 个参数ResNet-152 (ImageNet)|2015|6.0×10^7 个参数Variational (untied weights, MC) LSTM (Large)|2015|6.6×10^7 个参数Inception-ResNet-V2|2016|5.6×10^7 个参数Inceptionv4|2016|4.3×10^7 个参数SqueezeNet|2016|1.2×10^6 个参数Double DQN|2016|1.5×10^6 个参数Template Adaptation|2016|1.4×10^8 个参数Dueling DQN|2016|1.7×10^6 个参数Gated HORNN (3rd order)|2016|9.0×10^6 个参数LRR-4X|2016|1.4×10^8 个参数CMS-RCNN|2016|1.4×10^8 个参数SimpleNet|2016|5.5×10^6 个参数DenseNet-264|2016|3.4×10^7 个参数LF-MMI|2016|1.7×10^7 个参数MS-ensemble-speech-recognition|2016|3.2×10^9 个参数ResNet-1001|2016|1.0×10^7 个参数GNMT|2016|2.8×10^8 个参数Pointer Sentinel-LSTM (medium)|2016|2.1×10^7 个参数Xception|2016|2.3×10^7 个参数SPIDER2|2016|4.1×10^5 个参数BIDAF|2016|2.6×10^6 个参数NAS with base 8 and shared embeddings|2016|5.4×10^7 个参数NASv3 (CIFAR-10)|2016|3.7×10^7 个参数VD-LSTM+REAL Large|2016|5.1×10^7 个参数DLDL (PASCAL)|2016|5.6×10^8 个参数ResNeXt-101 (64×4d)|2016|8.3×10^7 个参数ResNeXt-50|2016|2.5×10^7 个参数PolyNet|2016|9.2×10^7 个参数3DMM-CNN|2016|4.5×10^7 个参数HR-ResNet101|2016|4.5×10^7 个参数EnhanceNet|2016|8.1×10^5 个参数YOLOv2|2016|5.1×10^7 个参数DeepStack|2017|2.5×10^6 个参数OR-WideResNet|2017|1.8×10^7 个参数MoE-Multi|2017|8.7×10^9 个参数MobileNet|2017|4.2×10^6 个参数Transformer (2017)|2017|2.1×10^8 个参数ShuffleNet v1|2017|2.4×10^6 个参数JFT|2017|4.5×10^7 个参数AWD-LSTM|2017|2.4×10^7 个参数NASNet-A|2017|8.9×10^7 个参数AWD-LSTM - 3-layer LSTM (tied) + continuous cache pointer (WT2)|2017|3.3×10^7 个参数RetinaNet-R101|2017|5.3×10^7 个参数RetinaNet-R50|2017|3.4×10^7 个参数EI-REHN-1000D|2017|1.9×10^7 个参数GL-LWGC-AWD-MoS-LSTM + dynamic evaluation (WT2)|2017|3.8×10^7 个参数PyramidNet|2017|2.6×10^7 个参数SENet (ImageNet)|2017|2.8×10^7 个参数ISS|2017|1.1×10^7 个参数LSTM + dynamic eval|2017|5.0×10^7 个参数AWD-LSTM+WT+Cache+IOG (WT2)|2017|5.3×10^7 个参数AlphaGo Zero|2017|4.6×10^7 个参数Fraternal dropout + AWD-LSTM 3-layer (WT2)|2017|3.4×10^7 个参数AWD-LSTM-MoS + dynamic evaluation (WT2, 2017)|2017|3.5×10^7 个参数DL scaling Image|2017|1.2×10^8 个参数DL scaling LM|2017|1.8×10^8 个参数DL scaling speech|2017|1.9×10^8 个参数ELMo|2018|9.4×10^7 个参数QRNN|2018|1.4×10^8 个参数IMPALA|2018|1.6×10^6 个参数TCN (P-MNIST)|2018|4.2×10^4 个参数4 layer QRNN (h=2500)|2018|1.5×10^8 个参数YOLOv3|2018|5.7×10^7 个参数Dropout-LSTM+Noise(Bernoulli) (WT2)|2018|5.1×10^7 个参数ResNeXt-101 32x48d|2018|8.3×10^8 个参数aLSTM(depth-2)+RecurrentPolicy (WT2)|2018|3.2×10^7 个参数GPT-1|2018|1.2×10^8 个参数MobileNetV2|2018|3.4×10^6 个参数FTW (For The Win)|2018|1.3×10^8 个参数Big-Little Net|2018|7.7×10^7 个参数Big-Little Net (speech)|2018|3.3×10^6 个参数AWD-LSTM-MoS+PDR + dynamic evaluation (WT2)|2018|3.5×10^7 个参数(ensemble): AWD-LSTM-DOC (fin) × 5 (WT2)|2018|1.9×10^8 个参数AWD-LSTM-MoS + dynamic evaluation (WT2, 2018)|2018|3.5×10^7 个参数Transformer + Simple Recurrent Unit|2018|9.0×10^7 个参数LSTM+NeuralCache|2018|2.1×10^6 个参数Transformer (Adaptive Input Embeddings) WT103|2018|2.5×10^8 个参数BERT-Large|2018|3.4×10^8 个参数MetaMimic|2018|2.2×10^7 个参数TrellisNet|2018|1.8×10^8 个参数Mesh-TensorFlow Transformer 2.9B (translation)|2018|2.9×10^9 个参数Mesh-TensorFlow Transformer 4.9B (language)|2018|4.9×10^9 个参数Fine-tuned-AWD-LSTM-DOC (fin)|2018|4.6×10^7 个参数GPipe (Transformer)|2018|6.0×10^9 个参数Multi-cell LSTM|2018|7.2×10^6 个参数SPN (ImageNet 128)|2018|2.5×10^8 个参数StyleGAN|2018|2.6×10^7 个参数Transformer ELMo|2019|5.6×10^7 个参数Transformer-XL (257M)|2019|2.6×10^8 个参数Hanabi 4 player|2019|7.6×10^5 个参数MT-DNN|2019|3.3×10^8 个参数GPT-2 (1.5B)|2019|1.5×10^9 个参数KataGo|2019|2.5×10^6 个参数NMT Transformer 437M|2019|4.4×10^8 个参数SciBERT|2019|1.1×10^8 个参数True-Regularization+Finetune+Dynamic-Eval|2019|7.0×10^6 个参数WeNet (Penn Treebank)|2019|2.3×10^7 个参数Transformer-XL + RMS dynamic eval|2019|2.6×10^8 个参数BERT-Large-CAS (PTB+WT2+WT103)|2019|4.0×10^8 个参数MuseNet|2019|2.0×10^9 个参数ResNeXt-101 Billion-scale|2019|1.9×10^8 个参数AWD-LSTM-DRILL + dynamic evaluation† (WT2)|2019|3.4×10^7 个参数CPC v2|2019|3.0×10^8 个参数EfficientNet-L2|2019|4.8×10^8 个参数DLRM-2020|2019|1.0×10^11 个参数XLM|2019|6.7×10^8 个参数XLNet|2019|3.4×10^8 个参数Transformer-XL Large + Phrase Induction|2019|2.6×10^8 个参数AWD-LSTM + MoS + Partial Shuffled|2019|3.5×10^7 个参数FixRes ResNeXt-101 WSL|2019|8.3×10^8 个参数LaNet-L (CIFAR-10)|2019|4.4×10^7 个参数BigBiGAN|2019|8.6×10^7 个参数RoBERTa Large|2019|3.6×10^8 个参数EN^2AS with performance reward|2019|2.3×10^7 个参数Mogrifier (d2, MoS2, MC) + dynamic eval|2019|3.5×10^7 个参数UDSMProt|2019|2.8×10^7 个参数Megatron-BERT|2019|3.9×10^9 个参数Megatron-LM (1.2B)|2019|1.2×10^9 个参数Megatron-LM (8.3B)|2019|8.3×10^9 个参数ALBERT|2019|1.8×10^7 个参数Adaptive Inputs + LayerDrop|2019|4.2×10^8 个参数AlphaX-1|2019|5.4×10^6 个参数DistilBERT|2019|6.6×10^7 个参数M4-50B|2019|5.0×10^10 个参数T5-11B|2019|1.1×10^10 个参数T5-3B|2019|2.8×10^9 个参数BART-large|2019|4.1×10^8 个参数AlphaStar|2019|1.4×10^8 个参数Base LM + kNN LM + Continuous Cache|2019|2.5×10^8 个参数XLM-RoBERTa|2019|5.5×10^8 个参数CamemBERT|2019|3.4×10^8 个参数Noisy Student (L2)|2019|4.8×10^8 个参数Sandwich Transformer|2019|2.1×10^8 个参数MoCo|2019|3.8×10^8 个参数MuZero|2019|3.7×10^7 个参数Transformer - LibriVox + Decoding/Rescoring|2019|3.0×10^8 个参数Transformer-XL DeFINE (141M)|2019|1.4×10^8 个参数StyleGAN2|2019|3.0×10^7 个参数MMLSTM (PTB)|2019|2.1×10^7 个参数MMLSTM (WT-2)|2019|3.2×10^7 个参数OpenAI Five|2019|1.6×10^8 个参数OpenAI Five Rerun|2019|1.6×10^8 个参数Big Transfer (BiT-L)|2019|9.3×10^8 个参数AlphaFold|2020|1.6×10^7 个参数Meena|2020|2.6×10^9 个参数Perceiver IO (optical flow)|2020|2.8×10^7 个参数TaLK Convolution|2020|2.4×10^8 个参数Theseus 6/768|2020|6.6×10^7 个参数ALBERT-xxlarge|2020|2.4×10^8 个参数FFN SwiGLU|2020|2.2×10^8 个参数SimCLR|2020|3.8×10^8 个参数Turing-NLG|2020|1.7×10^10 个参数Feedback Transformer|2020|1.3×10^8 个参数TCAN (WT2)|2020|3.3×10^7 个参数Routing Transformer (WT-103)|2020|8.0×10^7 个参数TransformerXL + spectrum control|2020|1.5×10^8 个参数Tensor-Transformer(1core)+PN (WT103)|2020|8.5×10^7 个参数ELECTRA|2020|3.4×10^8 个参数MetNet|2020|2.3×10^8 个参数CURL|2020|9.1×10^5 个参数Once for All|2020|7.7×10^6 个参数UnifiedQA|2020|1.1×10^10 个参数NAS+ESS (23M)|2020|2.3×10^7 个参数ContextNet|2020|1.1×10^8 个参数Conformer|2020|1.2×10^8 个参数Retrieval-Augmented Generator|2020|6.3×10^8 个参数DETR|2020|6.0×10^7 个参数GPT-3 175B (davinci)|2020|1.8×10^11 个参数GShard (dense)|2020|2.3×10^9 个参数EfficientDet|2020|7.7×10^7 个参数DeLighT|2020|9.9×10^7 个参数ERNIE-GEN (large)|2020|3.4×10^8 个参数ProBERTa|2020|4.4×10^7 个参数LUKE|2020|4.8×10^8 个参数Conformer + Wav2vec 2.0 + Noisy Student|2020|1.0×10^9 个参数German ELECTRA Large|2020|3.4×10^8 个参数mT5-XXL|2020|1.3×10^10 个参数ViT-Base/32|2020|8.6×10^7 个参数ViT-Huge/14|2020|6.3×10^8 个参数wave2vec 2.0 LARGE|2020|3.2×10^8 个参数KEPLER|2020|1.3×10^8 个参数AlphaFold 2|2020|9.3×10^7 个参数CPM-Large|2020|2.6×10^9 个参数ESM1b|2020|6.5×10^8 个参数CT-MoS (WT2)|2020|4.5×10^7 个参数ERNIE-Doc (247M)|2021|2.5×10^8 个参数CLIP (ResNet-50)|2021|8.9×10^7 个参数CLIP (ViT L/14@336px)|2021|3.7×10^8 个参数DALL-E|2021|1.2×10^10 个参数BigSSL|2021|8.0×10^9 个参数Switch|2021|1.6×10^12 个参数DeiT-B|2021|8.6×10^7 个参数DLWP|2021|2.7×10^6 个参数MSA Transformer|2021|1.0×10^8 个参数Rational DQN Average|2021|1.7×10^6 个参数SRU++ Large|2021|2.3×10^8 个参数Meta Pseudo Labels|2021|4.8×10^8 个参数Generative BST|2021|9.4×10^9 个参数M6-T|2021|1.0×10^12 个参数Unicorn|2021|1.1×10^10 个参数PLUG|2021|2.7×10^10 个参数ProtBERT-BFD|2021|4.2×10^8 个参数ProtT5-XL-U50|2021|3.0×10^9 个参数ADM|2021|5.6×10^8 个参数MedBERT|2021|1.7×10^7 个参数ByT5-XXL|2021|1.3×10^10 个参数CogView|2021|4.0×10^9 个参数Transformer local-attention (NesT-B)|2021|9.0×10^7 个参数ViT-G/14|2021|1.8×10^9 个参数ALIGN|2021|8.2×10^8 个参数CoAtNet|2021|2.4×10^9 个参数DeBERTa|2021|1.5×10^9 个参数Denoising Diffusion Probabilistic Models (LSUN Bedroom)|2021|2.6×10^8 个参数EMDR|2021|4.4×10^8 个参数EfficientNetV2-XL|2021|2.1×10^8 个参数StyleGAN3-R|2021|1.6×10^6 个参数StyleGAN3-T|2021|2.2×10^6 个参数Fold2Seq|2021|1.2×10^7 个参数Adaptive Input Transformer + RD|2021|2.5×10^8 个参数Codex|2021|1.2×10^10 个参数ERNIE 3.0|2021|1.0×10^10 个参数GOAT|2021|3.5×10^6 个参数HuBERT|2021|1.0×10^9 个参数SEER|2021|1.3×10^9 个参数6-Act Tether|2021|5.0×10^6 个参数YOLOX-X|2021|9.9×10^7 个参数W2v-BERT|2021|1.0×10^9 个参数Jurassic-1-Jumbo|2021|1.8×10^11 个参数Zidong Taichu|2021|3.2×10^9 个参数DNABERT|2021|1.1×10^8 个参数XLMR-XXL|2021|1.1×10^10 个参数FLAN 137B|2021|1.4×10^11 个参数MEB|2021|1.3×10^11 个参数PermuteFormer|2021|1.5×10^8 个参数HyperCLOVA 204B|2021|2.0×10^11 个参数PLATO-XL|2021|1.1×10^10 个参数TrOCR|2021|5.6×10^8 个参数Turing ULRv5|2021|2.2×10^9 个参数Megatron-Turing NLG 530B|2021|5.3×10^11 个参数Yuan 1.0|2021|2.5×10^11 个参数base LM+GNN+kNN|2021|2.7×10^8 个参数Eve|2021|1.5×10^7 个参数CodeT5-base|2021|2.2×10^8 个参数S4|2021|2.5×10^8 个参数Masked Autoencoders ViT-H|2021|6.3×10^8 个参数ViT-G/14 (LiT)|2021|3.0×10^9 个参数BASIC-L|2021|3.1×10^9 个参数Swin Transformer V2 (SwinV2-G)|2021|3.0×10^9 个参数Florence|2021|8.9×10^8 个参数NÜWA|2021|8.7×10^8 个参数T-NLRv5 XXL|2021|5.4×10^9 个参数Gopher (280B)|2021|2.8×10^11 个参数GLaM|2021|1.2×10^12 个参数LongT5|2021|3.0×10^9 个参数Contriever|2021|1.1×10^8 个参数LDM-1.45B|2021|1.5×10^9 个参数XGLM-7.5B|2021|7.5×10^9 个参数ERNIE 3.0 Titan|2021|2.6×10^11 个参数ERNIE-ViLG|2022|1.0×10^10 个参数Detic|2022|8.8×10^7 个参数data2vec (language)|2022|7.1×10^8 个参数data2vec (speech)|2022|7.1×10^8 个参数data2vec (vision)|2022|7.1×10^8 个参数AbLang (heavy sequences)|2022|3.6×10^8 个参数OntoProtein|2022|4.2×10^8 个参数InstructGPT 1.3B|2022|1.3×10^9 个参数InstructGPT 175B|2022|1.8×10^11 个参数InstructGPT 6B|2022|6.0×10^9 个参数AlphaCode|2022|4.1×10^10 个参数MaskGIT (ImageNet)|2022|2.3×10^8 个参数RETRO-7B|2022|7.5×10^9 个参数GPT-NeoX-20B|2022|2.0×10^10 个参数LaMDA|2022|1.4×10^11 个参数ProteinBERT|2022|1.6×10^7 个参数ST-MoE|2022|2.7×10^11 个参数PolyCoder|2022|2.7×10^9 个参数DeepNet|2022|3.2×10^9 个参数Statement Curriculum Learning|2022|7.7×10^8 个参数ViT-G (model soup)|2022|1.8×10^9 个参数Make-A-Scene|2022|4.0×10^9 个参数Segatron-XL large, M=384 + HCP|2022|2.6×10^8 个参数Chinchilla|2022|7.0×10^10 个参数PaLM (540B)|2022|5.4×10^11 个参数BERT-RBP|2022|1.1×10^8 个参数DALL·E 2|2022|3.5×10^9 个参数Sparse all-MLP|2022|9.4×10^9 个参数Stable Diffusion (LDM-KL-8-G)|2022|1.5×10^9 个参数Flamingo|2022|8.0×10^10 个参数OPT-175B|2022|1.8×10^11 个参数DeBERTaV3large + KEAR|2022|4.2×10^8 个参数UL2|2022|2.0×10^10 个参数Gato|2022|1.2×10^9 个参数Imagen|2022|7.8×10^9 个参数GPT-2 Medium (FlashAttention)|2022|3.6×10^8 个参数Tranception|2022|7.0×10^8 个参数CogVideo|2022|9.4×10^9 个参数DITTO|2022|7.5×10^8 个参数CoCa|2022|2.1×10^9 个参数Parti|2022|2.0×10^10 个参数ProGen2-xlarge|2022|6.4×10^9 个参数Minerva (540B)|2022|5.4×10^11 个参数CodeT5-large|2022|7.7×10^8 个参数NLLB|2022|5.5×10^10 个参数BLOOM-176B|2022|1.8×10^11 个参数ESM2-15B|2022|1.5×10^10 个参数OmegaPLM|2022|6.7×10^8 个参数AlexaTM 20B|2022|2.0×10^10 个参数GLM-130B|2022|1.3×10^11 个参数BlenderBot 3|2022|1.8×10^11 个参数BEIT-3|2022|1.9×10^9 个参数PaLI|2022|1.7×10^10 个参数Whisper|2022|1.6×10^9 个参数DiffDock|2022|2.0×10^7 个参数Phenaki|2022|1.8×10^9 个参数GenSLM|2022|2.5×10^10 个参数Flan-PaLM 540B|2022|5.4×10^11 个参数LMSI-Palm|2022|5.4×10^11 个参数U-PaLM (540B)|2022|5.4×10^11 个参数Mogrifier RLSTM (WT2)|2022|3.5×10^7 个参数eDiff-I|2022|9.1×10^9 个参数mT0-13B|2022|1.3×10^10 个参数InternImage|2022|1.1×10^9 个参数EVA-01|2022|1.0×10^9 个参数Galactica|2022|1.2×10^11 个参数AR-LDM|2022|1.5×10^9 个参数Fusion in Encoder|2022|3.3×10^8 个参数ALM 1.0|2022|3.4×10^8 个参数Vega v2|2022|6.0×10^9 个参数RT-1|2022|3.5×10^7 个参数CaLM|2022|8.6×10^7 个参数Hybrid H3-2.7B|2022|2.7×10^9 个参数VALL-E|2023|3.5×10^8 个参数DreamerV3|2023|2.0×10^8 个参数Ankh_large|2023|1.9×10^9 个参数Nucleotide Transformer|2023|2.5×10^9 个参数DDPM-IP (CelebA)|2023|3.0×10^8 个参数MusicLM|2023|8.6×10^8 个参数BLIP-2 (Q-Former)|2023|1.5×10^9 个参数ViT-22B|2023|2.2×10^10 个参数BASIC-L + Lion|2023|3.1×10^9 个参数LLaMA-65B|2023|6.5×10^10 个参数DiT-XL/2|2023|6.8×10^8 个参数AudioGen|2023|1.0×10^9 个参数PaLM-E|2023|5.6×10^11 个参数Falcon-40B|2023|4.0×10^10 个参数GPT-4 (Mar 2023)|2023|1.8×10^12 个参数LEP-AD|2023|3.0×10^9 个参数PanGu-Σ|2023|1.1×10^12 个参数SigLIP 400M|2023|4.0×10^8 个参数BloombergGPT|2023|5.1×10^10 个参数VideoMAE V2|2023|1.0×10^9 个参数Segment Anything Model|2023|6.4×10^8 个参数Incoder-6.7B|2023|6.7×10^9 个参数DINOv2|2023|1.1×10^9 个参数LLaVA|2023|1.3×10^10 个参数ImageBind|2023|9.3×10^8 个参数PaLM 2|2023|3.4×10^11 个参数StarCoder|2023|1.6×10^10 个参数InstructBLIP|2023|1.3×10^10 个参数CoEdiT-xxl|2023|1.1×10^10 个参数Med-PaLM 2|2023|3.4×10^11 个参数CodeT5+|2023|1.6×10^10 个参数ONE-PEACE|2023|4.0×10^9 个参数Goat-7B|2023|7.0×10^9 个参数DPO on Pythia-2.8B|2023|2.8×10^9 个参数PaLI-X|2023|5.5×10^10 个参数MusicGen|2023|3.4×10^9 个参数GPT-3.5 Turbo|2023|2.0×10^10 个参数GPT-4 (Jun 2023)|2023|1.8×10^12 个参数HyenaDNA|2023|6.6×10^6 个参数Stable Diffusion XL (SDXL)|2023|3.4×10^9 个参数InternLM|2023|1.0×10^11 个参数Pangu-Weather|2023|2.6×10^8 个参数xTrimoPGLM -100B|2023|1.0×10^11 个参数GPT3-2.7B (FlashAttention-2)|2023|2.7×10^9 个参数Llama 2-70B|2023|7.0×10^10 个参数Llama 2-7B|2023|7.0×10^9 个参数AudioLM|2023|1.5×10^9 个参数RT-2|2023|5.5×10^10 个参数Qwen-VL|2023|9.6×10^9 个参数Jais|2023|1.3×10^10 个参数Swift|2023|5.7×10^4 个参数Falcon-180B|2023|1.8×10^11 个参数Robot Parkour|2023|5.0×10^5 个参数AlphaMissense|2023|9.3×10^7 个参数Amazon Titan|2023|2.0×10^11 个参数GPT-3.5 Turbo Instruct|2023|2.0×10^10 个参数FinGPT-13B|2023|1.3×10^10 个参数Ferret (13B)|2023|1.3×10^10 个参数RT-2-X|2023|5.5×10^10 个参数PaLI-3|2023|5.0×10^9 个参数CODEFUSION (Python)|2023|7.5×10^7 个参数ChatGLM3-6B|2023|6.0×10^9 个参数DiT-XL/2 + CADS|2023|6.8×10^8 个参数Skywork-13B|2023|1.3×10^10 个参数BLUUMI|2023|1.8×10^11 个参数Grok-1|2023|3.1×10^11 个参数LLaVA 1.5|2023|1.3×10^10 个参数Yi-34B|2023|3.4×10^10 个参数CogVLM-17B|2023|1.7×10^10 个参数RoFormer|2023|1.1×10^8 个参数mPLUG-Owl2|2023|7.1×10^9 个参数Nemotron-3-8B|2023|8.0×10^9 个参数Qwen-Audio-Chat|2023|8.5×10^9 个参数SPHINX (Llama 2 13B)|2023|2.0×10^10 个参数Volcano 13B|2023|1.3×10^10 个参数GNoME for crystal discovery|2023|1.6×10^7 个参数PPLX-70B-Online|2023|7.0×10^10 个参数Qwen-72B|2023|7.2×10^10 个参数Mamba-24M (SC09)|2023|2.3×10^7 个参数Llama Guard|2023|7.0×10^9 个参数SeamlessM4T|2023|2.3×10^9 个参数Mixtral 8x7B|2023|4.7×10^10 个参数W.A.L.T|2023|4.7×10^9 个参数CogAgent|2023|1.8×10^10 个参数FunSearch|2023|1.5×10^10 个参数VILA-13B|2023|1.3×10^10 个参数Gemini Nano-1|2023|1.8×10^9 个参数Gemini Nano-2|2023|3.3×10^9 个参数nekomata-14b|2023|1.4×10^10 个参数GQA-8-XXL|2023|1.1×10^10 个参数CoRe|2023|1.2×10^10 个参数Palmyra X 003|2024|7.2×10^10 个参数AlphaGeometry|2024|1.5×10^8 个参数Qwen-VL-Max|2024|7.0×10^9 个参数Qwen1.5-72B|2024|7.2×10^10 个参数Aya|2024|1.3×10^10 个参数MegaScale (Production)|2024|5.3×10^11 个参数Stable Diffusion 3|2024|8.0×10^9 个参数Aramco Metabrain AI|2024|2.5×10^11 个参数MM1-30B|2024|3.0×10^10 个参数DBRX|2024|1.3×10^11 个参数ReALM|2024|3.0×10^9 个参数Reka Core|2024|6.7×10^10 个参数Llama 3-70B|2024|7.0×10^10 个参数VILA1.5-13B|2024|1.4×10^10 个参数Yi-Large|2024|1.0×10^11 个参数Octo-Base|2024|9.3×10^7 个参数ALLaM adapted 70B|2024|7.0×10^10 个参数Qwen2-72B|2024|7.3×10^10 个参数Nemotron-4 340B|2024|3.4×10^11 个参数OpenVLA|2024|7.2×10^9 个参数DeepSeek-Coder-V2 236B|2024|2.4×10^11 个参数Cambrian-1-34B|2024|3.4×10^10 个参数ESM3 (98B)|2024|9.9×10^10 个参数SenseChat 5.5|2024|6.0×10^11 个参数Mathstral|2024|7.0×10^9 个参数Llama 3.1-405B|2024|4.1×10^11 个参数Mistral Large 2|2024|1.2×10^11 个参数AFM-on-device|2024|2.7×10^9 个参数LLaVA-OV-72B|2024|7.2×10^10 个参数Table Tennis Agent|2024|1.9×10^5 个参数Jamba 1.5-Large|2024|4.0×10^11 个参数DeepSeek-V2.5|2024|2.4×10^11 个参数Qwen2.5-32B|2024|3.3×10^10 个参数Oryx 34B|2024|3.4×10^10 个参数Qwen2.5 Instruct (72B)|2024|7.3×10^10 个参数Qwen2.5-72B|2024|7.3×10^10 个参数Telechat2-115B|2024|1.2×10^11 个参数Llama 3.2 11B|2024|1.1×10^10 个参数Movie Gen Video|2024|3.0×10^10 个参数GR-2|2024|2.3×10^8 个参数Palmyra X 004|2024|1.5×10^11 个参数RDT-1B|2024|1.2×10^9 个参数NVLM-D 72B|2024|7.2×10^10 个参数NVLM-H 72B|2024|7.2×10^10 个参数NVLM-X 72B|2024|7.2×10^10 个参数Doubao-pro|2024|5.0×10^11 个参数Hunyuan-Large|2024|3.9×10^11 个参数Pixtral Large|2024|1.2×10^11 个参数Fugatto 1|2024|2.5×10^9 个参数未知模型|2024|2.0×10^9 个参数Llama 3.3 70B|2024|7.0×10^10 个参数NVILA 15B|2024|1.5×10^10 个参数EXAONE 3.5 32B|2024|3.2×10^10 个参数Apollo 7B|2024|7.0×10^9 个参数DeepSeek-V3|2024|6.7×10^11 个参数STORM-B/8|2025|1.0×10^8 个参数INTELLECT-MATH|2025|7.0×10^9 个参数DeepSeek-R1|2025|6.7×10^11 个参数Eagle 2|2025|8.9×10^9 个参数Eurus-2-7B-PRIME|2025|7.0×10^9 个参数Grok 3|2025|3.0×10^12 个参数QwQ-32B|2025|3.3×10^10 个参数Hunyuan-TurboS|2025|5.6×10^11 个参数ERNIE-4.5-VL-424B-A47B (文心大模型4.5)|2025|4.2×10^11 个参数EXAONE Deep 32B|2025|3.2×10^10 个参数DeepSeek-V3 (Mar 2025)|2025|6.7×10^11 个参数Diffusion Renderer|2025|1.1×10^9 个参数Llama 4 Behemoth (preview)|2025|2.0×10^12 个参数Llama 4 Maverick|2025|4.0×10^11 个参数Llama 4 Scout|2025|1.1×10^11 个参数Pangu Ultra|2025|1.3×10^11 个参数Qwen3-235B-A22B|2025|2.4×10^11 个参数DeepSeek-R1 (May 2025)|2025|6.7×10^11 个参数Qwen3 Embedding|2025|8.0×10^9 个参数FGN|2025|7.2×10^8 个参数Seed-1.6-Thinking|2025|2.3×10^11 个参数EXAONE Path 2.0|2025|1.8×10^8 个参数Grok 4|2025|3.0×10^12 个参数Kimi K2|2025|1.0×10^12 个参数EXAONE 4.0 (32B)|2025|3.2×10^10 个参数Qwen3-Coder-480B-A35B|2025|4.8×10^11 个参数Qwen3-235B-A22B (Jul 2025)|2025|2.4×10^11 个参数Qwen3-235B-A22B-Thinking (Jul 2025)|2025|2.4×10^11 个参数MindLink-72B|2025|7.2×10^10 个参数GLM-4.5|2025|3.6×10^11 个参数Hierarchical Reasoning Model (HPM)|2025|2.7×10^7 个参数Qwen Image|2025|2.7×10^10 个参数gpt-oss-120b|2025|1.2×10^11 个参数gpt-oss-20b|2025|2.1×10^10 个参数LongCat-Flash|2025|5.6×10^11 个参数Qwen3-Max|2025|1.0×10^12 个参数AgentFounder-30B|2025|3.0×10^10 个参数Qwen3-Omni-30B-A3B|2025|3.5×10^10 个参数GLM-4.6|2025|3.6×10^11 个参数Ling-1T|2025|1.0×10^12 个参数MiniMax-M2|2025|2.3×10^11 个参数Tongyi DeepResearch|2025|3.1×10^10 个参数Kaiju Large|2025|1.1×10^11 个参数Kaiju Medium|2025|3.4×10^10 个参数Kaiju Small|2025|1.3×10^10 个参数Kimi K2 Thinking|2025|1.0×10^12 个参数Olmo 3|2025|3.2×10^10 个参数P1-235B-A22B|2025|2.4×10^11 个参数π0.6 (pi-0.6)|2025|5.3×10^9 个参数DeepSeekMath-V2|2025|6.9×10^11 个参数Nemotron 3-Nano-30B-A3B|2025|3.2×10^10 个参数GLM-4.7|2025|3.6×10^11 个参数MiniMax-M2.1|2025|2.3×10^11 个参数A.X K1|2025|5.2×10^11 个参数HyperCLOVA X SEED 32B Think|2025|3.2×10^10 个参数VAETKI|2025|1.0×10^11 个参数K-EXAONE|2026|2.4×10^11 个参数Solar Open 100B|2026|1.0×10^11 个参数Kimi K2.5|2026|1.0×10^12 个参数Qwen3-Coder-Next|2026|8.0×10^10 个参数GLM-5|2026|7.4×10^11 个参数Qwen3.5 397B-A17B|2026|4.0×10^11 个参数Grok 4.20|2026|5.0×10^11 个参数Qwen3.5-122B-A10B|2026|1.2×10^11 个参数Nemotron 3 Super|2026|1.2×10^11 个参数Composer 2|2026|1.0×10^12 个参数MiMo-V2-Pro|2026|1.0×10^12 个参数GLM-5.1|2026|7.5×10^11 个参数MolmoAct 2|2026|5.5×10^9 个参数EXAONE 4.5|2026|3.3×10^10 个参数Kimi K2.6|2026|1.0×10^12 个参数DeepSeek-V4-Flash|2026|2.8×10^11 个参数DeepSeek-V4-Pro|2026|1.6×10^12 个参数MiMo-V2.5-Pro|2026|1.0×10^12 个参数Tencent Hy3 preview|2026|3.0×10^11 个参数TML-Interaction-Small|2026|2.8×10^11 个参数Composer 2.5|2026|1.0×10^12 个参数Nemotron 3 Ultra|2026|5.5×10^11 个参数Solar Open2 250B|2026|2.5×10^11 个参数Tencent Hy3|2026|3.0×10^11 个参数Inkling|2026|9.8×10^11 个参数Kimi K3|2026|2.8×10^12 个参数Qwen 3.8 Max|2026|2.4×10^12 个参数A.X K2|2026|6.9×10^11 个参数K-EXAONE 2.0|2026|7.5×10^11 个参数Motif-3|2026|3.1×10^11 个参数DeepSeek-V4-Pro-0813|2026|1.6×10^12 个参数GLM-5.3|2026|7.4×10^11 个参数其他
每个点为一个知名 AI 模型,纵轴=可训练参数量(对数轴),按开发方类型着色;共 718 个模型。

训练数据量趋势

训练数据集的样本 / token 规模——喂进模型的样本 / token 规模。数据量与算力、参数量一同增长,是规模定律的第三根支柱。

110³10⁶10⁹10¹²10¹⁵1960198020002020发布年份训练数据量(个样本,对数轴)Theseus|1950|4.0×10^1 个样本Self Organizing System|1955|2.0×10^0 个样本Perceptron Mark I|1957|1.0×10^2 个样本Pattern recognition and reading by machine|1959|1.8×10^2 个样本Perceptron (1960)|1960|1.0×10^2 个样本ADALINE|1960|1.0×10^2 个样本Linear Decision Functions|1962|5.0×10^2 个样本MADALINE I|1962|2.6×10^2 个样本LTE speaker verification system|1966|4.2×10^2 个样本GLEE|1968|6.0×10^3 个样本Piecewise linear model|1973|3.1×10^2 个样本Cognitron|1975|5.0×10^0 个样本Neocognitron|1980|5.0×10^0 个样本Kohonen network|1981|4.0×10^3 个样本ASE+ACE|1983|5.0×10^5 个样本Hierarchical Cognitron|1984|5.0×10^0 个样本Error Propagation|1986|6.4×10^1 个样本Distributed representation NN|1986|1.0×10^2 个样本MLP with back-propagation|1986|1.0×10^2 个样本NetTalk (dictionary)|1987|5.0×10^3 个样本NetTalk (transcription)|1987|5.1×10^3 个样本Translation-invariant MLP|1987|1.6×10^2 个样本MLN-ASR|1988|1.3×10^4 个样本MLP baggage detector|1989|2.0×10^4 个样本Q-learning|1989|2.0×10^5 个样本Handwritten digit recognition network|1989|9.8×10^3 个样本Speaker-independent vowel classification|1989|4.1×10^3 个样本Zip CNN|1989|7.3×10^3 个样本NETtalk reimplementation|1990|7.2×10^3 个样本Bankruptcy-NN|1990|7.4×10^1 个样本ISR network|1990|6.0×10^5 个样本SexNet classification|1990|8.0×10^1 个样本SexNet compression|1990|8.1×10^4 个样本RAAM|1990|2.9×10^1 个样本Weight Decay|1991|2.5×10^4 个样本TD-Gammon|1992|6.3×10^6 个样本Golem|1992|1.6×10^3 个样本Cancer drug mechanism prediction|1992|1.4×10^2 个样本Boosting|1992|2.9×10^4 个样本IBM-5|1993|2.9×10^7 个样本Siamese-TDNN|1993|7.7×10^3 个样本ANN Eye Tracker|1993|4.0×10^3 个样本Ceramic-MLP|1994|8.0×10^1 个样本JPMAX|1994|1.5×10^3 个样本Mixture of linear models|1994|1.8×10^6 个样本NeuroChess|1994|9.6×10^6 个样本Predictive Coding NN|1994|6.0×10^5 个样本Support Vector Machines|1995|6.0×10^4 个样本LISSOM|1995|2.0×10^3 个样本MUSIC perceptron|1996|8.1×10^4 个样本System 11|1996|2.4×10^4 个样本AdaBoost.M2 Digit Recognition|1996|9.7×10^3 个样本SOM-CNN|1997|1.3×10^5 个样本Bidirectional RNN|1997|1.4×10^5 个样本LSTM|1997|8.5×10^5 个样本LeNet-5|1998|6.0×10^4 个样本LSTM with forget gates|1999|1.4×10^8 个样本RECONTRA-categorized|1999|4.0×10^4 个样本RECONTRA-uncategorized|1999|5.8×10^4 个样本IBM Model 4|1999|8.0×10^5 个样本Neural LM|2000|3.2×10^7 个样本PoE MNIST|2000|5.4×10^4 个样本Gradient Boosting Machine|2001|5.0×10^3 个样本Decision tree (classification)|2001|7.5×10^5 个样本Thumbs Up?|2002|1.4×10^3 个样本NPLM (AP News)|2003|1.4×10^7 个样本NPLM (Brown)|2003|1.4×10^7 个样本Invariant CNN|2004|2.4×10^4 个样本LMICA|2004|1.0×10^5 个样本Hierarchical LM|2005|9.0×10^5 个样本Histograms of Oriented Gradients|2005|1.5×10^4 个样本RankNet|2005|3.5×10^6 个样本TFE SVM|2006|6.0×10^5 个样本SVM-CNN|2006|5.8×10^5 个样本Spatial Pyramid Matching|2006|3.0×10^3 个样本Deep Belief Nets|2006|4.7×10^7 个样本Dimensionality Reduction|2006|4.7×10^7 个样本Greedy layer-wise DNN training|2006|1.1×10^8 个样本Local Binary Patterns for facial recognition|2006|7.4×10^2 个样本KN-LM|2007|3.1×10^10 个样本SB-LM|2007|1.8×10^12 个样本BLSTM for handwriting (1)|2007|4.1×10^5 个样本Enhanced Neighborhood-Based Filtering|2007|1.0×10^8 个样本BLSTM for handwriting (2)|2007|3.3×10^6 个样本Deep Multitask NLP Network|2008|6.3×10^8 个样本Denoising Autoencoders|2008|7.8×10^6 个样本HLBL|2008|1.4×10^7 个样本GNN|2008|2.1×10^2 个样本RBM Image Classifier|2009|6.1×10^9 个样本GPU DBNs|2009|1.2×10^11 个样本MatrixFac for Recommenders|2009|1.0×10^8 个样本Two Stage Feature Extraction (MNIST)|2009|5.0×10^4 个样本LCNP LabelMe|2009|4.0×10^4 个样本LCNP MNIST|2009|5.0×10^4 个样本LCNP NORB|2009|2.4×10^4 个样本Stacked Denoising Autoencoders|2010|3.4×10^8 个样本Feedforward NN|2010|9.0×10^4 个样本ReLU (LFW)|2010|2.3×10^5 个样本ReLU (NORB)|2010|2.9×10^5 个样本iCCCP|2010|1.0×10^4 个样本Pooling CNN (Caltech 101)|2010|3.1×10^3 个样本Pooling CNN (NORB)|2010|2.4×10^4 个样本RNN LM|2010|6.4×10^6 个样本Deep rectifier networks|2011|8.2×10^7 个样本Deep Autoencoders|2011|4.9×10^9 个样本Vector Space Model|2011|5.7×10^6 个样本Recursive Neural Network|2011|5.7×10^5 个样本High Performance CNN (NORB)|2011|5.0×10^4 个样本CNN Committee (MNIST)|2011|4.2×10^5 个样本CNN Committee (NIST)|2011|3.4×10^6 个样本Adaptive Subgrad|2011|8.0×10^5 个样本CNN committee (traffic sign)|2011|5.3×10^4 个样本NLP from scratch|2011|8.5×10^8 个样本Dropout (CIFAR)|2012|6.0×10^4 个样本Dropout (ImageNet)|2012|2.6×10^6 个样本Dropout (MNIST)|2012|6.0×10^4 个样本Unsupervised High-level Feature Learner|2012|1.2×10^12 个样本Context-dependent RNN|2012|3.7×10^7 个样本LSTM LM|2012|2.7×10^7 个样本AlexNet|2012|2.5×10^9 个样本Bayesian automated hyperparameter tuning|2012|5.0×10^4 个样本DNN EM segmentation|2012|3.0×10^6 个样本DistBelief Speech|2012|1.1×10^9 个样本DistBelief Vision|2012|1.6×10^7 个样本RNN+LDA+KN5+cache|2012|9.3×10^5 个样本DistBelief NNLM|2013|6.0×10^9 个样本Multilingual DNN|2013|3.1×10^9 个样本Hierarchical Scene Labeling (Stanford Background)|2013|7.1×10^7 个样本RCTM|2013|4.5×10^6 个样本RNTN|2013|1.6×10^5 个样本Word2Vec (large)|2013|3.3×10^11 个样本Word2Vec (small)|2013|1.0×10^10 个样本Visualizing CNNs|2013|7.7×10^6 个样本DeViSE|2013|5.4×10^9 个样本TransE|2013|1.8×10^7 个样本RNN for 1B words|2013|1.0×10^9 个样本DQN|2013|1.6×10^8 个样本Network in Network|2013|6.3×10^5 个样本Image generation|2013|4.7×10^7 个样本GloVe (32B)|2014|3.2×10^8 个样本GloVe (6B)|2014|6.6×10^7 个样本HyperNEAT|2014|7.5×10^8 个样本Paragraph Vector|2014|1.6×10^7 个样本AdaRNN|2014|6.3×10^3 个样本Dropout: SVHN|2014|6.0×10^5 个样本GANs|2014|1.2×10^5 个样本Two-stream ConvNets for action recognition|2014|1.3×10^6 个样本SPPNet|2014|1.3×10^6 个样本DeepFace|2014|4.4×10^6 个样本Fragment embedding|2014|1.5×10^7 个样本Multiresolution CNN|2014|5.0×10^7 个样本ACF-WIDER|2014|1.4×10^5 个样本NPD|2014|4.4×10^5 个样本RNNsearch-50*|2014|2.3×10^8 个样本VGG16|2014|1.3×10^6 个样本VGG19|2014|1.3×10^6 个样本Seq2Seq LSTM|2014|8.7×10^8 个样本SPN-4+KN5|2014|9.3×10^5 个样本Deeply-supervised nets|2014|6.0×10^5 个样本GoogLeNet / InceptionV1|2014|5.7×10^11 个样本Spatially-Sparse CNN|2014|9.0×10^5 个样本LRCN|2014|4.0×10^5 个样本SC-NLM|2014|5.0×10^6 个样本Cascaded LNet-ANet|2014|9.3×10^6 个样本TA-CNN|2014|4.5×10^4 个样本SNM-skip|2014|8.0×10^8 个样本Fractional Max-Pooling|2014|9.0×10^5 个样本ADAM (CIFAR-10)|2014|5.0×10^4 个样本VGG-Face|2015|2.6×10^6 个样本MSRA (C, PReLU)|2015|1.3×10^6 个样本DQN-2015|2015|1.2×10^7 个样本genCNN + dyn eval|2015|9.3×10^5 个样本TC-DNN-BLSTM-DNN|2015|2.9×10^7 个样本Fast R-CNN|2015|2.6×10^7 个样本U-Net|2015|7.9×10^6 个样本Faster R-CNN|2015|1.0×10^8 个样本CFSS|2015|1.4×10^5 个样本BatchNorm|2015|1.2×10^10 个样本Deep CNN + COTS|2015|4.9×10^5 个样本DCNN|2015|4.9×10^5 个样本BPE|2015|5.0×10^7 个样本AlphaGo Fan|2015|1.3×10^10 个样本SAF R-CNN|2015|3.5×10^5 个样本3DDFA|2015|2.9×10^5 个样本Inception v3|2015|1.2×10^6 个样本SSD|2015|2.3×10^6 个样本ResNet-101 (ImageNet)|2015|1.3×10^6 个样本ResNet-110 (CIFAR-10)|2015|5.0×10^4 个样本ResNet-152 (ImageNet)|2015|1.3×10^6 个样本Advantage Learning|2015|1.0×10^8 个样本Variational (untied weights, MC) LSTM (Large)|2015|9.3×10^5 个样本AlphaGo Lee|2016|3.0×10^8 个样本A3C FF hs|2016|2.0×10^8 个样本Inception-ResNet-V2|2016|1.3×10^6 个样本Inceptionv4|2016|1.3×10^6 个样本SqueezeNet|2016|1.3×10^6 个样本Named Entity Recognition model|2016|2.1×10^5 个样本Template Adaptation|2016|7.8×10^3 个样本Gated HORNN (3rd order)|2016|2.2×10^7 个样本LRR-4X|2016|1.5×10^8 个样本PixelCNN|2016|1.6×10^10 个样本R-FCN|2016|1.1×10^7 个样本CCL|2016|2.0×10^4 个样本SimpleNet|2016|1.3×10^6 个样本LF-MMI|2016|7.2×10^5 个样本MS-ensemble-speech-recognition|2016|1.1×10^10 个样本WaveNet|2016|1.2×10^10 个样本ResNet-1001|2016|5.0×10^4 个样本ResNet-200|2016|1.3×10^6 个样本Wide Residual Network|2016|1.3×10^6 个样本GNMT|2016|7.2×10^8 个样本Pointer Sentinel-LSTM (medium)|2016|9.3×10^5 个样本GAWWN|2016|2.4×10^5 个样本Xception|2016|3.5×10^8 个样本SPIDER2|2016|1.4×10^7 个样本BIDAF|2016|8.8×10^5 个样本NAS with base 8 and shared embeddings|2016|9.3×10^5 个样本NASv3 (CIFAR-10)|2016|4.5×10^4 个样本VD-LSTM+REAL Large|2016|9.3×10^5 个样本DLDL (PASCAL)|2016|2.3×10^4 个样本DTN (Domain Transfer Network)|2016|2.0×10^6 个样本DAC-CSR|2016|2.0×10^4 个样本ResNeXt-101 (64×4d)|2016|1.3×10^6 个样本ResNeXt-50|2016|1.3×10^6 个样本PolyNet|2016|1.3×10^6 个样本Image-to-image cGAN|2016|2.4×10^6 个样本PointNet|2016|9.8×10^3 个样本3DMM-CNN|2016|5.0×10^5 个样本HR-ResNet101|2016|8.2×10^6 个样本EnhanceNet|2016|9.8×10^9 个样本YOLOv2|2016|1.3×10^6 个样本DeepStack|2017|2.5×10^10 个样本OR-WideResNet|2017|5.0×10^4 个样本MoE-Multi|2017|8.7×10^10 个样本DnCNN|2017|2.6×10^9 个样本Prototypical networks|2017|3.8×10^4 个样本Mask R-CNN|2017|4.6×10^10 个样本MobileNet|2017|1.3×10^6 个样本DeepLab (2017)|2017|2.6×10^7 个样本Mnemonic Reader|2017|2.2×10^5 个样本SRGAN|2017|7.0×10^5 个样本Inflated 3D ConvNet|2017|2.4×10^5 个样本PointNet++|2017|6.0×10^4 个样本Reading Twice for NLU|2017|2.0×10^5 个样本Transformer (2017)|2017|8.3×10^8 个样本HRA|2017|1.5×10^8 个样本DeepLabV3|2017|8.4×10^9 个样本NoisyNet-Dueling|2017|3.2×10^8 个样本ShuffleNet v1|2017|1.3×10^6 个样本JFT|2017|5.5×10^12 个样本AWD-LSTM|2017|2.0×10^6 个样本NASNet-A|2017|1.3×10^6 个样本ConvS2S (ensemble of 8 models)|2017|1.2×10^9 个样本GSM|2017|2.2×10^5 个样本AWD-LSTM - 3-layer LSTM (tied) + continuous cache pointer (WT2)|2017|2.0×10^6 个样本RetinaNet-R101|2017|1.2×10^5 个样本RetinaNet-R50|2017|1.2×10^10 个样本EI-REHN-1000D|2017|9.3×10^5 个样本NeuMF (Pinterest)|2017|1.5×10^6 个样本GL-LWGC-AWD-MoS-LSTM + dynamic evaluation (WT2)|2017|2.0×10^6 个样本PyramidNet|2017|1.3×10^6 个样本SENet (ImageNet)|2017|1.3×10^6 个样本ISS|2017|9.3×10^5 个样本LSTM + dynamic eval|2017|9.0×10^7 个样本AWD-LSTM+WT+Cache+IOG (WT2)|2017|2.0×10^6 个样本AlphaGo Zero|2017|6.4×10^9 个样本PhraseCond|2017|1.6×10^5 个样本S-Norm|2017|1.1×10^6 个样本DCN+|2017|2.2×10^5 个样本Fraternal dropout + AWD-LSTM 3-layer (WT2)|2017|2.0×10^6 个样本VQ-VAE|2017|6.3×10^10 个样本AWD-LSTM-MoS + dynamic evaluation (WT2, 2017)|2017|2.0×10^6 个样本TriNet|2017|5.1×10^5 个样本DL scaling LM|2017|4.0×10^8 个样本DL scaling speech|2017|2.2×10^9 个样本AlphaZero|2017|3.5×10^9 个样本ELMo|2018|2.0×10^9 个样本QRNN|2018|1.0×10^8 个样本T-DMCA|2018|1.4×10^10 个样本DeepLabV3+|2018|8.7×10^9 个样本IMPALA|2018|1.1×10^10 个样本TCN (P-MNIST)|2018|6.0×10^4 个样本4 layer QRNN (h=2500)|2018|1.0×10^8 个样本YOLOv3|2018|5.4×10^6 个样本Dropout-LSTM+Noise(Bernoulli) (WT2)|2018|2.0×10^6 个样本ResNeXt-101 32x48d|2018|9.4×10^8 个样本aLSTM(depth-2)+RecurrentPolicy (WT2)|2018|2.0×10^6 个样本GPT-1|2018|1.3×10^9 个样本Relational Memory Core|2018|4.0×10^9 个样本MobileNetV2|2018|1.3×10^6 个样本FTW (For The Win)|2018|2.0×10^9 个样本Big-Little Net|2018|1.3×10^6 个样本Big-Little Net (speech)|2018|7.2×10^8 个样本AWD-LSTM-MoS+PDR + dynamic evaluation (WT2)|2018|2.0×10^6 个样本Big Transformer for Back-Translation|2018|4.5×10^9 个样本(ensemble): AWD-LSTM-DOC (fin) × 5 (WT2)|2018|2.0×10^6 个样本AWD-LSTM-MoS + dynamic evaluation (WT2, 2018)|2018|2.0×10^6 个样本Transformer + Simple Recurrent Unit|2018|1.1×10^8 个样本LSTM+NeuralCache|2018|2.0×10^6 个样本Transformer (Adaptive Input Embeddings) WT103|2018|1.0×10^8 个样本BERT-Large|2018|2.7×10^9 个样本TrellisNet|2018|1.0×10^8 个样本MemoReader|2018|1.1×10^6 个样本Mesh-TensorFlow Transformer 2.9B (translation)|2018|1.6×10^9 个样本Mesh-TensorFlow Transformer 4.9B (language)|2018|5.0×10^9 个样本Fine-tuned-AWD-LSTM-DOC (fin)|2018|1.0×10^6 个样本GPipe (Transformer)|2018|1.5×10^12 个样本Multi-cell LSTM|2018|9.3×10^5 个样本SPN (ImageNet 128)|2018|2.5×10^11 个样本StyleGAN|2018|5.0×10^7 个样本Transformer ELMo|2019|2.0×10^9 个样本Transformer-XL (257M)|2019|1.0×10^8 个样本Hanabi 4 player|2019|2.0×10^10 个样本MT-DNN|2019|1.0×10^6 个样本GPT-2 (1.5B)|2019|1.1×10^10 个样本KataGo|2019|2.4×10^8 个样本SciBERT|2019|3.2×10^9 个样本True-Regularization+Finetune+Dynamic-Eval|2019|9.3×10^5 个样本WeNet (Penn Treebank)|2019|9.3×10^5 个样本Transformer-XL + RMS dynamic eval|2019|1.0×10^8 个样本BERT-Large-CAS (PTB+WT2+WT103)|2019|1.3×10^9 个样本Neuro-Symbolic Concept Learner|2019|1.0×10^5 个样本ResNeXt-101 Billion-scale|2019|9.0×10^7 个样本AWD-LSTM-DRILL + dynamic evaluation† (WT2)|2019|2.0×10^6 个样本EfficientNet-L2|2019|1.3×10^6 个样本DLRM-2020|2019|3.9×10^7 个样本XLNet|2019|3.3×10^10 个样本Transformer-XL Large + Phrase Induction|2019|1.0×10^8 个样本AWD-LSTM + MoS + Partial Shuffled|2019|2.0×10^6 个样本Char-CNN-BiLSTM|2019|9.3×10^5 个样本FixRes ResNeXt-101 WSL|2019|9.4×10^8 个样本LaNet-L (CIFAR-10)|2019|6.0×10^4 个样本BigBiGAN|2019|2.6×10^6 个样本RoBERTa Large|2019|4.3×10^10 个样本Mogrifier (d2, MoS2, MC) + dynamic eval|2019|2.0×10^6 个样本UDSMProt|2019|1.5×10^8 个样本Megatron-BERT|2019|7.0×10^9 个样本Megatron-LM (1.2B)|2019|1.6×10^11 个样本Megatron-LM (8.3B)|2019|4.6×10^10 个样本ALBERT|2019|3.3×10^9 个样本Adaptive Inputs + LayerDrop|2019|1.0×10^8 个样本AlphaX-1|2019|6.1×10^7 个样本DistilBERT|2019|5.0×10^8 个样本T5-11B|2019|3.4×10^10 个样本T5-3B|2019|5.1×10^9 个样本BART-large|2019|4.3×10^10 个样本Base LM + kNN LM + Continuous Cache|2019|1.0×10^8 个样本XLM-RoBERTa|2019|1.7×10^11 个样本CamemBERT|2019|2.9×10^10 个样本Noisy Student (L2)|2019|8.1×10^7 个样本Sandwich Transformer|2019|7.0×10^8 个样本MoCo|2019|9.4×10^8 个样本MuZero|2019|1.2×10^10 个样本Transformer - LibriVox + Decoding/Rescoring|2019|9.8×10^8 个样本Photo-Geometric Autoencoder|2019|8.2×10^8 个样本Transformer-XL DeFINE (141M)|2019|1.0×10^8 个样本StarGAN v2|2019|4.0×10^5 个样本StyleGAN2|2019|1.1×10^8 个样本MMLSTM (PTB)|2019|9.3×10^5 个样本MMLSTM (WT-2)|2019|2.0×10^6 个样本OpenAI Five|2019|4.5×10^11 个样本OpenAI Five Rerun|2019|5.3×10^10 个样本DD-PPO|2019|2.5×10^9 个样本Big Transfer (BiT-L)|2019|3.0×10^8 个样本AlphaFold|2020|6.6×10^9 个样本Meena|2020|5.3×10^10 个样本Perceiver IO (optical flow)|2020|1.5×10^11 个样本TaLK Convolution|2020|1.0×10^8 个样本Theseus 6/768|2020|3.9×10^5 个样本ALBERT-xxlarge|2020|3.3×10^9 个样本FFN SwiGLU|2020|5.1×10^10 个样本SimCLR|2020|1.1×10^10 个样本Turing-NLG|2020|4.6×10^10 个样本Feedback Transformer|2020|1.0×10^8 个样本TCAN (WT2)|2020|2.0×10^6 个样本Routing Transformer (WT-103)|2020|1.0×10^8 个样本TransformerXL + spectrum control|2020|1.0×10^8 个样本Tensor-Transformer(1core)+PN (WT103)|2020|1.0×10^8 个样本ELECTRA|2020|3.3×10^10 个样本MetNet|2020|7.1×10^9 个样本Go-explore|2020|4.0×10^10 个样本Once for All|2020|1.3×10^6 个样本ContextNet|2020|3.5×10^8 个样本Retrieval-Augmented Generator|2020|3.1×10^6 个样本DETR|2020|8.3×10^5 个样本GPT-3 175B (davinci)|2020|2.4×10^11 个样本GShard (dense)|2020|3.5×10^11 个样本DeLighT|2020|1.0×10^8 个样本ERNIE-GEN (large)|2020|1.2×10^11 个样本ProBERTa|2020|5.8×10^7 个样本LUKE|2020|4.7×10^9 个样本German ELECTRA Large|2020|3.6×10^10 个样本mT5-XXL|2020|1.0×10^12 个样本ViT-Base/32|2020|3.0×10^8 个样本ViT-Huge/14|2020|3.0×10^8 个样本wave2vec 2.0 LARGE|2020|4.6×10^9 个样本KEPLER|2020|3.5×10^9 个样本AlphaFold 2|2020|5.7×10^9 个样本CPM-Large|2020|1.7×10^10 个样本ESM1b|2020|2.8×10^10 个样本VQGAN + CLIP|2020|2.5×10^11 个样本CT-MoS (WT2)|2020|2.0×10^6 个样本DensePhrases|2020|5.8×10^7 个样本ERNIE-Doc (247M)|2021|1.0×10^8 个样本CLIP (ResNet-50)|2021|4.0×10^8 个样本CLIP (ViT L/14@336px)|2021|4.0×10^8 个样本DALL-E|2021|3.2×10^11 个样本BigSSL|2021|1.0×10^11 个样本Switch|2021|8.6×10^10 个样本DeiT-B|2021|3.8×10^6 个样本top-down frozen classifier|2021|3.4×10^6 个样本MSA Transformer|2021|1.4×10^12 个样本SRU++ Large|2021|1.0×10^8 个样本Meta Pseudo Labels|2021|1.3×10^8 个样本Generative BST|2021|5.7×10^10 个样本M6-T|2021|1.1×10^11 个样本PLUG|2021|6.0×10^10 个样本ProtBERT-BFD|2021|5.9×10^10 个样本ProtT5-XL-U50|2021|2.0×10^10 个样本ADM|2021|1.3×10^14 个样本MedBERT|2021|1.5×10^10 个样本ByT5-XXL|2021|1.1×10^12 个样本CogView|2021|9.7×10^11 个样本Transformer local-attention (NesT-B)|2021|1.3×10^6 个样本ViT-G/14|2021|3.0×10^9 个样本ALIGN|2021|1.8×10^9 个样本CoAtNet|2021|8.9×10^13 个样本DeBERTa|2021|2.1×10^10 个样本Denoising Diffusion Probabilistic Models (LSUN Bedroom)|2021|6.0×10^11 个样本EMDR|2021|1.7×10^11 个样本StyleGAN3-R|2021|5.0×10^7 个样本StyleGAN3-T|2021|5.0×10^7 个样本Fold2Seq|2021|4.6×10^4 个样本Adaptive Input Transformer + RD|2021|1.0×10^8 个样本Codex|2021|5.3×10^10 个样本ERNIE 3.0|2021|3.8×10^11 个样本GOAT|2021|8.0×10^14 个样本HuBERT|2021|8.6×10^8 个样本SEER|2021|1.0×10^9 个样本6-Act Tether|2021|1.3×10^8 个样本YOLOX-X|2021|2.5×10^6 个样本Jurassic-1-Jumbo|2021|3.0×10^11 个样本DNABERT|2021|1.4×10^9 个样本XLMR-XXL|2021|1.7×10^11 个样本FLAN 137B|2021|2.5×10^12 个样本MEB|2021|5.0×10^11 个样本PermuteFormer|2021|1.0×10^8 个样本HyperCLOVA 204B|2021|5.6×10^11 个样本PLATO-XL|2021|1.5×10^11 个样本AlphaFold-Multimer|2021|5.7×10^7 个样本Megatron-Turing NLG 530B|2021|2.7×10^11 个样本Yuan 1.0|2021|1.8×10^11 个样本base LM+GNN+kNN|2021|1.0×10^8 个样本Eve|2021|2.4×10^10 个样本EfficientZero|2021|1.0×10^5 个样本Projected GAN|2021|3.0×10^6 个样本S4|2021|1.0×10^8 个样本ViT-G/14 (LiT)|2021|1.0×10^12 个样本AliceMind-MMU|2021|1.3×10^7 个样本BASIC-L|2021|8.9×10^12 个样本Florence|2021|7.5×10^9 个样本NÜWA|2021|5.6×10^9 个样本Gopher (280B)|2021|3.0×10^11 个样本Student of Games|2021|2.5×10^11 个样本GLaM|2021|6.0×10^11 个样本LongT5|2021|5.2×10^11 个样本Contriever|2021|2.6×10^11 个样本LDM-1.45B|2021|2.9×10^11 个样本XGLM-7.5B|2021|5.0×10^11 个样本ERNIE 3.0 Titan|2021|6.7×10^11 个样本data2vec (language)|2022|1.3×10^11 个样本data2vec (speech)|2022|1.8×10^7 个样本data2vec (vision)|2022|2.5×10^8 个样本OntoProtein|2022|2.9×10^9 个样本InstructGPT 175B|2022|1.7×10^7 个样本AlphaCode|2022|9.7×10^11 个样本RETRO-7B|2022|4.2×10^11 个样本GPT-NeoX-20B|2022|3.4×10^11 个样本LaMDA|2022|2.1×10^12 个样本ProteinBERT|2022|3.8×10^10 个样本ST-MoE|2022|1.5×10^12 个样本PolyCoder|2022|3.9×10^10 个样本DeepNet|2022|2.7×10^11 个样本Statement Curriculum Learning|2022|3.7×10^11 个样本ViT-G (model soup)|2022|1.8×10^9 个样本Make-A-Scene|2022|2.7×10^11 个样本Segatron-XL large, M=384 + HCP|2022|1.0×10^8 个样本Chinchilla|2022|1.4×10^12 个样本PaLM (540B)|2022|7.8×10^11 个样本DALL·E 2|2022|1.7×10^11 个样本Sparse all-MLP|2022|1.0×10^11 个样本Flamingo|2022|4.6×10^11 个样本OPT-175B|2022|1.8×10^11 个样本UL2|2022|1.0×10^12 个样本Gato|2022|5.2×10^11 个样本SimCSE|2022|2.7×10^7 个样本GPT-2 Medium (FlashAttention)|2022|1.0×10^10 个样本Tranception|2022|4.8×10^10 个样本CogVideo|2022|1.5×10^11 个样本DITTO|2022|1.0×10^8 个样本CoCa|2022|1.4×10^12 个样本MetaLM|2022|6.5×10^11 个样本Parti|2022|4.7×10^12 个样本ProGen2-xlarge|2022|3.5×10^11 个样本Minerva (540B)|2022|2.6×10^10 个样本CodeT5-large|2022|1.1×10^10 个样本NLLB|2022|3.0×10^11 个样本BLOOM-176B|2022|3.8×10^11 个样本ESM2-15B|2022|1.5×10^10 个样本OmegaPLM|2022|1.3×10^12 个样本AlexaTM 20B|2022|1.3×10^12 个样本GLM-130B|2022|1.5×10^11 个样本BlenderBot 3|2022|1.3×10^9 个样本PaLI|2022|1.4×10^11 个样本Whisper|2022|1.2×10^10 个样本DiffDock|2022|4.4×10^6 个样本GenSLM|2022|2.3×10^11 个样本Flan-PaLM 540B|2022|1.4×10^9 个样本LMSI-Palm|2022|1.9×10^6 个样本U-PaLM (540B)|2022|1.3×10^9 个样本Mogrifier RLSTM (WT2)|2022|2.7×10^6 个样本eDiff-I|2022|1.6×10^12 个样本mT0-13B|2022|2.0×10^10 个样本InternImage|2022|8.4×10^10 个样本EVA-01|2022|7.6×10^9 个样本Galactica|2022|1.1×10^11 个样本Fusion in Encoder|2022|9.6×10^5 个样本ALM 1.0|2022|2.3×10^10 个样本DiT-XL/2 + Discriminator Guidance|2022|3.3×10^8 个样本Discriminator Guidance|2022|3.3×10^8 个样本DeepNash|2022|2.1×10^12 个样本Vega v2|2022|6.4×10^9 个样本CaLM|2022|2.5×10^9 个样本Hybrid H3-2.7B|2022|4.0×10^11 个样本VALL-E|2023|7.7×10^10 个样本DreamerV3|2023|1.6×10^9 个样本Ankh_large|2023|1.4×10^10 个样本Nucleotide Transformer|2023|3.0×10^11 个样本DDPM-IP (CelebA)|2023|8.3×10^8 个样本BLIP-2 (Q-Former)|2023|2.3×10^9 个样本ProteinDT|2023|1.3×10^8 个样本ViT-22B|2023|4.0×10^9 个样本LLaMA-65B|2023|1.4×10^12 个样本AudioGen|2023|2.3×10^11 个样本Falcon-40B|2023|1.0×10^12 个样本GPT-4 (Mar 2023)|2023|5.4×10^12 个样本LEP-AD|2023|1.2×10^6 个样本PanGu-Σ|2023|3.3×10^11 个样本SigLIP 400M|2023|6.7×10^12 个样本BloombergGPT|2023|5.7×10^11 个样本VideoMAE V2|2023|1.2×10^9 个样本Segment Anything Model|2023|1.1×10^9 个样本Incoder-6.7B|2023|5.2×10^10 个样本DINOv2|2023|3.6×10^10 个样本Agile Soccer Robot|2023|3.1×10^9 个样本PaLM 2|2023|3.6×10^12 个样本StarCoder|2023|2.0×10^11 个样本CoEdiT-xxl|2023|1.1×10^6 个样本Med-PaLM 2|2023|1.6×10^7 个样本CodeT5+|2023|5.2×10^10 个样本ONE-PEACE|2023|4.9×10^11 个样本Goat-7B|2023|4.4×10^7 个样本MusicGen|2023|1.4×10^13 个样本GPT-4 (Jun 2023)|2023|5.4×10^12 个样本HyenaDNA|2023|3.0×10^9 个样本InternLM|2023|1.6×10^12 个样本Pangu-Weather|2023|2.5×10^13 个样本xTrimoPGLM -100B|2023|2.8×10^11 个样本Llama 2-70B|2023|2.0×10^12 个样本Llama 2-7B|2023|2.0×10^12 个样本AudioLM|2023|1.3×10^11 个样本Qwen-VL|2023|5.0×10^11 个样本PeptideBERT|2023|4.2×10^6 个样本Jais|2023|4.0×10^11 个样本Swift|2023|1.2×10^8 个样本Falcon-180B|2023|3.5×10^12 个样本AlphaMissense|2023|2.3×10^9 个样本Amazon Titan|2023|4.0×10^12 个样本Show-1|2023|1.6×10^14 个样本FinGPT-13B|2023|7.7×10^4 个样本RoseTTAFold All-Atom (RFAA)|2023|6.3×10^7 个样本Ferret (13B)|2023|1.7×10^8 个样本CODEFUSION (Python)|2023|4.4×10^6 个样本ChatGLM3-6B|2023|1.4×10^12 个样本Skywork-13B|2023|3.2×10^12 个样本BLUUMI|2023|3.8×10^10 个样本Grok-1|2023|6.2×10^12 个样本Yi-34B|2023|3.1×10^12 个样本RoFormer|2023|3.3×10^9 个样本mPLUG-Owl2|2023|1.8×10^11 个样本Nemotron-3-8B|2023|3.8×10^12 个样本GNoME for crystal discovery|2023|6.9×10^4 个样本Qwen-72B|2023|3.0×10^12 个样本Mamba-24M (SC09)|2023|9.7×10^4 个样本Llama Guard|2023|4.1×10^6 个样本VILA-13B|2023|3.2×10^10 个样本nekomata-14b|2023|6.6×10^10 个样本Qwen1.5-72B|2024|3.0×10^12 个样本Aya|2024|1.1×10^12 个样本Aramco Metabrain AI|2024|7.0×10^12 个样本DBRX|2024|1.2×10^13 个样本ReALM|2024|1.3×10^11 个样本Llama 3-70B|2024|1.5×10^13 个样本VILA1.5-13B|2024|3.2×10^10 个样本AlphaFold 3|2024|3.0×10^10 个样本Yi-Large|2024|3.0×10^12 个样本GLM-4 (0520)|2024|1.0×10^13 个样本ALLaM adapted 70B|2024|6.0×10^11 个样本Qwen2-72B|2024|7.0×10^12 个样本Nemotron-4 340B|2024|9.0×10^12 个样本DeepSeek-Coder-V2 236B|2024|3.2×10^12 个样本ESM3 (98B)|2024|7.7×10^11 个样本Llama 3.1-405B|2024|1.6×10^13 个样本AFM-on-device|2024|7.6×10^12 个样本AFM-server|2024|7.4×10^12 个样本LLaVA-OV-72B|2024|3.8×10^10 个样本Table Tennis Agent|2024|2.4×10^9 个样本Qwen2.5-32B|2024|1.8×10^13 个样本Qwen2.5-72B|2024|1.8×10^13 个样本Telechat2-115B|2024|1.0×10^13 个样本PixelDance|2024|1.1×10^14 个样本Movie Gen Video|2024|3.4×10^9 个样本NVLM-D 72B|2024|5.7×10^10 个样本NVLM-H 72B|2024|1.3×10^11 个样本NVLM-X 72B|2024|4.6×10^10 个样本Doubao-pro|2024|8.4×10^12 个样本Hunyuan-Large|2024|7.0×10^12 个样本Llama 3.3 70B|2024|1.5×10^13 个样本EXAONE 3.5 32B|2024|6.5×10^12 个样本DeepSeek-V3|2024|1.5×10^13 个样本DeepSeek-R1|2025|1.5×10^13 个样本Doubao-1.5-pro|2025|9.0×10^12 个样本Eurus-2-7B-PRIME|2025|8.3×10^5 个样本Hunyuan-TurboS|2025|1.6×10^13 个样本EXAONE Deep 32B|2025|1.2×10^10 个样本DeepSeek-V3 (Mar 2025)|2025|1.5×10^13 个样本Llama 4 Behemoth (preview)|2025|3.0×10^13 个样本Llama 4 Maverick|2025|3.0×10^13 个样本Llama 4 Scout|2025|3.0×10^13 个样本Pangu Ultra|2025|1.3×10^13 个样本Qwen3-235B-A22B|2025|3.6×10^13 个样本Seed1.5-VL|2025|3.0×10^12 个样本DeepSeek-R1 (May 2025)|2025|1.5×10^13 个样本EXAONE Path 2.0|2025|1.4×10^5 个样本Kimi K2|2025|1.6×10^13 个样本EXAONE 4.0 (32B)|2025|1.4×10^13 个样本Qwen3-Coder-480B-A35B|2025|7.5×10^12 个样本Qwen3-235B-A22B (Jul 2025)|2025|3.6×10^13 个样本Qwen3-235B-A22B-Thinking (Jul 2025)|2025|3.6×10^13 个样本GLM-4.5|2025|2.3×10^13 个样本LongCat-Flash|2025|2.3×10^13 个样本Qwen3-Max|2025|3.6×10^13 个样本AgentFounder-30B|2025|3.2×10^11 个样本Qwen3-Omni-30B-A3B|2025|2.0×10^12 个样本GLM-4.6|2025|2.3×10^13 个样本Ling-1T|2025|2.0×10^13 个样本Olmo 3|2025|5.5×10^12 个样本K-EXAONE|2026|1.1×10^13 个样本Solar Open 100B|2026|2.0×10^13 个样本MiMo-V2.5-Pro|2026|2.7×10^13 个样本Solar Open2 250B|2026|1.1×10^13 个样本Inkling|2026|4.5×10^13 个样本语言视觉多领域其他生物游戏语音图像生成机器人
每个点为一个知名 AI 模型,纵轴=训练数据集规模(对数轴,样本 / token 数),按应用领域着色;共 662 个模型。

训练算力纪录:历年刷新前沿的模型

下表为在其发布时刷新「已知最高训练算力」纪录的模型(按算力升序刷新),倒序展示最近 12 个纪录。

年份模型领域训练算力(petaFLOP)
2025Grok 4其他5.0×10¹¹
2025GPT-4.5其他3.8×10¹¹
2025Grok 3其他3.5×10¹¹
2023Gemini 1.0 Ultra其他5.0×10¹⁰
2023GPT-4 (Mar 2023)其他2.1×10¹⁰
2022Minerva (540B)其他2.7×10⁹
2022GPT-3.5 (davinci-002)其他2.6×10⁹
2021FLAN 137B其他2.1×10⁹
2021Jurassic-1-Jumbo其他3.7×10⁸
2020GPT-3 175B (davinci)其他3.1×10⁸
2020Meena其他1.1×10⁸
2019AlphaStar其他1.1×10⁸

延伸阅读

数据来源:Epoch AI「Notable AI models」数据集(CC BY 4.0), 经 Our World in Data 整理。原始数据页:训练算力 ·参数量 ·训练数据量。 数据于 2026-09-01 抓取,慢数据(约年度更新)、定期刷新;各图纵轴均为对数刻度。 本页仅客观呈现已公开数据,不预测、不构成任何投资建议。