Vergelijking van Architecturen

Naarmate computertaken verschuiven van algemene software naar zware graphics, AI en enorme datastromen, is de hardware fundamenteel gespecialiseerd. Waar een systeem vroeger alles met één centrale processor deed, worden intensieve rekentaken nu gedelegeerd aan chips met een architectuur die is geoptimaliseerd voor een specifiek type wiskunde of dataverkeer.
| Processor | Architectonisch Verschil | Primaire Toepassing | Voordeel | Nadeel |
| CPU Central Processing Unit | De Generalist: Focus op lage latency en complexe sequentiële logica via een paar zeer snelle rekenkernen. | Besturingssystemen, lokale webservers (bijv. PHP/MySQL-stacks), en specifieke CPU-mining algoritmes zoals Yescrypt of MinotaurX. | Extreem flexibel; onmisbaar voor complexe if/then-vertakkingen en het daadwerkelijk aansturen van hardware. | Inefficiënt voor het gelijktijdig uitvoeren van miljoenen simpele berekeningen. |
| GPU Graphics Processing Unit | De Parallelle Werker: Bevat duizenden kleinere, eenvoudigere rekenkernen die allemaal tegelijkertijd opereren. | Rendering van graphics, GPU-crypto mining (zoals Rinhash/Ethash), en het zware rekenwerk bij het trainen van AI-modellen. | Enorme ruwe rekenkracht voor wiskunde die perfect parallel kan worden opgesplitst. | Hoog stroomverbruik, hitteontwikkeling en totaal ongeschikt voor logische stapsgewijze taken. |
| TPU Tensor Processing Unit | De AI-Trainer: Een door Google ontwikkelde ASIC, specifiek en uitsluitend ontworpen voor matrix-vermenigvuldiging (tensoren). | Grootschalige machine learning, het trainen van zware AI-modellen (TensorFlow) in datacenters. | Vele malen sneller en energie-efficiënter in AI-wiskunde dan een traditionele GPU. | Een gesloten, duur ecosysteem (grotendeels cloud-based) dat onbruikbaar is voor algemene applicaties. |
| NPU Neural Processing Unit | De Lokale AI-assistent: Een zeer compacte co-processor, inmiddels vaak direct ingebakken op de hoofdchip in moderne telefoons en laptops. | ‘Edge AI’: real-time gezichtsherkenning, webcam-achtergrondvervaging en lichte lokale AI-assistenten op accustroom. | Buitengewoon energiezuinig; voorkomt dat de zware hoofd-CPU wakker moet blijven voor lichte inferentietaken. | Heeft beperkte rekenkracht; absoluut ongeschikt om modellen zelf te trainen. |
| LPU Language Processing Unit | De Token-Generator: Een unieke architectuur (zoals die van Groq) met ultrasnel SRAM-geheugen direct naast de rekenkernen. | Real-time inferentie (het genereren van de tekst) van Large Language Models zoals Llama, Claude of ChatGPT. | Zorgt voor ongekend lage latency en genereert honderden tekst-tokens per seconde. | Extreem exclusief voor LLM-inferentie ontworpen; zeer beperkte geheugencapaciteit per individuele chip. |
| DPU Data Processing Unit | De Verkeersregelaar: Een processor met eigen netwerkinterfaces en specifieke hardwareversnellers voor datapakketten. | Zware datacenter-omgevingen, netwerkbeveiliging (encryptie op gigabit-snelheden) en data-routering. | Maakt de hoofd-CPU’s van servers volledig vrij voor de daadwerkelijke web- of applicatiesoftware. | Biedt geen enkele toegevoegde waarde in een particuliere desktop of laptop. |
Begrijpen via de Hardware-Bottleneck
De explosie aan nieuwe chipnamen (TPU, NPU, LPU) komt niet doordat de wiskunde per se verandert, maar omdat ingenieurs specifieke hardware-knelpunten wilden elimineren:
- De Reken-Bottleneck: Een CPU raakt overweldigd bij het minen of grafisch renderen omdat hij alles in een lange, enkele rij afhandelt. De GPU lost dit op door duizenden kassa’s tegelijk te openen.
- De Wiskunde-Bottleneck: GPU’s zijn geweldig in parallel werken, maar neurale netwerken bestaan volledig uit het vermenigvuldigen van massieve roosters met getallen (matrices). TPU’s en NPU’s schrappen alle grafische hardware om fysiek meer ruimte te maken voor pure matrix-wiskunde.
- De Geheugen-Bottleneck: Bij het praten met een AI (inferentie) moet de chip voor elk woord continu naar het geheugen grijpen. Dat duurt naar verhouding lang, zelfs voor een GPU. De LPU pakt dit aan door het geheugen letterlijk aan de processor te bouwen, waardoor datatransporttijd vrijwel nul wordt.
- De Netwerk-Bottleneck: In een druk datacenter verliest een CPU soms een kwart van zijn capaciteit puur aan het controleren en versleutelen van inkomend verkeer. De DPU fungeert als een geavanceerde portier die de CPU van die administratie verlost.
Processor Trade-off Matrix
Vergelijk architectuur, doorvoer en flexibiliteit van moderne verwerkingseenheden
| CPU Central Processing Unit | Sequentieel | ~100 GB/s | 10 | Hoge latentie bij complexe stuurlogica en dynamische vertakkingen. |
| GPU Graphics Processing Unit | Parallel (SIMD) | ~2.0 TB/s | 7 | Massaal parallelle SIMD-workloads en visuele rendering. |
| DPU Data Processing Unit | I/O & Netwerk | ~800 GB/s | 5 | CPU-overhead door netwerk-, opslag- en encryptietaken. |
| TPU Tensor Processing Unit | Matrix (Systolic) | ~1.2 TB/s | 4 | Von Neumann geheugen-bottleneck bij grootschalige AI-training. |
| NPU Neural Processing Unit | Matrix (Low-Power) | ~200 GB/s | 3 | Energieverbruik en batterijduur bij on-device AI-inferentie. |
| LPU Language Processing Unit | Sequentieel-Stream | ~8.0 TB/s | 1 | DRAM-bandbreedte bij autoregressieve LLM-tokengeneratie. |
