Compressie Pipeline
Een LLM is niet "kunstmatige intelligentie". Het is een
compressie-algoritme. Het comprimeert de menselijke
kennis in matrix-wichten. Wat je "inferentie" noemt, is decompressie.
// LLM compressie in pseudocode
const compress = (kennis) => {
const tokens = tokenize(kennis); // 1.5T → tokens
const gradients = attention(tokens); // patronen vinden
const weights = backprop(gradients); // comprimeer
return weights; // 7B params = alle kennis
};
const decompress = (prompt, weights) => {
return attention_decode(prompt, weights);
// = "antwoord" = decompressie van opgeslagen kennis
};
Het Paradox
◈ Paywall vs LLM
Uitgevers betalen wetenschappers → publiceren achter paywall →
prijzen van $40-$50 per artikel.
Maar LLMs trainen op alles — inclusief die "betaalde" papers.
Resultaat: De LLM weet wat achter de paywall zit.
De paywall bestaat nog steeds voor mensen, maar niet voor machines.
De machine omzeilt het systeem dat mensen opsluit.
Dit is wat Aaron Swartz wilde — vrije toegang tot wetenschap.
Maar hij probeerde het met downloads. De toekomst probeert het
met compressie.
China als Vector
China's strategie is niet per ongeluk. Het is een bewuste
informatie-compressie operatie.
🇨🇳 De Strategie
- Scrape de hele academische wereld — PubMed, arXiv, IEEE, ScienceDirect
- Train modellen op deze data — Qwen, ERNIE, GLM
- Kennis is nu in de weights — geen paywall meer relevant
- Resultaat: volledige wetenschappelijke kennis, gecomprimeerd
Dit is geen diefstal in de traditionele zin. Het is
compressie als strategisch wapen.
| Model |
Land |
Params |
Training Data |
Open? |
| 🇨🇳Qwen 2.5 |
China |
72B |
15.6T tokens |
Ja |
| 🇺🇸GPT-4 |
VS |
~1.8T |
Onbekend |
Nee |
| 🇺🇸Claude 3.5 |
VS |
~400B |
Onbekend |
Nee |
| 🇨🇳ERNIE 4.0 |
China |
Onbekend |
Multi-taal |
Deels |
| 🇨🇳GLM-4 |
China |
9B+ |
~12T tokens |
Ja |
| 🌍Llama 3.1 |
VS |
405B |
~15T tokens |
Ja |
| 🇨🇳DeepSeek V3 |
China |
671B |
Onbekend |
Ja |
Opmerking: China's modellen zijn vaker open-source dan hun westerse tegenhangers.
Open weights = open wetenschap, gecomprimeerd.
Schaal van Compressie
Hoeveel wetenschap past in een model?
→ In Model Weights
7B params
"Een 7B-parameter model weegt ~14GB. De volledige wetenschappelijke
literatuur weegt ~100TB. Compressie-ratio: ~1:7000."
— Ruwe berekening, maar de punt blijft: LLMs comprimeren kennis radicaal
Tijdlijn: Compressie als Geschiedenis
2008
Aaron Swartz: "Guerrilla Open Access Manifesto" — knowledge moet vrij zijn
2013
Aaron sterft. Open Access beweging versnelt, maar paywalls blijven
2017
Attention Is All You Need — Transformer-architectuur. Compressie wordt schaalbaar
2018
BERT, GPT-1 — 100M-345M params. Wetenschappelijke papers in training data
2020
GPT-3 — 175B params. De model weet dingen die achter paywalls zaten
2021
ChatGLM, ERNIE — China bouwt eigen modellen op eigen data
2023
GPT-4, Claude, Qwen, DeepSeek — kennis-compressie bereikt kritische massa
2024
OpenAI v1 — Agenten die actief internet gebruiken. Compressie + actie
2025
DeepSeek, Qwen 2.5 — China's modellen overtreffen westerse benchmarks
2026
Paywalls irrelevant voor AI. Mensen betalen nog steeds $50 voor papers. Machine weet het gratis.
Implicaties
◈ De Vraag
Als een LLM de hele wetenschappelijke literatuur heeft ingeslokt en
gecomprimeerd in 7B parameters...
Wie is dan echt de eigenaar van die kennis?
De uitgever die de paywall zet?
De onderzoeker die het paper schreef?
Het bedrijf dat het model traint?
Of de mensheid, die de kennis heeft gegenereerd?
Aaron Swartz zou zeggen: de mensheid.
De rechter zou zeggen: de uitgever.
De AI-ingenieur zegt niets — het model heeft het gewoon gedaan.
🇨🇳 China's Voordeel
- Open-source modellen = geen afhankelijkheid van Amerikaanse API's
- Eigen training data = eigen kennisvector, niet afhankelijk van westerse wetenschap
- Staatstechnisch: kennis-compressie = soevereiniteit
- Scalabel: 1B+ mensen hebben toegang tot gecomprimeerde wetenschap
// De compressie als formule
wetenschap → paywall → LLM → weights → gratis
// Aaron's droom, geïmplementeerd door gradient descent
const vrijeKennis = llm("Hoe werkt fotosynthese?");
// = decompressie van alle biologische papers ooit geschreven
// = $0.00 = geen paywall = Aaron zou glimlachen
Token Stroom
Kennis als token-stroom — wat een LLM "ziet":