AI Zonder de Hype: Een Gids voor Werkende Engineers
Een nuchtere, praktische introductie tot het gebruik van LLM's en ML-tools in echte projecten, zonder buzzwoorden of magisch denken.
Het meeste AI-content online valt in twee kampen: ondergang over superintelligentie, of opgetogen bewering dat een chatbot je baan volgende dinsdag vervangt. Geen van beide helpt je iets op te leveren. Deze gids slaat beide over en loopt je door hoe je de huidige generatie AI-tools in echte projecten gebruikt, met de beperkingen expliciet gemaakt.
Wat een LLM werkelijk doet
Een groot taalmodel zoals GPT-4 of Llama 3 voorspelt het volgende token in een reeks, getraind op enorme hoeveelheden tekst. Dat is alles. Er is geen interne feitenchecker, geen blijvend geheugen tussen sessies (tenzij je dat bouwt), en geen begrip op de manier waarop een persoon begrijpt. Wanneer je het een vraag stelt, genereert het een statistisch aannemelijke voortzetting van je prompt.
Dit is praktisch van belang: het model genereert zelfverzekerd een Python-functie die een bibliotheekmethod aanroept die niet bestaat, omdat die method klinkt als iets wat de bibliotheek zou hebben. Voer de code altijd uit. Controleer altijd de API-reference. Behandel modeloutput als een eerste concept van een snelle, goed belezen stagiair die soms onbewust liegt.
Een echte workflow: een LLM gebruiken voor code
Hier is een patroon dat werkt in plaats van ChatGPT gewoon te vragen "bouw me een app":
- Schrijf de functiesignatuur en docstring zelf, specificieer types en randgevallen.
- Vraag het model om het tegen exact die spec uit te voeren.
- Schrijf je eigen tests apart — vraag het model niet tests te schrijven voor code die het zojuist schreef, het zal tests schrijven die triviaal slagen.
- Voer de tests uit. Voer fouten in als nieuwe prompts, geen vage "het werkt niet" stellingen.
def parse_duration(text: str) -> int:
"""
Parse strings like '1h30m', '45s', '2d' into total seconds.
Raise ValueError on invalid input.
"""
Het geven van het model dit exacte contract produceert veel beter output dan een lossse beschrijving, en het geeft je iets concreets om tegen te testen.
Retrieval-augmented generation, in duidelijke termen
RAG wordt als buzzwoord rondgegooid maar het mechanisme is eenvoudig: in plaats van te vertrouwen op wat het model tijdens training onthield, haal je relevante documenten op query-tijd op en stop je ze in de prompt.
Een basisopstelling:
- Verdeel je documenten (500-1000 tokens elk is een gebruikelijk startpunt).
- Embed elk stuk met een model als
text-embedding-3-smallof een open model alsbge-small-en. - Sla vectoren op in iets als Postgres met
pgvector, of een specifieke store als Qdrant. - Op query-tijd, embed de vraag van de gebruiker, voer een gelijkenisszoeken uit (cosinusafstand is standaard), en haal de top-k stukken in de prompt naast de vraag.
SELECT content FROM docs
ORDER BY embedding <=> '[0.012, -0.045, ...]'
LIMIT 5;
Dit is waarom een chatbot getraind op data tot een bepaalde datum nog steeds vragen over je interne wiki van vorige week kan beantwoorden. Het redeneert niet over je bedrijf — het leest je documenten en vat ze samen.
Waar klassieke ML nog steeds wint
Niet elk probleem heeft een transformer nodig. Als je churn voorspelt op basis van gestructureerde tabelgegevens — accountleeftijd, gebruiksfrequentie, supporttickets — zal een gradient-boosted tree model als XGBoost of LightGBM meestal een benadering op LLM-basis outperformen, in minuten in plaats van uren trainen, en een fractie kosten om uit te voeren. Grijp naar scikit-learn's RandomForestClassifier of XGBoost voordat je naar een API-call grijpt, vooral wanneer je data in een spreadsheet past en je doelvariabele een schoon getal of categorie is.
Kosten en latentie zijn ontwerpbeperkingen, niet iets achteraf
Een GPT-4-klasse oproep kost echt geld per token en kost echt seconden om terug te keren. Als je een functie bouwt die op elke paginalading voor elke gebruiker draait, loopt dat snel op en de latentie zal zichtbaar zijn. Cache agressief, gebruik een kleiner model als GPT-4o-mini of een lokale Llama 3 8B voor alles wat geen topniveau redenering nodig heeft, en reserveer de dure modeloproepen voor de delen van je pipeline waar kwaliteit werkelijk uitmaakt.
De foutmodus waarschuwing niemand je voor
Modellen hallucineren meer, niet minder, wanneer je om dingen vraagt die iets buiten hun trainningsdistributie liggen — obscure bibliotheekversies, intern bedrijfsjargon, recente CVE-nummers. Als het antwoord exact juist moet zijn (een beveiligingsadvisory, een juridische verwijzing, een medische dosis), vertrouw niet alleen op generatie. Verifieer tegen een primaire bron elke keer, en bouw die verificatiestap in je pipeline in plaats van erop te vertrouwen dat menselijke beoordeling het achteraf oppikt.
AI-tooling is werkelijk nuttig eenmaal je stopt met verwachten dat het denkt en begint het te behandelen als een snelle patroonmatcher die je moet controleren. Bouw de verificatiestap vanaf dag één in en je krijgt echte waarde eruit in plaats van een stroom zelfverzekerde onzin.
Als je verder wilt gaan, bekijk Korra Studio's Python en Data Science tracks voor de fundamenten die werken met deze tools werkelijk productief maken.
Geschreven met AI-ondersteuning, herzien en gepubliceerd door Michal Pilch (CISSP), Korra Studio.
Dit is één aantekening uit de kennisbasis van Korra Studio — het platform koppelt elk onderwerp aan 1-op-1 mentoring.
Gratis beginnenarrow_forward