c’t 08-09/2026
Vibe coding voor developers
Cover van
Cover voor AI-software op Neural Processing Units: de eerste stappen met AMD Lemonade

AI-software op Neural Processing Units: de eerste stappen met AMD Lemonade

De gratis software Lemonade maakt het makkelijker om AI-modellen op een Ryzen-NPU te gebruiken. We kijken welke AI-taken lokaal draaien en waar de NPU tekortschiet.

Lokale AI op de NPU met AMD Lemonade

Neural Processing Units zijn hardware-eenheden in moderne laptop- en desktopprocessors die gespecialiseerd zijn in AI-berekeningen. Ze zijn bedoeld om CPU- en GPU-kernen te ontlasten bij het verwerken van AI-modellen, wat de accuduur en het energieverbruik ten goede komt. In tegenstelling tot clouddiensten heeft dat bovendien het voordeel dat de gegevens op je eigen pc blijven.

Ontwikkelaars moeten hun software echter wel aanpassen voor NPU’s, waardoor tot nu toe maar weinig applicaties gebruikmaken van die NPU’s.

Als alternatief kun je AI-modellen zelf op een NPU draaien. Tot nu toe was dat meestal een frustrerende ervaring, omdat je te maken kreeg met ontbrekende stuurprogramma’s, niet-aangepaste frameworks en slechte documentatie. De gratis te gebruiken software Lemonade van AMD belooft, in ieder geval voor computers met een moderne Ryzen-processor, veel dingen beter en vooral gebruiksvriendelijker te maken.

AMD heeft de grafische interface samen met de AI-community ontwikkeld en die is onlangs verschenen in versie 11. Lemonade biedt talrijke Large Language Models, beeldgeneratoren en speech-to-text-modellen die voornamelijk op de NPU van Ryzen-processors draaien, maar deels ook hybride: op de NPU, op CPU-kernen en op de grafische eenheid.

We gaan kort in op het installeren en bedienen en kijken voor welke doeleinden NPU’s met Lemonade geschikt zijn en waarvoor niet.

Ryzen AI nodig

Ongeveer twee jaar geleden, in het voorjaar van 2024, verschenen met de Ryzen 7 8700G en Ryzen 5 8600G de eerste desktopprocessors van AMD met een geïntegreerde Neural Processing Unit. Onze pogingen destijds om die voor AI-toepassingen te gebruiken, mislukten. De Copilot+-apps in Windows 11 bestonden nog niet en er waren sowieso maar weinig apps die gebruik konden maken van NPU’s.

Bovendien ontbrak destijds de belastingindicator voor de NPU in het Windows Taakbeheer op systemen met een Ryzen-processor.

De poging om aan de hand van een stapsgewijze handleiding van AMD een LLM op de Neural Processing Unit aan de praat te krijgen, mislukte na enkele uren rommelen en foutopsporing via de commandline jammerlijk.

Inmiddels is het tij gekeerd. Verschillende foto- en videoprogramma’s gebruiken voor bepaalde taken AI-algoritmen en laten die, indien beschikbaar, door de NPU berekenen [1]. Als je een laptop of desktop-pc met een geschikte Ryzen-processor gebruikt, kun je met de nieuwste versie 11 van Lemonade nu zelf makkelijk AI-modellen op de NPU draaien.

Dat werkt echter alleen bij Ryzen-CPU’s die een Neural Processing Unit van de tweede generatie met XDNA2-architectuur gebruiken. Daaronder vallen de series Ryzen AI (Max) 300 en Ryzen AI (Max) 400. Processors met oudere XDNA1-rekenunits, zoals de Ryzen 7040U/H, Ryzen 8040U/H, Ryzen 8000G en Ryzen 200, vallen buiten de boot.

Dat laat zien dat de eerste generatie NPU’s van x86-processoren nu al verouderd is. Voor onze tests hebben we een HP Z2 Mini G1a gebruikt, met een 16-core AMD Ryzen AI Max+ PRO 395 met 128 GB werkgeheugen.

De in de processor geïntegreerde NPU haalt volgens AMD 50 Tops, oftewel 50 biljoen bewerkingen per seconde bij bepaalde gegevensformaten zoals 8-bit integers.

Lees dit artikel verder

Lees over tech-trends en achtergronden, nieuwe apparatuur, software en toepassingen voor professioneel gebruik. Met c’t heb je altijd de juiste tech-informatie. Word abonnee en lees onbeperkt alle artikelen.
Bekijk abonnementen Al abonnee? Log in

Lemonade installeren

Lemonade is binnen een paar minuten klaar voor gebruik. Je hoeft alleen maar het 9 MB grote installatieprogramma voor Windows te downloaden en vervolgens te starten (te downloaden via de link bij dit artikel). AMD biedt de software ook aan voor macOS, Docker en de belangrijkste Linux-distributies.

Standaard wordt Lemonade geïnstalleerd in de gebruikersmap, in de submap AppData. Je kunt echter ook elke andere locatie kiezen. Houd er wel rekening mee dat de AI-modellen behoorlijk groot zijn en al snel tientallen gigabyte op een SSD in beslag nemen.

Na het installeren start je de Lemonade-server eenvoudig met een muisklik via het pictogram op het bureaublad. Op het eerste gezicht gebeurt er niet veel. Om de eigenlijke interface te openen, klik je met de rechtermuisknop op het citroensymbool rechts in het systeemvak van de taakbalk. Kies daar Open Lemonade App en het chatvenster verschijnt.

Kies een LLM

Links staat een lijst met talrijke AI-modellen. We hebben eerst een model uit de categorie FastFlowLM NPU uitgeprobeerd. Het ontwikkelteam van FastFlowLM is medio juli 2026 overgestapt naar AMD. Het team stroomlijnt gangbare Large Language Models tot een klein formaat en een bescheiden behoefte aan resources, zodat ze in het werkgeheugen van de gangbare laptops en desktop-pc’s passen en draaien op relatief zwakke hardware zoals geïntegreerde GPU’s en NPU’s.

Met de 128 GB werkgeheugen van de HP Z2 heb je ruimte genoeg om LLM’s kwijt te kunnen, met 16 GB RAM kan het soms krap worden. We raden een systeem aan met minimaal 32 GB RAM.

Onze keuze viel op het ongeveer 9 GB grote multimodale model gemma4-it-e4b-FLM Gemma-4-E4B-it-GGUF. Het downloaden start via het pictogram rechts naast de modelnaam.

Lemonade zorgt er op de achtergrond zelf voor dat alle benodigde frameworks geïnstalleerd worden. De software kan ook meerdere modellen tegelijk downloaden, wat vanwege de downloads van meerdere gigabyte alleen aan te raden is als je een snelle internetverbinding hebt.

Beeldherkenning en transcripties

Vervolgens selecteer je het model onderaan in het invoerveld van het chatvenster. Het door Google getrainde LLM Gemma4 begrijpt ook beeldinhoud. We hebben het daarom gevoed met een foto van het Praagse Oude Stadsplein en gevraagd om een beschrijving van de afbeelding. Bij de eerste aanvraag wordt het geselecteerde model automatisch in het werkgeheugen geladen, wat ongeveer een minuut kan duren. De Lemonade-interface is in het Engels, maar je kunt je vragen gewoon in het Nederlands stellen – je krijgt afhankelijk van het model soms wel Engelstalige antwoorden terug.

Het LLM draait volledig op de NPU en geeft een gedetailleerde beschrijving van de afgebeelde gebouwen, voorwerpen en de weersomstandigheden. De uitvoersnelheid van twaalf tokens per seconde is in vergelijking met krachtige grafische kaarten allesbehalve snel, maar volstaat voor deze toepassing.

Vervolgens hebben we Gemma4 gevraagd hoeveel mensen er op de foto te zien zijn, wat de AI met zo’n 50 personen behoorlijk goed herkende.

Je kunt de NPU bijvoorbeeld ook gebruiken om een spraakopname om te zetten in tekst. Daarvoor hebben we het ongeveer 600 MB grote model whisperv3-turbo-FLM gekozen. Het verwijderen van het vorige model en het laden van het nieuwe model bij het wisselen regelt Lemonade zelf.

We hebben een transcript laten maken van een aflevering van een podcast. Op een paar uitzonderingen na herkende Whisper-v3 alle woorden correct, waaronder ook de meestal Engelstalige vaktermen. Er is echter geen toewijzing van wie wat heeft gezegd, je krijgt alleen een lange, onopgemaakte tekst.

Bovendien is er wat geduld nodig. Voor de 45 minuten durende podcastaflevering had de NPU bijna acht minuten nodig om te transcriberen.

Allrounder op zijn limiet

Lemonade biedt ook zogenaamde Omni-modellen. Die komen qua functionaliteit in de buurt van commerciële AI-cloudproviders en combineren tekst, beeld en audio.

We hebben gekozen voor het geheugenbesparende pakket LMX-Omni-5.5B-Lite, dat ongeveer 9 GB RAM in beslag neemt. Het bestaat uit het Large Language Model Qwen3.5-4BMTP-GGUF, dat onder andere ook de verdeling over de andere modellen regelt: kokoro-v1 zet tekst om in audio, Whisper-Tiny doet het omgekeerde en SD-Turbo (Stable Diffusion) genereert afbeeldingen.

De afzonderlijke modellen maken op verschillende manieren gebruik van de CPU, GPU en NPU – afhankelijk van welke rekenunit het meest geschikt is. In veel gevallen belast LMX-Omni-5.5B-Lite echter de grafische kaart, omdat die vaak de krachtigste van de drie is.

De resultaten zijn vrij beperkt vanwege de bescheiden omvang van de afzonderlijke AI-modellen. Het audiotranscript brak al na een paar zinnen af en leverde alleen Engelse tekst op.

Iets soortgelijks gebeurde toen we een alinea van een kort nieuwsbericht in een audiobestand lieten omzetten. De AI produceerde alleen onverstaanbaar gebrabbel omdat een Engelse stem probeerde een Nederlandse tekst voor te lezen. Met een Engelstalig bericht ging het daarentegen veel beter.

Programmeren kun je leren

Tot slot hebben we uit de categorie Ryzen AI LLM het 13 GB grote Large Language Model gpt-oss-20b-NPU gedownload. Dat LLM van OpenAI bevat 20 miljard parameters. We hebben hem een kleine programmeeropdracht gegeven voor een quiz op een website. Met zo’n negen tokens per seconde levert de NPU de code maar heel langzaam en stopte uiteindelijk na enkele minuten – midden in het maken van het JavaScript-bestand.

Uiteindelijk hebben we een eenvoudiger project gemaakt, waarbij een webpagina de huidige tijd weergeeft en dynamisch bijwerkt. Dat werkte perfect en duurde nog geen anderhalve minuut. Voor grote programmeertaken is de NPU veel te traag, maar kleine projecten doet hij veel sneller dan een mens.

Conclusie

Met Lemonade zet AI op Neural Processing Units een grote stap vooruit. Zonder programmeerkennis en zonder kennis van Python, ROCm en de commandline kun je er binnen een paar minuten mee aan de slag. Er is een heleboel keuze uit modellen die geoptimaliseerd voor NPU’s zijn, mits je een computer hebt met een geschikte, recente Ryzen-processor.

De kwaliteit van de resultaten wordt echter vaak beperkt door de kleine omvang van de modellen omdat de gegevens in het werkgeheugen van de computer moeten passen. Met slechts een paar gigabyte kunnen de aangepaste AI-modellen niet tippen aan de clouddiensten van de grote, commerciële aanbieders zoals Anthropic Claude, OpenAI ChatGPT en Google Gemini.

Voor kleine taken die op de achtergrond kunnen draaien, is Lemonade echter zeker de moeite waard. De NPU voert AI-berekeningen efficiënter uit dan de geïntegreerde grafische kaart, waardoor je op een laptop profiteert van een langere accuduur. Bovendien blijven de gegevens op je eigen pc.

Literatuur

[1] Christian Hirsch en Noud van Kruysbergen, Welke software profiteert er al van AI-hardware?, c’t 8-9/2026, p.42

Lemonade-installer downloaden
https://lemonade-server.ai

(Christian Hirsch en Noud van Kruysbergen)

Inspiratie in je mailbox

Blijf bij op IT-gebied en verbreed je expertise. Ontvang elke week artikelen over de laatste tech-ontwikkelingen, toepassingen, nieuwe hard- en software én ontvang tips en aanbiedingen.

Loginmenu afsluiten