Mistral lanceert Shieldstral voor flexibelere moderatie van AI-content
Shieldstral van Mistral classificeert de veiligheid van AI-content met behulp van een nieuwe aanpak. Die moet zich flexibel kunnen aanpassen aan veranderende contexten.
Lees verder na de advertentie
Flexibele moderatie met ja/nee-vragen
Mistral AI heeft met Shieldstral een veiligheidsmodel geïntroduceerd dat de moderatie van door AI gegenereerde content eenvoudiger moet maken. Het model werkt niet met vooraf vastgelegde categorieën, maar met een flexibele vraag-en-antwoordmethode. Beheerders kunnen hun moderatieregels daarbij omzetten in ja/nee-vragen in natuurlijke taal, bijvoorbeeld om te bepalen of bepaalde content aanzet tot daadwerkelijk geweld. Shieldstral berekent vervolgens een veiligheidsscore waarmee kan worden bepaald of een prompt of AI-antwoord wordt toegestaan.
Volgens Mistral heeft deze aanpak twee voordelen. Ten eerste kunnen de vragen die aan de inhoud worden gesteld eenvoudig door de beheerders van Shieldstral worden aangepast en op elk moment worden gewijzigd. Ten tweede kan hierdoor beter rekening worden gehouden met de context van de inhoud. Bijvoorbeeld: originele citaten uit historische toespraken die mogelijk noodzakelijk zijn voor een schoolpresentatie over concentratiekampen, zouden als inhoud van een persoonlijke blogpost uiterst problematisch kunnen zijn.
Tip!
Slimme IP-camera’s met live toezicht en haarscherpe beveiliging!
Bestaande guardrail-modellen met vastgelegde taxonomieën kunnen dergelijke contextuele verschillen volgens de auteurs van het bijbehorende paper slechts onvoldoende weergeven, omdat de toelaatbaarheid van inhoud vaak strikt aan bepaalde categorieën is gekoppeld.
Van ja/nee-antwoord naar veiligheidsscore
Bij de invoer behandelt Shieldstral de moderatie als een binaire vraag-en-antwoordtaak. Het model krijgt daarvoor een systeeminstructie met richtlijnen, de relevante context en een vraag die met ja of nee kan worden beantwoord. Tijdens de inferentie berekent Shieldstral de logits voor beide antwoorden en zet deze via softmax om in een doorlopende veiligheidsscore. Aan de hand van die score kan vervolgens worden bepaald of de betreffende content wordt toegestaan.
Shieldstral draait op een GPU met 16 GB geheugen
In een blogpost beredeneert Mistral dat Shieldstral met deze nieuwe aanpak dezelfde prestaties als modellen die zeven keer zo groot zijn, terwijl het model op een Nvidia-GPU met 16 GB geheugen kan draaien. Technisch gezien is Shieldstral gebaseerd op Ministral-3B-Base-2512, een causaal taalmodel uit Mistrals eigen modelfamilie. Die familie werd onlangs nog uitgebreid met Leanstral 1.5, dat is geoptimaliseerd voor wiskundige bewijzen en formele verificatie.
Open weights beschikbaar op Hugging Face
Voor beeldverwerking wordt een Pixtral Vision Encoder gebruikt. Het model met 3 miljard parameters is onder de Apache 2.0-licentie als open weights beschikbaar op Hugging Face en kan daar worden gedownload.
Tot slot
Met Shieldstral kiest Mistral voor een flexibelere manier om de veiligheid van AI-content te beoordelen, waarbij de context een grotere rol speelt. Doordat organisaties zelf hun moderatievragen kunnen formuleren en aanpassen, kan het model voor uiteenlopende toepassingen worden ingezet. Tegelijkertijd maakt de relatief compacte omvang het mogelijk om Shieldstral op gangbare hardware te draaien.
Tip
Download het e-book en krijg direct inzicht in de stappen die jouw organisatie moet zetten.
Praat mee