Microsoft AI heeft laten zien hoe zijn MAI-audiomodellen worden ingezet in Ode Poetry, een nieuwe spraakervaring rond poëzie. De app vraagt hoe iemand zich voelt, voert een gesprek en beveelt daarna een passend gedicht aan.
Realtime spraak begrijpen
Volgens Microsoft gebruikt Ode Poetry MAI-Transcribe om gesproken taal in realtime te begrijpen. De nieuwste versie, MAI-Transcribe-1.5, haalt volgens de bron een gemiddelde Word Error Rate van 4,86 procent op de FLEURS-benchmark. Daarmee wil Microsoft aantonen dat het model verschillende talen, accenten, dialecten en rumoerige audio aankan.
Ode gebruikt daarnaast MAI-Voice om een expressieve stemervaring te bouwen. Microsoft zegt dat het model met een korte audioreferentie een herkenbare spreekstijl kan weergeven. In dit project gaat het om de stem en aanpak van poëziekenner William Sieghart.
Wat kmo's hieruit kunnen leren
Voor ondernemers is vooral de productles interessant. Microsoft benadrukt dat een goede AI-ervaring niet alleen draait om een model, maar ook om veilige aanbevelingslogica, red teaming, guardrails en veel iteratie op kwaliteit, consistentie, latency en toon.
Dat is relevant voor kmo's die zelf voicebots, telefonie-automatisering, trainingstools of klantinterfaces willen bouwen. Spraak-AI wordt bruikbaarder, maar vraagt nog altijd duidelijke grenzen: wat mag het systeem zeggen, wanneer moet het stoppen en wanneer blijft een mens nodig?