Wat is chain of thought? Een model laten redeneren in tussenstappen voordat het antwoordt. Wanneer het helpt en wat het kost.
Chain of thought is een manier van sturen waarbij een model pas antwoordt nadat het de tussenstappen heeft uitgeschreven: eerst de losse onderdelen van het probleem, dan de conclusie. Dat helpt bij taken met meerdere stappen, en kost daarvoor tijd en tekst per aanroep. EIGHTY8 zet het bewust in. Niet standaard, maar waar de opgave het vraagt.
Sommige taken laten zich niet in één denkstap oplossen. Weeg drie regelingen tegen elkaar af, tel bedragen uit een vrije tekst, bepaal welke levering eerst moet. Een antwoord in één adem gaat daar geregeld mis, omdat het model het tussenwerk overslaat. Chain of thought stelt dat tussenwerk centraal: de instructie vraagt het model om stap voor stap te werken, en pas aan het eind de conclusie te trekken.
Wat er gebeurt is simpel en grondig: elke tussenstap die het model schrijft, wordt onderdeel van zijn eigen context. De volgende stap bouwt op zichtbare tekst in plaats van op een gedachte die alleen intern bestond. Fouten worden daardoor eerder zichtbaar (een verkeerde afleiding staat er letterlijk) en de kans op een juiste conclusie stijgt bij taken met echte meerstapslogica.
De keerzijde zit in de rekening van tijd en tekst. Elke tussenstap is tekst die geschreven én betaald moet worden, en de gebruiker wacht erop. Voor een nachtelijke controle van tachtig offertes is dat prima; voor een chatvraag die live moet, kan dezelfde grondigheid een sta-in-de-weg zijn. Daarom is chain of thought een keuze per taak, geen standaardinstelling.
Chain of thought is de moeite waard bij taken met meerdere stappen die elkaar opvolgen: vergelijken, berekenen, plannen, toetsen van een logische redenering. Ook bij werk waar de tussenstappen zelf waarde hebben (een controle die aantoonbaar correct is uitgevoerd) levert het meer op dan een kaal antwoord: de afleiding is erbij, en die is te controleren.
Het is niet de moeite waard bij taken die geen keten hebben: samenvatten, herschrijven, indelen, vertalen. Daar verlaat tussenstappen de zaak alleen maar. Het model doet alsof hij nadenkt en levert extra woorden zonder extra juistheid. En waar een gebruiker live wacht, weegt de extra tijd vaak niet op tegen de winst. Gebruik het waar de logica zit, niet uit gewoonte.
EIGHTY8 kiest per werkstroom of een taak meerdere denkstappen verdient, en schrijft de instructie daarop: gevraagde tussenstappen, een duidelijke plek voor de conclusie en een controle die de afleiding kan nalopen. Bij gespreksantwoorden laten we het bewust weg om vaart te houden. Zo betaal je voor grondigheid alleen waar grondigheid iets oplevert.
Dat bepaal je als bouwer. De tussenstappen komen mee in de uitkomst van het model; of ze op het scherm verschijnen is een keuze van de toepassing. Bij een controle-taak is tonen vaak wenselijk. De gebruiker kan de afleiding nalopen. In een klantgericht gesprek tonen we liever alleen de conclusie en bewaren de stappen in het logboek. En let op: wat het model 'denkt' is een geconstrueerde afleiding, geen venster op een innerlijk.
Bij taken zonder echte keten: samenvatten, herschrijven, taal herkennen, een tekst indelen. Daar is er niets om stap voor stap op te bouwen, en de tussenstappen worden decoratie. Meer tekst, meer wachttijd, dezelfde uitkomst. Soms werken ze zelfs averechts, omdat het model een fout in een tussenstap daarna trouw voortzet. Vuistregel: helpt alleen bij taken die je zelf ook stap voor stap zou uitschrijven.
Elke tussenstap is tekst die het model produceert: dat kost rekentijd bij de aanbieder, wachttijd bij de gebruiker en verbruik bij elke aanroep. Hoeveel precies hangt af van de taak en het model. Soms enkele regels, soms een bladzijde per antwoord. Daarom meten we het per werkstroom in plaats van het aan te nemen: waar de extra stappen de juistheid meetbaar verbeteren, blijven ze; waar ze alleen de rekening dikker maken, vallen ze weg.
Ze horen bij elkaar maar zijn niet hetzelfde. Chain of thought is de techniek: het model vragen om tussenstappen, bruikbaar in elk taalmodel via de instructie. Een reasoning-model is een modeltype dat dat redeneren ingebouwd heeft en er standaard meer reken- en denktijd in steekt voordat hij antwoordt. In de praktijk: met chain of thought stuur je zelf; bij een reasoning-model heeft de bouwer het sturen al voor je gedaan. Tegen een prijs in tijd.
EIGHTY8