Verzonden op 03-09-2026 08:06
Nieuw paper: AI-agents maken traditionele software-engineering overbodigEen nieuw onderzoekspaper stelt dat AI-agents de rol van traditionele software-engineering ingrijpend veranderen. Het argument is niet dat programmeurs verdwijnen, maar dat de software zelf de agent is geworden, een systeem dat zijn eigen aandacht en inspanning beheert. Dit sluit aan op wat je in de praktijk al ziet: Fable 5.1 verifieert eigen code en Gemini kiest welke frames relevant zijn. Het patroon is consistent: modellen worden geen tools die je bedient, maar systemen die zelfstandig prioriteren. Voor ontwikkelteams betekent dit dat de rol van softwareontwikkelaar verschuift van schrijven naar sturen. Wie daar nu al mee oefent, bouwt een voorsprong op. Wie wacht tot het vanzelf gaat, merkt straks dat de lat hoger ligt dan verwacht.
|
Claude Fable 5.1 scoort 73,4% op CursorBench en verifieert eigen codeAnthropic heeft Claude Fable 5.1 uitgebracht en het model is nu beschikbaar in Cursor. Op CursorBench, het eigen codeerbenchmark van Cursor, haalt het 73,4%, de hoogste score die Cursor tot nu toe heeft gemeten. Wat Fable 5.1 onderscheidt van eerdere modellen: het verifieert de code die het schrijft, in plaats van te stoppen na de generatie. Dat klinkt als een detail, maar het betekent dat je bij complexe taken minder handmatige reviewcycli nodig hebt. Voor teams die al met Cursor werken, is dit direct beschikbaar. De vraag die overblijft, is hoeveel autonomie je het model wilt geven voordat je zelf nog even meekijkt. In een live test bouwde Fable 5.1 een complete browsergame en installeerde het zelf Blender-tooling, al merkten de testers dat het model snel beslissingen neemt zonder om bevestiging te vragen. De actietip: schakel Fable 5.1 in Cursor in en geef het een taak met meerdere stappen. Zo zie je snel waar de autonomie handig is en waar je liever zelf de teugels houdt. |
Anthropic draait 30-dagen databeleid terug na kritiekAnthropic heeft zijn omstreden beleid rond 30 dagen dataretentie teruggedraaid. Wat dat beleid precies inhield en waarom het kritiek opriep, staat niet volledig beschreven in de beschikbare bronnen, maar de ommekeer zelf is bevestigd. Voor organisaties die Claude inzetten voor gevoelige taken is dit relevant nieuws. Het databeleid van AI-aanbieders bepaalt hoe lang gesprekken en inputs bewaard blijven, met directe gevolgen voor privacy-compliance en verwerkersovereenkomsten. Controleer altijd zelf de actuele verwerkingsvoorwaarden van de AI-tools die je gebruikt, want beleidswijzigingen gaan soms sneller dan je interne documentatie kan bijhouden.
|
Gemini's nieuwe videomodel bekijkt alleen relevante frames en kost 66% minderGoogle heeft een nieuw videomodel uitgebracht dat zelf kiest welke frames het analyseert, in plaats van een video frame voor frame te verwerken. Dat levert een kostenbesparing van 66% op ten opzichte van de vorige aanpak. Voor organisaties die video-analyse op schaal willen inzetten is dit een zinvolle stap, bijvoorbeeld voor kwaliteitscontrole, mediabeheer of surveillance. De kosten vormden tot nu toe een van de voornaamste drempels. De techniek, selectieve frameaandacht, lijkt eenvoudig, maar vereist dat het model zelf bepaalt wat relevant is. Dat werkt goed bij gestructureerde video en is minder voorspelbaar bij ongestructureerde of snel wisselende beelden.
|
Open-source 2B-model presteert vergelijkbaar met Qwen op consumentenhardware voor onder 7.000 dollarNous Research heeft Hermes Agent v0.21.0 uitgebracht met een grote Pantheon-update. Tegelijk circuleert er een open-source 2B-model dat op consumentenhardware presteert op het niveau van Qwen, voor een aanschafprijs van minder dan 7.000 dollar. Dat is relevant voor organisaties die AI lokaal willen draaien, zonder afhankelijkheid van cloudproviders of API-kosten. Lokale inferentie op dit niveau was tot voor kort voorbehouden aan grotere en duurdere opstellingen. De kanttekening: benchmarkvergelijkingen op modelniveau vertalen zich niet altijd direct naar taakvergelijkingen in de praktijk. Test het model op je eigen dataset voor je conclusies trekt over productiegeschiktheid.
|