Verzonden op 04-08-2026 08:25
Google's Earth AI-generator offline na nepbeelden van oorlogen en rampenGoogle heeft zijn AI-aangedreven Earth-beeldgenerator binnen 24 uur na de lancering offline gehaald. Gebruikers maakten realistische maar valse satellietbeelden van oorlogsgebieden, natuurrampen en vluchtelingenkampen. Dit laat helder zien hoe een generatief AI-systeem misbruikt kan worden zodra het publiek ermee aan de slag gaat. Wat in een testomgeving veilig lijkt, pakt anders uit als miljoenen gebruikers actief naar de grenzen zoeken. Voor teams die generatieve AI-tools publiek uitrollen, is het zaak misbruikscenario's te testen voordat je live gaat. Vraag jezelf af: wat is het ergste dat iemand met dit systeem kan maken, en hoe ziet dat eruit als het viraal gaat? De snelheid waarmee Google heeft ingegrepen, binnen een dag, laat zien dat reactietijd bij misbruik telt. Bouw een escalatieprocedure in je AI-productlancering voordat je die nodig hebt. |
OpenAI Astra lost 10 onopgeloste wiskundeproblemen op voor 2.000 dollarEen intern OpenAI-model genaamd Astra heeft 10 open onderzoeksproblemen opgelost op het gebied van wiskunde, kwantumcomplexiteit en theoretische informatica. De resultaten staan beschreven in een paper van 249 pagina's en de totale tokenkosten bedroegen 2.000 dollar. Geen van deze problemen had in de afgelopen tien jaar nieuwe vooruitgang geboekt. Dat geeft aan dat Astra geen bekende paden bewandelde, maar de kennis daadwerkelijk uitbreidde. Voor organisaties die werken met complexe optimalisatie- of R&D-vraagstukken is dit een signaal dat AI-modellen mogelijk bijdragen aan het oplossen van problemen waar menselijke experts vastlopen. De kosten per opgelost probleem zijn opvallend laag. Astra is nog niet publiek beschikbaar, dus directe toepassing is nu nog niet mogelijk. Heb je R&D-teams die vastlopen op hardnekkige technische problemen, dan is het de moeite waard om te verkennen welke daarvan in principe door een redeneermodel aangepakt kunnen worden.
|
Alibaba's Qwen3.8-Max codeert 10 dagen autonoom doorAlibaba heeft Qwen3.8-Max uitgebracht, een model met 2,4 biljoen parameters dat volgens de aankondiging volledig autonoom kan werken, van een lege map tot een afgerond product, zonder tussenkomst. De opvallendste claim: het model heeft in één sessie een heel jaar e-commercestrategie gesimuleerd. Volgende week gaat het model open source, samen met een kleinere variant die je lokaal kunt draaien. Voor teams die nadenken over autonome coding agents is dit een concrete optie om te testen zodra de gewichten beschikbaar zijn. De combinatie van een gigantisch model én open source-toegang is zeldzaam. De claims komen van Alibaba zelf en zijn nog niet onafhankelijk geverifieerd. Test het volgende week op een afgebakend project zodra de gewichten er zijn, dan kun je zelf beoordelen hoe betrouwbaar het autonoom werkt. |
DeepSeek V4-Flash verslaat V4-Pro op 9 benchmarks zonder grotere omvangDeepSeek heeft zijn V4-Flash model opnieuw getraind en het presteert nu beter dan het eigen flagship V4-Pro op 9 agent-benchmarks, bij gelijke modelgrootte. Het verschil zit puur in betere post-training, niet in meer parameters. Dit bevestigt een patroon dat steeds duidelijker wordt: de manier waarop je een model traint na de initiële fase telt zwaarder dan de schaalgrootte. Ruwe parameteraantallen zijn geen goede maatstaf meer voor de te verwachten prestaties. Voor organisaties die modellen selecteren voor agent-taken betekent dit dat benchmarks op parameteraantal je op het verkeerde been kunnen zetten. V4-Flash is al beschikbaar via de API tegen lage kosten, eerder gepubliceerd als centenbedragen per miljoen tokens. Vergelijk V4-Flash deze week op je eigen agent-workload met je huidige model. De prijsverschillen zijn groot genoeg om een serieuze test te rechtvaardigen.
|
Mexico's topuniversiteit annuleert duizenden examenscores na AI-fraudeDe Nationale Autonome Universiteit van Mexico (UNAM) heeft duizenden scores van haar eerste online toelatingsexamen geannuleerd nadat de resultaten wezen op grootschalige fraude met AI-hulpmiddelen. Dit is geen incident bij een kleine instelling: UNAM is de grootste universiteit van Latijns-Amerika. Het laat zien dat AI-fraude bij examens al een operationeel probleem is, geen toekomstige zorg. Organisaties die certificeringen of assessments digitaal afnemen, staan voor dezelfde uitdaging. Zelfs goed ontworpen online examens zijn kwetsbaar als er geen actieve detectie of proctoring wordt ingezet. Gebruikt jouw organisatie digitale toetsen of assessments voor werving of certificering? Dan is dit het moment om te evalueren welke detectie- of verificatielaag je eromheen hebt.
|
Gemini Spark browst het web namens jou in ChromeGoogle heeft Gemini Spark ingeschakeld om ingelogde webtaken uit te voeren binnen Chrome. De assistent kan nu acties uitvoeren op websites waar je al bent ingelogd, dus niet enkel informatie ophalen maar ook daadwerkelijk handelingen verrichten. Daarmee komt Gemini Spark op hetzelfde terrein als autonome browser-agents, een categorie die snel volwassen wordt. Het verschil met losstaande agent-tools is dat deze functie direct is geïntegreerd in een browser die al op honderden miljoenen apparaten draait. Voor gebruikers die herhalende webtaken doen, zoals formulieren invullen, statuspagina's checken of data uit portals halen, levert dit een concrete tijdsbesparing op die je morgen al kunt testen als je Chrome gebruikt. De keerzijde: een agent met toegang tot ingelogde sessies kan meer schade aanrichten bij fouten of misbruik. Controleer welke rechten en toestemmingen Gemini Spark vraagt voordat je het loslaat op gevoelige accounts.
|