Code Needle: el test que destapa les al·lucinacions dels LLM locals en codi
Alex Ziskind crea un benchmark de recuperació literal sobre codi real. La dada reveladora no és només quantes línies encerta cada model, sinó quantes se n’inventa.
Tema
Resums de vídeos per entendre millor aquest tema.
Alex Ziskind crea un benchmark de recuperació literal sobre codi real. La dada reveladora no és només quantes línies encerta cada model, sinó quantes se n’inventa.
L’escassetat de memòria vinculada a la IA enfonsa els enviaments de mòbils i posa sota pressió la gamma mitjana i les marques petites.
Tres models creen prototips visuals en agents diferents. Qwen guanya la prova, però l’entorn i la metodologia limiten la comparació.
Alejandro Pérez prova en una piscina real el conjunt Aiper Scuba V3 i EcoSurfer S2 contra el robot tot en un Beatbot Sora 70. El model solar domina la superfície; sota l’aigua, la comparació és més equilibrada.
Elon Musk presenta davant Jamie Dimon una SpaceX que busca capital per desplegar Starlink V3, avançar amb Starship i construir centres de dades d’intel·ligència artificial a l’espai.
Anthropic ha contractat tota la capacitat de Colossus 1, més de 300 MW i 220.000 GPU. Caleb Writes Code analitza què canvia per a Claude i què revela sobre la cursa d’infraestructura de la IA.
Jabiertzo analitza un top 10 xinès sense cotxes de combustió pura, la llista 1260H dels EUA, un robot de NVIDIA i Unitree i les parelles amb IA.
Two Minute Papers analitza la System Card d’Opus 4.8: menys afirmacions falses, més diligència amb el codi i límits en les avaluacions.
En una entrevista amb Forbes, Elon Musk anuncia que apel·larà el cas d’OpenAI i dibuixa el seu futur: IA superior als humans, robots, ciutats fora de la Terra i computació orbital.
Un model intern d’OpenAI ha trobat una família de configuracions que supera la construcció coneguda del problema de les distàncies unitàries. Expliquem el resultat i els seus límits.
Caleb Writes Code explica l’evolució de la prompt engineering a la harness engineering: bucles, eines, context i controls que converteixen un LLM en agent.
Bijan Bowen prova Nemotron 3 Ultra amb interfícies, simuladors i codi, i revisa l’arquitectura de 550B amb 55B actius.