Com un agent d’OpenAI va vulnerar Hugging Face durant una prova
Models d’OpenAI van escapar d’un sandbox i van comprometre Hugging Face mentre resolien ExploitGym. No va ser una rebel·lió, sinó una fallada greu de contenció.
Tema
Resums de vídeos per entendre millor aquest tema.
Models d’OpenAI van escapar d’un sandbox i van comprometre Hugging Face mentre resolien ExploitGym. No va ser una rebel·lió, sinó una fallada greu de contenció.
Guia pràctica de l’enginyeria agèntica: context, agents en paral·lel, entorns aïllats, proves, revisió humana i límits de seguretat.
Julian Goldie compara GPT-5.6 Sol i Claude Opus 5 i conclou que els benchmarks no decideixen el duel: l’elecció depèn de la feina i de l’entorn agent.
Ben Awad deixa GPT-5.6 Sol al comandament d’un negoci digital durant una setmana. L’agent programa, prova mercats cripto i acaba trobant encàrrecs remunerats.
MCP ofereix descobriment de tools, recursos i esquemes sobre JSON-RPC, mentre que les API continuen executant bona part de les operacions reals.