Los agentes IA ignoran las reglas del open source
Un estudio de la Universidad de Pekin probo 4 modelos frontier y encontro que los coding agents casi nunca leen las reglas de contribucion.
Un estudio de la Universidad de Pekin probo 4 modelos frontier y encontro que los coding agents casi nunca leen las reglas de contribucion.
Tim Gowers analiza qué matemáticas resuelven bien los LLMs tras los 10 problemas de OpenAI, y dónde siguen fallando en 2026.
OpenAI resolvió 10 problemas matemáticos abiertos en agosto de 2026 y Tim Gowers analiza qué hacen bien los LLMs y dónde todavía fallan.
Anthropic marca todo el texto de Claude desde agosto de 2026 por la EU AI Act. Qué prueba, qué no, y por qué es más frágil de lo que parece.
Analizamos Claude 3 y Gemini 2.5 lado a lado: precio, velocidad, benchmarks y qué modelo elegir según tu caso de uso. La comparativa más detallada del 2026.
Anthropic firmó el EU AI Act y desde agosto 2026 los modelos nuevos de Claude marcan el contenido generado. Cómo funciona la marca de agua Claude y sus límites.
OpenAI presentó GPT-5.6-Cyber dentro de Daybreak: modelo de ciberseguridad con acceso restringido, 95% en benchmark interno y dos zero-days en V8.
Tencent Hunyuan presentó WorldClaw: un agente que genera mundos 3D abiertos y editables desde texto con Claude Opus 4.8 y Blender 5.1.1.
Un modelo sin lanzar de Anthropic mejoró una cota de la Hipótesis de Riemann con 60 subagentes y 31 millones de tokens. Qué pasó y qué no.
El estudio Stolen Thoughts reconstruyó 315.320 bloques de razonamiento oculto de OpenAI, Anthropic y Google, y recuperó 704 datos privados.