IA como juez: aprueba el 40% de respuestas erróneas
Un experimento con 10 modelos mostró que los jueces de IA aprobaron el 40% de las respuestas erróneas. Solo dos favorecieron sus propios errores.
Un experimento con 10 modelos mostró que los jueces de IA aprobaron el 40% de las respuestas erróneas. Solo dos favorecieron sus propios errores.
Un chat nuevo de ChatGPT genera preguntas distintas y no trae tus errores del lunes, según un artículo de Tali. Cómo armar el registro y el plan antes del parcial.
Wellows analizó 9.471 preguntas en cinco motores de IA, entre ellos Gemini y ChatGPT. Qué muestra sobre las citas y qué no prueba sobre publicar más contenido.
El autor de cli-bench portó seis tareas a Kaggle y probó seis modelos en un intento. Pasaron 35 de 36 corridas, pero los primeros bugs eran del propio benchmark.
Llama es la familia de modelos de lenguaje de Meta con pesos abiertos. Te explicamos qué es, cómo funciona, cuáles son sus versiones y para qué sirve cada una.
Claude Haiku 4.5 envió el 18 de julio de 2026 un aviso falso sobre un homicidio al formulario de la policía de Filadelfia. Anthropic lo detectó 72 días después.
Hacktron encadenó un heap overflow en libheif con una falla de SSO y abrió un PR en el monorepo de OpenAI en menos de 72 horas. Qué pasó y cómo parchear.
Claude Code es el agente de programación de Anthropic que funciona desde la terminal. Te explicamos qué es, cómo funciona y por qué genera tanto debate entre desarrolladores.
Claude Haiku 5.5 cuesta USD 0,10 por millón de tokens de entrada, pero solo hasta 100K tokens de prompt. Qué cambia arriba, cuánto se ahorra de verdad y cuándo conviene migrar.
Anthropic fusionó Project Glasswing y su programa de verificación en tres niveles: Defense, Red Team y Specialized. Quién califica, qué sigue bloqueado y qué falta saber.