El benchmark de la rana Habsburgo que prueba la IA

En pocas palabras: FROGS es un benchmark casero alojado en frogs.vaguespac.es que le pide a cada modelo generar en SVG una rana con mandíbula de Habsburgo. En la corrida del 2 de agosto de 2026, Claude Opus 5 tardó 64 segundos y produjo un archivo de 3.900 bytes.

Un desarrollador armó un benchmark casero para probar modelos de IA con una sola consigna: “generá un SVG de una rana con mandíbula de Habsburgo”. El proyecto se llama FROGS, y el 2 de agosto de 2026 Claude Opus 5 devolvió un SVG de 3.900 bytes en 64 segundos. Sí, en serio.

En 30 segundos

  • Qué es FROGS: un benchmark personal alojado en frogs.vaguespac.es que le pide a cada modelo el mismo prompt: una rana con mandíbula prognática, en SVG.
  • Dato duro: en la corrida del 2 de agosto de 2026, Claude Opus 5 tardó 64,0 segundos y produjo un archivo de 3.900 B, con 3 tiradas por modelo.
  • Por qué SVG: el modelo escribe código vectorial a ciegas, sin ver la imagen. Es una prueba de razonamiento espacial, no de “dibujo”.
  • Inspiración directa: el clásico “pelícano en bicicleta” de Simon Willison, que ya usaba SVG para rankear modelos.
  • Para vos: armar tu propio benchmark de 10-15 casos reales te dice más que cualquier MMLU sobre qué modelo te conviene.

Un personal benchmark del tipo “generate SVG” es una prueba casera donde una persona define una única consigna difícil, se la pasa a varios modelos de lenguaje y compara el código vectorial que devuelven. FROGS es exactamente eso: creado por un usuario individual, mide la capacidad de Claude, GPT y Gemini para traducir una descripción abstracta (“rana con mandíbula de Habsburgo”) en un archivo SVG válido, sin acceso a render visual.

¿Qué es un “personal benchmark” y por qué una rana con mandíbula de Habsburgo?

Es un test que armás vos, con una consigna que a los benchmarks oficiales se les escapa. FROGS toma la idea y la lleva a un terreno incómodo para la máquina: pedir “generate SVG” de una rana con la mandíbula prognática típica de la casa de Habsburgo, esa deformidad de mentón adelantado que se ve en los retratos de Carlos II de España.

¿Por qué esa consigna y no un perrito genérico? Porque combina dos cosas que la IA hace mal por separado y peor juntas. Una: dibujar en código, sin ojos. Dos: entender una referencia histórica y anatómica bien específica, la prognacia mandibular, y aplicarla a un bicho que no tiene mandíbula de mamífero. Podés ver un análisis más profundo en nuestra guía completa de Claude.

El proyecto se para sobre hombros conocidos. Simon Willison viene midiendo modelos con “un pelícano andando en bicicleta” desde noviembre de 2025, y en su benchmark de SVG dejó clara la lógica: si el modelo puede razonar la geometría de algo raro, probablemente razone bien otras cosas. FROGS es la versión anfibia y con más humor negro.

¿Cómo generan SVG los modelos de IA en la práctica?

El modelo no dibuja: escribe. Un SVG es texto, código XML con coordenadas, y el modelo lo teclea línea por línea sin ver el resultado hasta que un navegador lo renderiza. Es como pintar con los ojos vendados guiándote solo por números.

Acá está la diferencia clave con las imágenes que todos conocemos. Un PNG o un JPG es una grilla de píxeles (raster): lo genera un modelo de difusión tipo el motor de imágenes de turno. Un SVG es vectorial: son fórmulas, curvas de Bézier, gradientes definidos con matemática. Escalás un SVG a un cartel de 3 metros y no se pixela. Por eso sirve para iconos y logos.

Mirá lo que devolvió Claude Opus 5 en la corrida real. Definió un linearGradient para la piel que va de un verde claro (#8fd35a) a uno más oscuro (#5aa33c), un gradiente aparte para la mandíbula y un radialGradient para el globo ocular. O sea: no tiró cuatro círculos y listo, planificó capas. Ponele que le pedís lo mismo a un modelo flojo y te devuelve una mancha verde con dos puntos.

¿Qué resultados dan los distintos modelos en el benchmark FROGS?

La corrida documentada corresponde a Claude Opus 5 el 2 de agosto de 2026: 64,0 segundos, 3.900 bytes, 3 tiradas por modelo (Run 1 of 3). El detalle interesante no es el peso del archivo sino que el modelo agregó anotaciones editoriales dentro del SVG, algo que también ves en nuestro análisis de ChatGPT.

En vez de etiquetar las partes como “figura 1” o “path”, el modelo describió la característica pedida: “massive protruding mandible” y explicó que el labio superior queda “recessed, tucked behind the jaw” con los dientes inferiores por encima. Interpretó la anatomía, no solo la etiquetó. Eso es bueno y malo, ya vamos a ver por qué.

ModeloFortaleza típica en SVGDato / observación
Claude Opus 5Código limpio, capas y gradientes bien estructurados64,0 s y 3.900 B en la corrida FROGS del 2/8/2026
Claude (línea Sonnet)Más rápido, algo menos detalle geométricoSin corrida pública en esta tanda
GPT (familia GPT-5)Competitivo, buena comprensión de la consignaRinde parejo con Claude en SVG según pruebas públicas 2025-2026
GeminiMejoró bastante, menos precisión anatómicaSuele fallar más en proporciones raras
personal benchmark generate svg diagrama explicativo

Aclaración honesta: la única corrida con métricas duras que publica FROGS al momento de escribir esto es la de Opus 5. El resto de la tabla ordena capacidades según lo que se sabe de estos modelos en pruebas de SVG de 2025 y 2026, no cifras del propio FROGS. Tomalo con pinzas, como cualquier ranking donde falten tiradas.

¿Cuáles son los errores más comunes al generar SVG con IA?

Los modelos fallan casi siempre en los mismos lugares. Si alguna vez peleaste con coordenadas SVG a mano, varios te van a sonar.

  • Malinterpretar la consigna abstracta: “mandíbula de Habsburgo” es una referencia que muchos modelos no conectan con prognacia mandibular. Terminás con una rana normal.
  • Gradientes mal linkeados: definen un linearGradient con un id y después la figura no lo referencia bien. Resultado: relleno negro o transparente.
  • Proporciones que no cierran: ojos gigantes, patas cortadas fuera del viewBox, un mentón que en teoría sale pero geométricamente queda a mitad de camino.
  • Editorializar de más: lo que hizo Opus 5 con las anotaciones (“protruding mandible”) es lindo, pero si le pediste solo etiquetas estructurales, te está metiendo interpretación que no pediste.
  • Sintaxis casi válida: una etiqueta sin cerrar, un atributo mal escrito, y el navegador renderiza a medias o directamente en blanco.

¿Cómo armar tu propio benchmark personalizado de IA?

No necesitás infraestructura ni un paper. Necesitás una consigna que le duela al modelo y paciencia para repetirla. La lógica de FROGS la copiás en una tarde. Lo explicamos a fondo en los modelos de lenguaje modernos.

  • Definí la tarea real de tu negocio: no “resumí un texto”, sino “extraé el CUIT y el monto de esta factura en JSON”. Lo específico es lo que discrimina.
  • Juntá 10 a 15 ejemplos representativos: casos reales, incluidos los feos. Si todos son fáciles, el benchmark no te dice nada.
  • Probá 3 o 4 modelos candidatos: Claude, GPT y Gemini como piso. Corré cada caso al menos 3 veces, como hace FROGS, porque un modelo varía entre tiradas.
  • Armá una rúbrica de tres columnas: calidad (¿sirve?), costo (USD por 1.000 llamadas) y velocidad (segundos). Sin las tres, elegís a ciegas.
  • Documentá y repetí cada mes: los modelos cambian de versión seguido. El que ganaba en junio puede perder en agosto.

¿Vale la pena tanto laburo? Si vas a mandar un modelo a producción, sí. Un benchmark de 15 casos propios te ahorra el drama de descubrir el problema con clientes reales adentro.

¿Qué modelos ganan en gráficos vectoriales y por qué?

En generación de SVG, la familia Claude suele quedar arriba, y no por magia: es la misma habilidad que la hace fuerte en código. Un SVG es programación, y el modelo que planifica mejor una función también planifica mejor las capas de una figura.

El dato de FROGS lo respalda de costado. Opus 5 no improvisó: estructuró gradientes separados para piel, mandíbula y ojo antes de dibujar el primer path. GPT-5 pelea de igual a igual en la mayoría de las pruebas públicas. Gemini viene mejorando fuerte pero todavía patina en proporciones cuando la consigna es rara, como esta rana deforme. Habría que ver más corridas para afirmarlo con números.

¿Para qué sirve evaluar IA con SVG más allá de la rana?

El benchmark es un juego, la aplicación no. Un modelo que genera SVG limpio te resuelve tareas que hoy tercerizás o hacés a mano. Para más detalles técnicos, mirá nuestra guía completa de GPT.

  • Iconos de UI a demanda: pedís un set de iconos coherente para tu panel sin abrir un editor vectorial.
  • Placeholders dinámicos: generás avatares o gráficos de relleno por código, escalables a cualquier tamaño.
  • Diagramas técnicos automáticos: convertís una descripción en un flowchart o un esquema de red.
  • Infografías y logos conceptuales: primeros borradores que después un diseñador pule.
  • Gráficos en dashboards: visualizaciones vectoriales que servís en tu web. Si eso vive en un sitio propio, un hosting AR como donweb.com te ahorra el ida y vuelta de la latencia.

Preguntas Frecuentes

¿Qué es el benchmark FROGS de la mandíbula de Habsburgo?

Es un benchmark personal alojado en frogs.vaguespac.es que le pide a distintos modelos de IA generar un SVG de una rana con mandíbula prognática, la deformidad típica de la dinastía Habsburgo. Corre cada prompt 3 veces por modelo y publica el código, el tiempo y el peso del archivo.

¿Puede Claude generar imágenes vectoriales SVG de verdad?

Sí. Claude no dibuja píxeles, escribe el código XML del SVG a ciegas. En la corrida de FROGS del 2 de agosto de 2026, Claude Opus 5 produjo un SVG de 3.900 bytes con gradientes lineales y radiales bien estructurados en 64 segundos.

¿Cuál es el mejor modelo de IA para generar SVG?

Para SVG, la familia Claude suele liderar por su fortaleza en código, con GPT-5 muy cerca y Gemini un paso atrás en proporciones complejas. Lo real: depende de tu caso, por eso conviene correr tu propio benchmark con 10-15 ejemplos representativos.

¿Cuánto tarda un modelo en generar un SVG complejo?

Depende del modelo y del detalle pedido. En el caso documentado de FROGS, Claude Opus 5 tardó 64,0 segundos en un SVG con gradientes y anotaciones anatómicas. Modelos más chicos resuelven figuras simples en pocos segundos, con menos precisión.

¿Cómo armo un benchmark de IA para mi propio negocio?

Definí una tarea concreta de tu operación, juntá 10-15 casos reales, probá 3-4 modelos corriendo cada caso al menos 3 veces y evaluá con una rúbrica de calidad, costo y velocidad. Repetí el test cada mes, porque los modelos cambian de versión seguido.

Conclusión

FROGS parece un chiste (una rana con cara de Carlos II), pero prueba algo serio: la mejor forma de elegir un modelo no es leer el ranking oficial, es pasarle una consigna difícil y mirar qué devuelve. El dato concreto de la corrida del 2 de agosto de 2026, Claude Opus 5 en 64 segundos con gradientes bien armados, vale más que diez porcentajes de MMLU.

¿Qué hacés con esto? Copiá la idea. Elegí la tarea que de verdad te importa, armá tus 10-15 casos y corré Claude, GPT y Gemini tres veces cada uno. En una tarde vas a saber cuál te conviene, con datos tuyos y no del fabricante. Eso sí: repetilo el mes que viene, porque el que gana hoy capaz pierde en la próxima versión.

Fuentes

Desplazarse hacia arriba