Petals: correr LLM gigantes en casa al estilo BitTorrent

En pocas palabras: Petals es un sistema open source de BigScience que corre LLM enormes de forma distribuida: cada usuario aloja unas pocas capas transformer en su GPU y se conecta a un enjambre estilo BitTorrent que sirve el resto, alcanzando velocidad para apps interactivas desde una placa de consumo o Google Colab.

Petals es un sistema de código abierto del taller de investigación BigScience que te permite ejecutar LLM en casa descentralizado, al estilo BitTorrent: cargás una parte del modelo en tu GPU y te conectás a un enjambre de voluntarios que sirven el resto. Según la documentación oficial de Petals a julio 2026, la inferencia de un solo lote corre a una velocidad que alcanza para apps interactivas, usando una placa de consumo o incluso Google Colab.

Petals es una plataforma distribuida de inferencia y fine-tuning para modelos de lenguaje grandes. En vez de correr todo el modelo en tu máquina, cada usuario aloja unas pocas capas transformer y colabora con otros para completar el modelo entero. Nació dentro del taller de investigación BigScience (el mismo detrás de BLOOM) y su código vive en GitHub bajo licencia abierta. Sirve para inferencia, fine-tuning con adapters y acceso a estados internos del modelo.

En 30 segundos

  • Qué es: un sistema tipo BitTorrent para correr LLM enormes repartiendo el modelo entre voluntarios, no en una sola máquina.
  • Velocidad: inferencia de lote único a un ritmo apto para apps interactivas, según la documentación oficial de Petals a julio 2026.
  • Hardware: alcanza una GPU de consumo (o Colab), porque solo cargás una fracción del modelo, no los pesos completos.
  • Diferencia con Ollama: Ollama corre 100% local; Petals reparte la carga en una red y depende de que haya nodos activos.
  • El pero: tus datos pasan por nodos de terceros durante la inferencia, así que no es la opción para información confidencial dura.

¿Cómo funciona la red descentralizada de Petals?

Petals parte el modelo en bloques de capas transformer y los reparte entre las máquinas conectadas a la red. Vos cargás una porción, otros voluntarios sirven las capas que te faltan, y la comunicación entre nodos arma el modelo completo bajo demanda. La analogía con BitTorrent es literal: nadie tiene el archivo entero, cada uno aporta un pedazo.

Ponele que querés correr un modelo de 70.000 millones de parámetros. Ese modelo pesa decenas de gigas y no entra en una placa de consumo. Con Petals cargás apenas las capas que te tocan, el resto viaja por la red, y el texto se genera pasando los estados ocultos de nodo en nodo. La documentación oficial señala que la inferencia de lote único corre a un ritmo que zafa para chat interactivo y apps en tiempo real (no para procesar millones de tokens en batch, ojo).

Lo interesante es que no te quedás con una API cerrada. Podés ejecutar caminos personalizados a través del modelo, aplicar tus propios métodos de sampling y ver los estados internos. Tenés la comodidad de una API con la flexibilidad de correr el modelo vos mismo.

¿Qué modelos de lenguaje soporta Petals?

Petals soporta las familias de modelos abiertos más pesadas del mercado: Llama, Falcon y BLOOM 176B, la estrella de BigScience. Al ser código abierto, la comunidad puede agregar arquitecturas nuevas cuando salen. El foco siempre estuvo en los modelos que no entran en una sola GPU de consumo, que es justo donde el enfoque distribuido tiene sentido.

Acá viene un matiz importante que conviene verificar antes de arrancar: qué modelos están activos en la red depende de qué estén sirviendo los voluntarios en ese momento. Un modelo puede estar soportado en el código pero no tener nodos online. Antes de casarte con una arquitectura, mirá el estado de la red en la documentación oficial de Petals.

¿Cuáles son los requisitos mínimos de GPU y RAM?

El requisito clave de Petals es tener VRAM suficiente para alojar el bloque de capas que te toca servir, no el modelo entero. Por eso una GPU de consumo o un Google Colab gratuito alcanzan para empezar, según la documentación de Petals. Esa es la diferencia de fondo con correr el modelo completo en local, donde necesitarías decenas de gigas de VRAM que ninguna placa hogareña tiene.

Si tu placa viene justa de memoria, la cuantización (reducir la precisión de los pesos, por ejemplo a INT4) baja el consumo de VRAM a costa de algo de calidad. Y si comparás con las APIs en la nube, la ventaja es que no pagás suscripción mensual: ponés tu hardware y tu ancho de banda, y listo.

Eso sí: los números exactos de VRAM y RAM dependen del modelo y de cuántas capas sirvas. Los valores “recomendados” que circulan por foros son orientativos. Tomalos con pinzas y probá con tu setup antes de sacar conclusiones.

¿Qué velocidad de inferencia tiene Petals frente a otras opciones?

Petals apunta a inferencia interactiva, no a throughput masivo. La referencia es una inferencia de lote único a un ritmo pensado para uso interactivo, según la documentación oficial de Petals. El paper de Petals sostiene que, en un setup realista, este enfoque distribuido es bastante más rápido que hacer offloading de un modelo grande contra el disco o la RAM de una sola máquina.

¿Y de qué depende esa velocidad? No solo de tu GPU. Como el modelo viaja por la red, la latencia entre nodos pesa tanto como la potencia de cálculo. Si los voluntarios que te sirven capas están del otro lado del planeta con conexiones flojas, vas a sentirlo. Por eso el rendimiento real varía según el estado del enjambre, y conviene medirlo antes de meterlo en cualquier flujo serio.

¿Qué diferencia hay entre Petals y Ollama?

La diferencia central: Ollama corre el modelo entero en tu propia máquina, Petals lo reparte en una red de voluntarios. Ollama te da privacidad total pero te limita a modelos que entren en tu hardware. Petals te deja correr modelos gigantes con una placa modesta, a cambio de depender de nodos externos y de tolerar la latencia de red.

AspectoPetalsOllama
ArquitecturaDistribuida (enjambre de voluntarios)100% local
Hardware para modelos grandesGPU de consumo o ColabNecesitás VRAM para el modelo completo
PrivacidadLos datos pasan por nodos de tercerosLos datos nunca salen de tu máquina
Dependencia de conexiónAlta (requiere nodos online)Ninguna, funciona offline
Modelos gigantes (70B+)Sí, con hardware modestoSolo si tu GPU los banca
CostoGratis, código abiertoGratis, código abierto
ejecutar llm en casa descentralizado diagrama explicativo

No es que uno sea mejor que el otro. Son herramientas para escenarios distintos. Si tenés una placa modesta y querés jugar con un modelo enorme, Petals. Si necesitás que nada salga de tu equipo y tu hardware banca el modelo, Ollama.

¿Cómo se usa Petals para fine-tuning personalizado?

Petals permite fine-tuning con métodos eficientes en parámetros: en vez de reentrenar el modelo completo, entrenás adapters livianos (como P-Tuning) sobre la red distribuida. Instalás Petals, te conectás al enjambre, cargás tus adapters y entrenás sobre tu tarea puntual. Casos típicos: un clasificador de sentimientos, un chatbot con tu tono, o un sistema de RAG con tus documentos. Tema relacionado: cómo funcionan los modelos de lenguaje.

La gracia extra es el acceso a los estados ocultos del modelo. Eso abre la puerta a extensiones custom que con una API cerrada ni soñás: caminos personalizados a través de las capas, sampling propio, inspección de lo que pasa por dentro. Para investigación o prototipos raros, ese nivel de acceso vale oro.

¿Qué tan privado y seguro es Petals para datos sensibles?

Acá está la letra chica. En Petals, tus prompts y estados intermedios viajan por nodos de voluntarios que no controlás. Para datos moderadamente sensibles puede estar bien, pero para información confidencial dura (datos de clientes, secretos comerciales, historia clínica) no es la herramienta. Si necesitás garantía total de que nada sale de tu máquina, Ollama o un modelo 100% local es el camino.

Dicho esto, el enfoque distribuido no es intrínsecamente inseguro: sirve fenómeno para experimentar, para tareas públicas o para contenido que no te importa que pase por terceros. El punto es entender el modelo de confianza antes de mandar cualquier cosa. Si armás una red privada con nodos tuyos, el panorama cambia, pero eso ya es otro nivel de setup.

Si estás montando la infraestructura para correr tus propios nodos, un VPS o un servidor con GPU te dan control sobre quién sirve las capas. Para hosting y servidores en Argentina podés mirar donweb.com.

Qué está confirmado y qué no

  • Confirmado: Petals corre LLM al estilo BitTorrent repartiendo capas entre voluntarios, según su web oficial y su paper en OpenReview.
  • Confirmado: inferencia de lote único a un ritmo apto para apps interactivas, y funcionamiento con GPU de consumo o Colab.
  • Confirmado: soporta fine-tuning eficiente en parámetros y expone estados ocultos del modelo.
  • No confirmado por mí: el estado actual de la red en 2026 (cuántos nodos activos, qué modelos hay online). No tengo datos en vivo, así que verificalo en petals.dev antes de depender del proyecto.
  • No confirmado por mí: el soporte exacto para los modelos más nuevos. El código es abierto y evoluciona, así que chequeá el repo de GitHub.

Errores comunes al usar Petals

  • Creer que necesitás una GPU extrema. No: la idea es justo la contraria. Solo cargás una fracción del modelo, por eso alcanza una placa de consumo.
  • Confundirlo con Ollama. Ollama es local y offline; Petals necesita nodos online. Si esperás que funcione sin conexión, te vas a frustrar.
  • No medir la latencia de red antes de producción. El rendimiento depende del enjambre, no solo de tu hardware. Probá tu caso real antes de comprometerte.
  • Elegir modelo sin pensar en cuantización. Si vas justo de VRAM, INT4 te salva, pero cambia la calidad. Definilo antes, no después.
  • Mandar datos confidenciales. Recordá que pasan por nodos de terceros. Para eso, otra herramienta.

Preguntas Frecuentes

¿Qué es Petals?

Petals es un sistema de código abierto para ejecutar y ajustar modelos de lenguaje grandes de forma distribuida, al estilo BitTorrent. Cada usuario aloja unas capas del modelo y colabora con otros para completarlo. Nació en el taller de investigación BigScience y su código está en GitHub. Lo explicamos a fondo en qué ofrece Google en IA.

¿Puedo correr Petals con una GPU común?

Sí. Alcanza una GPU de consumo o incluso Google Colab, según la documentación oficial de Petals, porque solo cargás una porción del modelo y no los pesos completos. Esa es la ventaja central frente a correr un modelo gigante entero en local.

¿Cuánta velocidad de inferencia obtengo con Petals?

La inferencia de lote único corre a un ritmo que sirve para chat interactivo, según la documentación de Petals. La velocidad real depende de la latencia de la red, no solo de tu GPU.

¿Es seguro usar Petals para datos confidenciales?

No para información confidencial dura. En Petals tus datos pasan por nodos de voluntarios durante la inferencia, así que no hay garantía de que nada salga de tu control. Para máxima privacidad conviene una herramienta 100% local como Ollama.

¿Petals es gratis?

Sí, Petals es de código abierto y gratuito, con su repositorio público en GitHub bajo el paraguas de BigScience. No pagás suscripción: ponés tu hardware y tu ancho de banda, y te sumás al enjambre de la red.

Conclusión

Petals resuelve un problema concreto: correr modelos de lenguaje enormes sin tener una GPU de data center en tu casa. Repartís la carga, aportás una parte y el enjambre completa el resto. Para investigación, prototipos y experimentos con modelos abiertos gigantes, es una propuesta ingeniosa que sigue teniendo pocos equivalentes.

¿Qué hacer con esto? Si querés jugar con un modelo de 70B y tu placa no lo banca, probá Petals antes de pagar una API. Si tu prioridad es que nada salga de tu máquina, quedate con Ollama. Y si vas en serio, verificá el estado actual de la red en petals.dev: el modelo distribuido vive de que haya nodos activos, y eso conviene chequearlo hoy, no asumirlo.

Fuentes

Desplazarse hacia arriba