Washington Viana

Washington Viana

Infraestructura de IA Local de Alto Rendimiento
IA

Infraestructura de IA Local de Alto Rendimiento

vLLM Qwen3 NVIDIA H200 ComfyUI Blender (OptiX) Qdrant Redis Nginx/TLS Tailscale RAG/OCR

Plataforma de IA privada on-premise construida sobre 2 servidores dedicados, en alianza con IBM AI Factory (centro de datos Tier 3), para proyectos que exigen estabilidad, seguridad, gobernanza y escalabilidad. Reúne, en la misma GPU, inferencia de LLM, embeddings, RAG/OCR, generación de imagen/vídeo/3D y renderizado 3D — sirviendo aplicaciones externas únicamente mediante una API interna compatible con OpenAI.

Lo que entrega la plataforma

  • LLM de alto rendimiento: contexto de 256K tokens, 512 secuencias concurrentes y hasta ~1.300 inferencias por segundo con cola de espera — listo para cargas agénticas paralelas.
  • Embeddings co-residentes en la misma GPU, para búsqueda semántica y RAG.
  • RAG y OCR (indexación documental) en un nodo dedicado, con Qdrant y Redis.
  • Generación de imagen, vídeo y 3D (ComfyUI) y renderizado 3D con Blender (Cycles + OptiX) en la GPU.
  • API compatible con OpenAI: cualquier SDK o cliente existente funciona sin cambiar el código.

Arquitectura

Dos nodos complementarios: un nodo GPU dedicado a la inferencia pesada y un nodo de servicio (pasarela, RAG, OCR, búsqueda vectorial y proxy TLS). La comunicación entre nodos y consumidores usa VPN mesh y un túnel inverso con clave dedicada; el acceso está protegido por Nginx + TLS y autenticación del panel.

Las aplicaciones consumidoras se ejecutan en VPS externas y usan solo la API internaningún modelo se ejecuta fuera de la infraestructura propia.

Soberanía de datos y seguridad

  • Los datos nunca salen de la infraestructura física: prompts, documentos indexados (RAG), salidas y pesos de los modelos permanecen en el entorno propio; nada se envía a proveedores externos ni se usa para entrenar modelos de terceros.
  • Residencia y cumplimiento: cumple requisitos de la LGPD y de clientes que prohíben enviar datos sensibles a la nube de terceros.
  • Control total de retención y borrado: borrar datos es borrarlos local, inmediata y verificablemente.
  • Sin lock-in: API compatible con OpenAI y biblioteca de modelos local — cambiar de modelo no rompe las aplicaciones.
  • Auditoría: registros de inferencia por servicio y base de métricas propia, rastreables en el propio entorno.

Costo: tokens a costo marginal casi nulo

Ya se procesaron más de 1,4 mil millones de tokens — más de 28 mil solicitudes de LLM y 58 mil de embeddings — sin ningún cobro por token. El costo es eléctrico y de hardware ya amortizado: costo marginal de inferencia ≈ 0, sin throttling, sin fair-use y sin límite de solicitudes. En APIs comerciales de clase equivalente, este volumen costaría miles de dólares — aquí, el costo adicional es indistinguible del consumo eléctrico del servidor.

Método: investigación, laboratorio y base documental

Nada aquí se improvisó. La plataforma es el resultado de investigación aplicada y experimentación en laboratorio: comparación de varios modelos, prueba de distintas configuraciones de inferencia y validación de rendimiento antes de llevar cualquier cosa a producción.

Esta base combina más de 29 años de experiencia en desarrollo y arquitectura de software con la lectura sistemática de documentación técnica oficial — OpenAI, Anthropic, Qwen y otras — y de las informaciones de configuración y model cards publicadas en Hugging Face. Cada parámetro (contexto, concurrencia, partición de VRAM, cuantización, parsers) se eligió con base en evidencia, no en suposiciones.

Es esta combinación — experiencia de ingeniería más investigación y disciplina de laboratorio aplicadas a la IA — la que permite extraer de la GPU el mejor rendimiento con estabilidad y previsibilidad.

Ingeniería y operación

  • LLM ajustado para producción: decodificación especulativa (MTP), tool-calling nativo para agentes de código, partición de VRAM (LLM + embeddings en la misma GPU) e historial de configuraciones mantenido como scripts, lo que permite cambios sin reimplementación.
  • Operación madura: servicios bajo systemd con auto-restart, scripts de orquestación y health-check, runbooks y procedimiento de rollback.
  • Dashboard de operaciones propio: estado, métricas históricas, control de start/stop y monitor de VRAM.
  • Multi-tenant en la GPU: protocolo documentado para que el render 3D comparta y libere la GPU con el LLM — una sola GPU atendiendo inferencia, generación de medios y render al mismo tiempo.
  • Estabilidad comprobada: 120 días en producción sin incidencias, con espejo redundante.

En resumen: una base de IA privada que convierte hardware dedicado en capacidad de inferencia escalable, soberana y de costo predecible para productos que exigen gobernanza de datos.

Galería