Servidor de inferencia local
Ejecuta modelos GGUF dentro de tu infraestructura con streaming compatible con el formato OpenAI. Parametrizas contexto, hilos, atención rápida y caché KV desde el panel.
01 · Inferencia
Modelos, memoria y concurrencia: donde se define la capacidad real de tu nodo.
Ejecuta modelos GGUF dentro de tu infraestructura con streaming compatible con el formato OpenAI. Parametrizas contexto, hilos, atención rápida y caché KV desde el panel.
Modelos con componente visual y proyección multimodal. Aceptan imágenes por URL o datos embebidos para leer documentos, capturas y fotografías.
Carriles base, gpu0, gpu1, dual y cpu para distribuir cargas y aislar tareas críticas del tráfico ordinario.
Ciclo de vida completo: borrador, prueba y publicación. Lo que un ingeniero experimenta queda como configuración estable para el resto.
Combinaciones de varios modelos guardadas y restaurables, con estimación previa de memoria antes de cargarlas.
Suspende el stack habitual, carga un modelo de mayor tamaño y restaura la configuración tras la inactividad sin cortar inferencias activas.
02 · Voz
Transcripción y síntesis que no envían el audio a ningún servicio externo.
Transcripción de audio dentro del nodo, con descarga por inactividad para devolver la GPU a las tareas principales cuando no se usa.
Generación de audio bajo demanda para avisos, accesibilidad, contenidos formativos y productos que necesitan hablar.
03 · Documentos
La base de casi todo caso de uso institucional: convertir papeles en conocimiento utilizable.
Convierte PDF, documentos de Office, imágenes y hojas de cálculo en texto plano listo para consultar, resumir o extraer datos.
Gestión del almacenamiento de modelos: colas de descarga, verificación de pesos y control de qué versiones quedan disponibles.
04 · Plataforma
Interfaces y módulos opcionales. Todo lo opcional está etiquetado como tal.
Endpoints sobre HTTPS con claves de acceso de alcance limitado, para conectar sistemas internos, automatizaciones o productos propios.
Conexión del nodo con entornos de desarrollo de juegos y simulación para personajes, diálogo asistido y contenido dinámico.
Vinculación con centralitas para escenarios de voz por teléfono sobre la misma capacidad de transcripción y síntesis.
Coordinación de configuración y catálogo entre varios nodos de una misma organización.
Posibilidad de enrutar cargas concretas a servicios externos cuando la organización lo decide y lo documenta.
Panel y documentación en español, inglés y portugués para equipos y regiones diversas.
05 · Gobierno y seguridad
Controles concretos con responsabilidades claras: ni promesas absolutas ni caja negra.
Identidades humanas y de servicios con roles y privilegios mínimos, administradas desde el propio nodo.
Segundo factor basado en tiempo y gestión de sesiones para reducir el riesgo de credenciales comprometidas.
Claves por integración, limitadas por permiso, revocables y con registro de uso.
Registros de accesos, cambios de configuración y eventos relevantes para reconstruir qué ocurrió.
Historial de consultas y respuestas del sistema para trazabilidad operativa y análisis de uso.
Administración de puertos, reglas y exposición externa desde el panel, con terminación TLS.
06 · Operación
Telemetría, servicios y energía: lo que necesitas para sostener el sistema en el tiempo.
GPU y VRAM por tarjeta, potencia consumida, CPU, memoria, temperaturas, discos y estado de servicios en una sola vista.
Estado y control de los procesos del sistema, con verificación de salud de cada motor.
Consumo eléctrico del nodo y su correlación con la carga de trabajo, insumo directo para el cálculo de costo total.
Medición de latencia del primer token y velocidad de generación en el hardware real del cliente.
Con los modelos instalados, los flujos locales siguen funcionando sin salida a internet.
Despliegue en etapas sobre servidor limpio, con verificación y capacitación en cada fase.