Tecnología y seguridad

Para el equipo técnico: qué hay adentro y qué no prometemos.

Esta página está escrita para sysadmins, ingenieros, arquitectos de seguridad y desarrolladores. Sin adjetivos innecesarios: motores, interfaces, controles y límites conocidos.

Diagrama público

Una plataforma, múltiples motores especializados.

Usuarios y aplicaciones · navegador · integraciones
Xeretron AI Server · panel FastAPI + frontend
Modelos LLM / VL
llama-proxy + llama.cpp
Voz a texto
FastWhisper
OCR / documentos
File Server
Texto a voz
Qwen TTS
Seguridad / usuarios
PAM · TOTP · keys
Observabilidad
health · logs
Infraestructura privada · GPU NVIDIA CUDA · Linux · systemd

Vista pública. No publicamos rutas internas, credenciales, detalles de red sensibles ni vulnerabilidades no gestionadas.

Motores y sustento

Qué corre, con qué se sostiene y dónde está el límite.

ComponenteQué haceLímite declarado
Panel unificadoDashboard, chat, modelos, descargas, APIs, inferencias, seguridad, usuarios, red, firewall, servicios y energía.No afirmamos observabilidad enterprise completa.
Telemetría de hardwareGPU y VRAM, potencia, CPU/RAM, temperatura, discos y estado de servicios.Los sensores dependen del host físico.
Inferencia localModelos GGUF con streaming compatible con formato OpenAI; contexto, hilos, atención rápida, caché KV y tensor split.No todo GGUF corre en cualquier binario o hardware.
Catálogo y proxyCatálogo, salud, carga/descarga, endpoints de chat y administración, perfiles publicados.Depende de pesos descargados previamente.
Lanesbase, gpu0, gpu1, dual y cpu para distribuir cargas.Concurrencia limitada por VRAM.
Texto y visiónComponente visual con proyección multimodal e imágenes por URL o datos.Requiere mmproj compatible con el modelo.
ChatStreaming SSE, historial en cliente, transcripción, adjuntos visuales y métricas.El historial se gestiona del lado del cliente.
Perfiles y VRAMCiclo borrador → probar → publicar y estimación de memoria antes de armar stacks.La estimación no es una garantía exacta.
Modo frontierSuspende el stack habitual, carga un modelo grande y restaura tras la inactividad sin cortar inferencias activas.Puede tardar varios minutos en conmutar.
Voz a textoTranscripción local con descarga por inactividad.Calidad sujeta a audio de entrada e idioma.
OCR / documentosPDF, Office, imágenes y CSV a texto, ES/EN.Depende de la calidad del escaneo original.
API de inferenciaEndpoints sobre HTTPS con claves de alcance limitado.Compatible solo en endpoints y estructuras soportados.
Red / HTTPSTerminación TLS y exposición externa controlada.La política de red la define la organización.
Módulos opcionalesGameDev-MCP / Unreal, telefonía SIP, sincronización entre nodos y proveedores externos explícitos.Se activan según proyecto y acuerdo.

Seguridad

Controles concretos, no eslóganes.

No decimos que un sistema sea «100 % seguro» ni «imposible de hackear». Describimos qué controles existen y quién es responsable de cada capa.

Autenticación y MFA

Gestión de acceso con segundo factor basado en tiempo y administración de sesiones desde el nodo.

API keys con scopes

Claves por integración con alcance limitado, revocables y con registro de uso.

Auditoría

Registros de seguridad y de inferencias para reconstruir accesos, cambios y consultas.

TLS y firewall

Cifrado en tránsito y administración de puertos y reglas desde el propio panel.

Usuarios de sistema y apps

Identidades humanas y de aplicaciones con roles diferenciados y privilegios mínimos.

Backups y despliegue

Respaldos acordados e instalación por fases sobre servidor limpio, con verificación.

Corresponsabilidad. Xeretron aporta los controles técnicos y la operación acompañada; la organización mantiene la política de acceso, la gestión de su red y el cumplimiento de su marco normativo. No afirmamos cumplimiento regulatorio automático.

Requisitos orientativos

Dimensionamiento realista.

  • Sistema operativo Linux con controladores NVIDIA y CUDA.
  • De 1 a 2 o más GPU según paquete y modelos objetivo.
  • RAM y almacenamiento en función del catálogo de pesos previsto.
  • Acceso administrativo durante el despliegue y ventana de mantenimiento.
  • Evaluación previa obligatoria antes de cualquier compromiso.

Preguntas de preventa técnica

  • ¿Qué datos se procesarán? Define privacidad, retención, red y acceso.
  • ¿Qué modelos necesitan? Define GPU, RAM, disco y compatibilidad.
  • ¿Cuántos usuarios? Define concurrencia y capacidad.
  • ¿Contexto y documentos? Define caché KV, RAM y OCR.
  • ¿Usarán voz? Define GPU compartida, audio y almacenamiento.
  • ¿Operación offline? Define paquetes, soporte y actualizaciones.
  • ¿Integrarán aplicaciones? Define API, autenticación, TLS y scopes.
  • ¿Qué disponibilidad esperan? Define redundancia, monitoreo y SLA.
Agendar conversación técnica

¿Quieres ver el nodo en operación antes de decidir?

Demo de 30 minutos, presencial o remota, con un responsable técnico de tu lado si lo deseas.