Producto

Un servidor de IA que se gobierna desde un solo panel.

Xeretron reúne modelos, hardware, voz, documentos, APIs, seguridad y operación en un sistema que vive dentro de tu organización. Esta página explica el problema que resuelve, qué verás en el panel y qué se necesita para ponerlo a operar.

Solicitar una evaluación privada Ver arquitectura técnica

El problema operacional

Tener IA hoy significa, en la práctica, depender de otro.

Cada conversación sale de la organización. Cada factura cambia con el uso. Cada cambio de proveedor o de precios obliga a rediseñar lo que ya estaba construido. Y la información más sensible de la institución termina gobernada por políticas ajenas.

Datos que viajan

Lo que se procesa en una nube externa deja de estar bajo tu gobierno diario.

Costo variable

El presupuesto depende de cuánto se use, y el uso rara vez se puede predecir.

Dependencia de proveedor

Modelos, límites y precios cambian sin que la organización pueda decidir.

Herramientas dispersas

Chat, transcripción, OCR y APIs en servicios distintos, sin control unificado.

Vista unificada

Todo el nodo, en una sola pantalla.

El panel de Xeretron muestra el estado del hardware, los modelos cargados, los servicios activos y la actividad de inferencia. La idea es simple: si puedes verlo, puedes operarlo.

HUD de hardware

GPU y VRAM por tarjeta, potencia, CPU, RAM, temperaturas, discos y estado de servicios.

Catálogo y carga

Modelos disponibles, salud, carga y descarga, perfiles publicados y colas de descarga.

Chat y pruebas

Streaming, adjuntos visuales, transcripción de audio y métricas por respuesta.

APIs y claves

Endpoints publicados, claves con alcance y documentación para tus desarrolladores.

Inferencias y auditoría

Historial de inferencias y registros de seguridad para revisar qué ocurrió y cuándo.

Red, firewall y energía

Puertos, servicios del sistema y consumo eléctrico administrados desde el panel.

Tour del panel

Del modelo cargado a la respuesta, con métricas.

Cada operación deja información útil: qué modelo respondió, en qué lane corrió, cuánto tardó el primer token y a qué velocidad generó. Esa visibilidad es la que convierte una demo en una operación sostenida.

  • Streaming en tiempo real con historial en el cliente.
  • Adjuntos visuales para modelos con componente mmproj compatible.
  • Transcripción de audio y extracción de documentos en el mismo hilo de trabajo.
  • Indicadores de comportamiento por familia de modelos.
Captura real del panel Xeretron 1: carga y selección de modelo
Clic para ampliar

Capacidades en detalle

Una plataforma, múltiples motores especializados.

Cada motor resuelve una tarea concreta y comparte con el resto el mismo panel, la misma seguridad y la misma infraestructura.

Inferencia local

Servidor de inferencia con modelos GGUF y streaming compatible con el formato OpenAI: contexto, hilos, atención rápida, caché KV y división por tarjetas. Límite honesto: no todo GGUF corre en cualquier binario o hardware; la compatibilidad se valida en la evaluación.

Texto y visión

Modelos con componente visual y proyección multimodal, aceptando imágenes por URL o datos embebidos, para lectura de documentos, capturas y fotografías.

Lanes y concurrencia

Carriles de ejecución base, gpu0, gpu1, dual y cpu. La concurrencia real está limitada por la memoria de video disponible: se dimensiona, no se promete a ciegas.

Perfiles y stack multi-modelo

Flujo de borrador, prueba y publicación. Combinaciones de modelos guardadas y restaurables, con estimación previa de memoria para cada stack.

Modo frontier

Suspende el stack habitual, carga un modelo de mayor tamaño y restaura la configuración tras la inactividad sin cortar inferencias activas. Puede tardar varios minutos.

Voz a texto local

Transcripción con Whisper en el propio nodo y descarga por inactividad para devolver GPU a las tareas principales.

Documentos y OCR

PDF, Office, imágenes y hojas de cálculo convertidas a texto en español e inglés, listas para consultar o resumir con los modelos cargados.

Texto a voz

Generación de audio bajo demanda dentro del nodo, para avisos, accesibilidad y productos que necesitan hablar.

Benchmarks y descargas

Mediciones de latencia inicial y tokens por segundo en hardware real, contextualizadas; colas de descarga y almacenamiento de pesos administrados.

API de inferencia

Endpoints sobre HTTPS con claves de acceso limitadas por alcance, para conectar aplicaciones internas o servicios existentes.

Módulos opcionales

Integración con entornos de desarrollo de juegos y Unreal, telefonía SIP y sincronización entre nodos.

Operación offline

Con los modelos instalados, la operación local es posible. Las actualizaciones y descargas requieren conectividad, y así lo especificamos en cada despliegue.

Arquitectura

Servicios desacoplados sobre infraestructura privada.

Usuarios y aplicaciones
Xeretron AI Server
Modelos LLM / VL
Voz a texto
OCR / documentos
Texto a voz
Seguridad / usuarios
Observabilidad
Infraestructura privada · GPU NVIDIA · Linux

Diagrama público simplificado. No publicamos rutas internas, credenciales ni detalles sensibles del despliegue.

Requisitos y despliegue

Qué necesitas para empezar.

Los requisitos dependen de los modelos y de la concurrencia esperada, por eso la evaluación previa es obligatoria. Como orientación general:

  • Servidor con Linux y GPU NVIDIA con CUDA.
  • De una a dos o más GPU según el paquete elegido.
  • RAM y disco dimensionados al catálogo de modelos previsto.
  • Red interna con posibilidad de exponer HTTPS de forma controlada.
  • Un responsable técnico designado por la organización.

Qué recibe el cliente

  • Hardware y software optimizados como un solo sistema.
  • Panel Xeretron y motor de inferencia configurados.
  • Voz a texto, texto a voz y procesamiento de archivos.
  • HTTPS, catálogo inicial de modelos e instalación en sitio.
  • Capacitación del equipo y soporte de arranque de 30 a 90 días.
  • Documentación en español.

¿Tu infraestructura actual puede convertirse en un nodo de IA?

Cuéntanos qué datos, modelos y usuarios tienes en mente. Respondemos con una evaluación honesta, incluidos los casos en los que Xeretron no es la mejor opción.