IREX
ES

StreamVLM

StreamVLM™ crea un detector de video funcional a partir de una frase. Una condición descrita en texto simple se convierte en un detector activo en las cámaras seleccionadas, sin recopilación de conjunto de datos, sin etiquetado y sin entrenamiento de modelos.

Disponibilidad. StreamVLM se ofrece en beta en instancias seleccionadas. La capacidad está incluida en el precio estándar de IREX; el único costo adicional es un nodo GPU local para la inferencia del modelo de visión y lenguaje cuando un despliegue lo requiere. Para confirmar si un despliegue concreto está dentro del alcance, contacte al representante de IREX de la región.

El problema que resuelve

Un módulo de analítica convencional es un modelo entrenado. Agregar uno implica recopilar grabaciones de la condición, etiquetarlas, entrenar, validar y publicar una versión. Ese esfuerzo se justifica para armas, rostros, placas y fuego, donde la condición se repite en todos los despliegues y lo que está en juego es alto.

No se justifica para la larga cola de casos: agua estancada en un paso a desnivel, vertido ilegal detrás de un edificio, nieve sin retirar en una salida de emergencia, grafiti en una pared. Estas condiciones son específicas de un municipio, y hay cientos de ellas. StreamVLM cubre esa cola, porque describir una condición cuesta una frase en lugar de un ciclo de desarrollo.

Cómo funciona

Cómo un texto de StreamVLM se convierte en una alerta DEL TEXTO A LA ALERTA 1. Texto Se escribe una vez, en texto simple: "persona tendida en el suelo" 2. Fotogramas Muestreados de la transmisión en vivo del canal elegido. 3. VLM Un modelo de visión y lenguaje lee imagen y texto juntos, y puntúa cada fotograma. 4. Umbral La confianza por texto y el tiempo de espera deciden qué califica. 5. Evento Alerta en tiempo real, registro y datos de tablero. El texto, la evaluación y cada evento resultante se registran en el log de auditoría La inferencia se ejecuta en un nodo GPU dentro de la red del cliente. Los fotogramas y los resultados no salen de ella.
Un texto se configura una vez y luego se evalúa de forma continua contra fotogramas muestreados. Todo lo que produce el detector entra en la misma canalización de eventos que cualquier otro módulo de analítica.

Cómo es un detector

Un detector de StreamVLM es un conjunto nombrado de textos con su propia configuración, aplicado a canales de cámara seleccionados. Cada texto es independiente:

Ajuste Qué controla
Texto del prompt La condición a detectar, descrita en lenguaje simple.
Umbral de confianza Qué tan seguro debe estar el modelo antes de generar un evento. Un umbral más bajo detecta más y reporta más falsos positivos; uno más alto hace lo contrario.
Tiempo de espera de alerta El intervalo mínimo entre alertas repetidas de la misma condición en el mismo canal, para que una condición persistente no inunde al operador.
Tipo de evento Cómo se clasifica el evento resultante para la búsqueda, los monitores de alarma y los informes.
Cámaras En qué canales se ejecuta el detector.

Un solo canal de cámara admite hasta 100 detectores definidos con texto a la vez. Una cámara de estación puede así vigilar simultáneamente a una persona en las vías, la sobrecarga del andén, una bolsa abandonada, humo, grafiti reciente y el anegamiento a nivel del andén. Los textos se agregan y ajustan sin sacar el sistema de servicio.

Ejemplos de texto

Escenario Texto
Emergencia médica en un espacio público una persona tendida en el suelo
Inundación en un paso a desnivel agua estancada o inundación en el paso a desnivel
Daño en infraestructura una valla dañada o rota a lo largo del perímetro
Vertido ilegal escombros o basura vertidos fuera de un contenedor
Vandalismo grafiti reciente en una pared
Riesgo invernal nieve sin retirar en una acera o salida de emergencia
Área restringida un vehículo estacionado en la acera
Señalización y marcas un número de contenedor o cartel de advertencia visible en el vehículo

Dónde encaja StreamVLM junto a los demás módulos

StreamVLM complementa a los módulos entrenados en lugar de competir con ellos. Los dos trabajan a tasas de fotogramas distintas y responden preguntas distintas.

Módulos entrenados StreamVLM
Mejor para Seguir e identificar personas, vehículos y objetos de forma continua Reconocer una escena o condición descrita
Tasa de fotogramas Alta, cada fotograma, para poder seguir un objeto Fotogramas muestreados, suficientes para una condición persistente
Una capacidad nueva exige Un conjunto de datos, entrenamiento y una versión Una frase
Uso típico Coincidencias con listas de vigilancia, lectura de placas, intrusión, conteo, aplicación de tránsito Condiciones municipales, riesgos específicos del sitio, necesidades de monitoreo puntuales

Los eventos de StreamVLM entran en la misma canalización que cualquier otro evento. Funcionan con monitores de alarma, aparecen en la búsqueda de eventos y llegan al terreno a través de Sover.

Rendición de cuentas

Un detector que cualquiera puede definir en una frase necesita la misma supervisión que uno que tomó un año entrenar, y se rige por los mismos mecanismos:

  • Los textos quedan registrados. Crear, editar y activar un detector son acciones registradas, atribuidas al operador que las realizó. Por eso siempre es posible reconstruir qué se le pidió al sistema que buscara.
  • Los eventos son auditables. Toda alerta lleva su canal, marca de tiempo, confianza y el texto que la produjo, lo que hace revisable el comportamiento de un detector después de los hechos.
  • Las búsquedas siguen exigiendo un Case ID. Recuperar eventos de StreamVLM del archivo es una búsqueda de eventos, de modo que las reglas de Case ID y rendición de cuentas se aplican sin cambios.
  • Los permisos siguen aplicando. Quién puede crear textos, en qué cámaras, y quién puede ver los eventos resultantes, se rige por el control de acceso basado en roles.
  • Los textos no amplían el alcance de la plataforma. Un texto describe una escena o una condición. No crea una nueva capacidad de identificación, y no puede usarse para reconocer o seguir a personas que no estén pre-registradas. Véase Ética de la IA.

Temas relacionados