StreamVLM
StreamVLM™ crea un detector de video funcional a partir de una frase. Una condición descrita en texto simple se convierte en un detector activo en las cámaras seleccionadas, sin recopilación de conjunto de datos, sin etiquetado y sin entrenamiento de modelos.
Disponibilidad. StreamVLM se ofrece en beta en instancias seleccionadas. La capacidad está incluida en el precio estándar de IREX; el único costo adicional es un nodo GPU local para la inferencia del modelo de visión y lenguaje cuando un despliegue lo requiere. Para confirmar si un despliegue concreto está dentro del alcance, contacte al representante de IREX de la región.
El problema que resuelve
Un módulo de analítica convencional es un modelo entrenado. Agregar uno implica recopilar grabaciones de la condición, etiquetarlas, entrenar, validar y publicar una versión. Ese esfuerzo se justifica para armas, rostros, placas y fuego, donde la condición se repite en todos los despliegues y lo que está en juego es alto.
No se justifica para la larga cola de casos: agua estancada en un paso a desnivel, vertido ilegal detrás de un edificio, nieve sin retirar en una salida de emergencia, grafiti en una pared. Estas condiciones son específicas de un municipio, y hay cientos de ellas. StreamVLM cubre esa cola, porque describir una condición cuesta una frase en lugar de un ciclo de desarrollo.
Cómo funciona
Cómo es un detector
Un detector de StreamVLM es un conjunto nombrado de textos con su propia configuración, aplicado a canales de cámara seleccionados. Cada texto es independiente:
| Ajuste | Qué controla |
|---|---|
| Texto del prompt | La condición a detectar, descrita en lenguaje simple. |
| Umbral de confianza | Qué tan seguro debe estar el modelo antes de generar un evento. Un umbral más bajo detecta más y reporta más falsos positivos; uno más alto hace lo contrario. |
| Tiempo de espera de alerta | El intervalo mínimo entre alertas repetidas de la misma condición en el mismo canal, para que una condición persistente no inunde al operador. |
| Tipo de evento | Cómo se clasifica el evento resultante para la búsqueda, los monitores de alarma y los informes. |
| Cámaras | En qué canales se ejecuta el detector. |
Un solo canal de cámara admite hasta 100 detectores definidos con texto a la vez. Una cámara de estación puede así vigilar simultáneamente a una persona en las vías, la sobrecarga del andén, una bolsa abandonada, humo, grafiti reciente y el anegamiento a nivel del andén. Los textos se agregan y ajustan sin sacar el sistema de servicio.
Ejemplos de texto
| Escenario | Texto |
|---|---|
| Emergencia médica en un espacio público | una persona tendida en el suelo |
| Inundación en un paso a desnivel | agua estancada o inundación en el paso a desnivel |
| Daño en infraestructura | una valla dañada o rota a lo largo del perímetro |
| Vertido ilegal | escombros o basura vertidos fuera de un contenedor |
| Vandalismo | grafiti reciente en una pared |
| Riesgo invernal | nieve sin retirar en una acera o salida de emergencia |
| Área restringida | un vehículo estacionado en la acera |
| Señalización y marcas | un número de contenedor o cartel de advertencia visible en el vehículo |
Dónde encaja StreamVLM junto a los demás módulos
StreamVLM complementa a los módulos entrenados en lugar de competir con ellos. Los dos trabajan a tasas de fotogramas distintas y responden preguntas distintas.
| Módulos entrenados | StreamVLM | |
|---|---|---|
| Mejor para | Seguir e identificar personas, vehículos y objetos de forma continua | Reconocer una escena o condición descrita |
| Tasa de fotogramas | Alta, cada fotograma, para poder seguir un objeto | Fotogramas muestreados, suficientes para una condición persistente |
| Una capacidad nueva exige | Un conjunto de datos, entrenamiento y una versión | Una frase |
| Uso típico | Coincidencias con listas de vigilancia, lectura de placas, intrusión, conteo, aplicación de tránsito | Condiciones municipales, riesgos específicos del sitio, necesidades de monitoreo puntuales |
Los eventos de StreamVLM entran en la misma canalización que cualquier otro evento. Funcionan con monitores de alarma, aparecen en la búsqueda de eventos y llegan al terreno a través de Sover.
Rendición de cuentas
Un detector que cualquiera puede definir en una frase necesita la misma supervisión que uno que tomó un año entrenar, y se rige por los mismos mecanismos:
- Los textos quedan registrados. Crear, editar y activar un detector son acciones registradas, atribuidas al operador que las realizó. Por eso siempre es posible reconstruir qué se le pidió al sistema que buscara.
- Los eventos son auditables. Toda alerta lleva su canal, marca de tiempo, confianza y el texto que la produjo, lo que hace revisable el comportamiento de un detector después de los hechos.
- Las búsquedas siguen exigiendo un Case ID. Recuperar eventos de StreamVLM del archivo es una búsqueda de eventos, de modo que las reglas de Case ID y rendición de cuentas se aplican sin cambios.
- Los permisos siguen aplicando. Quién puede crear textos, en qué cámaras, y quién puede ver los eventos resultantes, se rige por el control de acceso basado en roles.
- Los textos no amplían el alcance de la plataforma. Un texto describe una escena o una condición. No crea una nueva capacidad de identificación, y no puede usarse para reconocer o seguir a personas que no estén pre-registradas. Véase Ética de la IA.
Temas relacionados
- Administrar la analítica de video: configurar la analítica en una cámara.
- Ask IREX: la contraparte en lenguaje natural del lado de la búsqueda.
- Requisitos del sistema: dimensionamiento, incluyendo nodos GPU.
- Novedades: el estado actual por versión.