Resumen
Implementar el control de calidad mediante IA en la planta de producción es más complejo que entrenar un modelo: requiere conjuntos de datos personalizados, una selección cuidadosa del hardware y una infraestructura periférica robusta. El módulo SOM ConnectCore 95 de Digi International, junto con los servicios en la nub Digi ConnectCore , ofrece una plataforma completa para la inspección mediante visión artificial: desde la inferencia acelerada por NPU y el empaquetado de modelos en contenedores hasta las actualizaciones inalámbricas, la supervisión remota y un ciclo de mejora continua que mantiene la precisión de los modelos a medida que cambian las condiciones del mundo real.
Los fabricantes se ven presionados para detectar los defectos con mayor rapidez, reducir los residuos y mantener las líneas de producción en marcha sin aumentar la plantilla. El software de control de calidad basado en la inteligencia artificial para el sector manufacturero se ha convertido en la respuesta más práctica a esa presión. Sin embargo, conseguir que funcione de forma fiable en la planta de producción es más difícil de lo que la mayoría de los equipos esperan.
El reto no consiste en crear un modelo que detecte defectos. La mayoría de los equipos pueden hacerlo en un entorno controlado. El reto consiste en implementar ese modelo en hardware integrado en el borde de la red, mantener su precisión a medida que cambian las condiciones de producción y gestionarlo en toda una flota de dispositivos repartidos por múltiples instalaciones sin que haya un científico de datos presente en cada una de ellas.
Un seminario web reciente de Digi International, titulado«Cerrar la brecha de la IA en el borde: del entrenamiento de modelos a la implementación en el mundo real», abordó este problema de principio a fin. La sesión, presentada en colaboración con RBZ Robot Design, utilizó un sistema de inspección visual automatizado en tiempo real que funciona en una panadería de Valencia (España) para mostrar todas las fases del proceso de implementación, desde la recopilación de datos hasta las actualizaciones de modelos OTA sobre el terreno. En esta entrada se revelan las lecciones clave y se aplican a las implementaciones de control de calidad industrial.
Principales conclusiones:
- Para alcanzar el umbral de precisión superior al 95 % que exige el control de calidad en la fabricación, es necesario disponer de un conjunto de datos personalizado creado a partir de tu propio entorno de producción, y no de imágenes genéricas de código abierto.
- El marco de entrenamiento que elijas debe estar determinado por el acelerador en el que tengas previsto ejecutar la inferencia. Cambiar de marco a mitad del proyecto resulta costoso.
- La cuantificación reduce el tamaño del modelo aproximadamente cuatro veces y acelera considerablemente la inferencia, pero conlleva una pérdida de precisión de entre el 5 % y el 10 %. El entrenamiento adaptado a la cuantificación es la forma más eficaz de gestionarla.
- El rendimiento de la inferencia varía considerablemente según el nivel de hardware. La NPU interna de l Digi ConnectCore e 95 ofrece una inferencia aproximadamente 27 veces más rápida que la CPU, mientras que el acelerador externo RBZ ARA240 reduce ese tiempo a menos de 2 milisegundos.
- La contenedorización permite que las implementaciones de IA en el borde sean portátiles, estén controladas por versiones y se puedan actualizar sin necesidad de intervenir en la capa de aplicación superior.
- Digi ConnectCore Los servicios en la nube ofrecen actualizaciones de modelos OTA, supervisión remota y un ciclo de mejora continua que se adapta tanto a un solo dispositivo como a miles de ellos.
- El Digi ConnectCore 95 está diseñado con una vía de actualización integrada. Pasar de la NPU interna a un acelerador externo requiere una actualización del contenedor, no una sustitución del hardware.
Lo que realmente requieren los sistemas de control de calidad basados en la inteligencia artificial en el sector manufacturero
El control de calidad en la fabricación basado en la inteligencia artificial se apoya en la visión artificial: las cámaras supervisan la línea de producción y un modelo entrenado analiza cada fotograma para clasificar los productos y señalar los defectos. Parece sencillo. En la práctica, requiere una combinación perfectamente coordinada de hardware, software e infraestructura operativa.
Los sistemas tradicionales de inspección automatizada solían basarse en la computación mediante ordenadores personales. Ese enfoque funciona, pero resulta caro por unidad y es difícil de mantener y ampliar. La IA periférica integrada cambia la ecuación económica. La inferencia se ejecuta localmente en un dispositivo integrado con circuitos integrados dedicados a la IA. El sistema es físicamente compacto y está diseñado para uso industrial.
El módulo SOM «Digi ConnectCore 95» está diseñado precisamente para este caso de uso. Basado en el procesador i.MX 95 de NXP, el « Digi ConnectCore 95» ofrece todo lo que un fabricante de equipos originales (OEM) necesita para crear un sistema de inspección por visión artificial listo para la producción, incluyendo núcleos Cortex-A55 de alto rendimiento, una unidad de procesamiento neuronal (NPU) integrada, un procesador de señal de imagen (ISP) y compatibilidad con hasta ocho entradas de cámara. Un bus PCIe permite además conectar aceleradores de redes neuronales externos para aplicaciones que requieran un mayor rendimiento de IA, tal y como se ha demostrado en la implementación de inspección de productos de panadería con el módulo RBZ ARA240.
El flujo de trabajo completo de desarrollo del control de calidad basado en IA
Comprender el flujo de trabajo completo es esencial para los equipos que planifican su primera implementación de IA en el borde. Los siguientes pasos reflejan el proceso real utilizado en el proyecto de la panadería de RBZ Robot Design. A grandes rasgos, también son aplicables a otras implementaciones de sistemas de control de calidad basados en IA en el sector manufacturero.
1. Recopilación y anotación de datos
En esta fase es donde la mayoría de los proyectos subestiman el esfuerzo necesario. Los conjuntos de datos de imágenes de código abierto pueden generar modelos que alcanzan una precisión del 75 al 80 %, pero el control de calidad en la fabricación suele exigir un 95 % o más. Alcanzar ese umbral implica crear un conjunto de datos a medida que refleje el entorno de producción real: tus productos, tu iluminación y tus tipos de defectos.
El proyecto de la panadería tardó varios meses en recopilar datos útiles. La panadería elabora diferentes tipos de pan en días distintos en función de la demanda, por lo que el conjunto de datos tenía que abarcar una amplia gama de productos y condiciones. Para ello, fueron necesarias semanas de grabación continua en vídeo in situ, seguidas de la extracción de fotogramas y el etiquetado manual en colaboración con el personal de la panadería, que podía identificar qué constituía realmente un defecto.
La lección práctica: la recopilación de datos debe comenzar antes de lo que parezca necesario, y los equipos deben planificar desde el primer día que el conjunto de datos evolucione a medida que los dispositivos sobre el terreno pongan de manifiesto nuevos casos extremos.

2. Selección del marco de formación
El marco utilizado para entrenar el modelo debe elegirse en función del entorno en el que se vaya a ejecutar finalmente. Si el acelerador de destino requiere TensorFlow Lite, entrenar en TensorFlow desde el principio evita tener que realizar una conversión complicada más adelante. Los aceleradores que admiten ONNX o PyTorch ofrecen otras opciones.
Para el sistema de inspección de panadería, RBZ Robot Design eligió PyTorch y ONNX porque permitían aprovechar tanto la CPU como el acelerador externo ARA240. Se creó un modelo independiente de TensorFlow para validarlo con la NPU interna de l Digi ConnectCore e 95. La elección del marco de trabajo determinó todos los pasos posteriores, y dar marcha atrás a mitad del proyecto resultaría muy costoso.
3. Formación sobre modelos en la nube
El entrenamiento en la nube basado en GPU suele generar un modelo de punto flotante. Este paso es la parte más conocida del proceso para la mayoría de los equipos de IA, pero una tarea que se suele pasar por alto es el registro de puntos de control. Cada sesión de entrenamiento, incluidos sus hiperparámetros y resultados, debería registrarse y almacenarse. Cuando un modelo empieza a desviarse en el entorno real seis meses después de su implementación, la capacidad de rastrear el problema hasta un estado de entrenamiento específico resulta inestimable.
4. Optimización de modelos para la inferencia en el borde
Este es el paso que distingue la IA en el borde de la IA en la nube. Los modelos que se ejecutan en una NPU integrada deben cuantificarse, pasando de una representación en coma flotante de 32 bits a una representación en números enteros de 8 bits. Las ventajas son significativas: una reducción de aproximadamente cuatro veces en el tamaño del modelo, menores requisitos de ancho de banda de memoria y una inferencia más rápida. Sin embargo, la cuantificación conlleva una pérdida de precisión de entre el 5 % y el 10 %, y en ocasiones incluso mayor.
La forma más eficaz de gestionar esa pérdida es el entrenamiento sensible a la cuantificación, que modifica el propio proceso de entrenamiento para tener en cuenta la reducción de precisión que se producirá en el momento de la inferencia. Para el NXP i.MX 95 y la plataforma «Digi ConnectCore » 95, el marco de software eIQ de NXP proporciona la cadena de herramientas completa: cuantificación, recuperación de la precisión e implementación de la inferencia en los tres niveles de computación.
Un principio de arquitectura que se cumplió en el proyecto de la panadería: los modelos más pequeños se cuantifican con mayor precisión que los más grandes. Dividir una tarea compleja en dos modelos más ligeros —por ejemplo, uno para la localización y otro para la clasificación— puede resultar más fácil de optimizar para el dispositivo periférico que crear un único modelo que se encargue de ambas funciones.
5. Envases
Una vez optimizado el modelo, se empaqueta en un contenedor junto con su entorno de ejecución de inferencia, sus dependencias y su configuración. La contenedorización es ahora una práctica habitual en la IA de borde en producción. El contenedor es portátil, está versionado y es reproducible. Además, desacopla la capa de aplicación de la capa de inferencia: si el acelerador de destino cambia de la NPU interna al ARA240, un cambio de contenedor se encarga de la transición sin afectar a la aplicación que se ejecuta por encima de él.
Digi ConnectCore Los servicios en la nube son compatibles con los formatos de contenedores LXC, Docker y Podman. El contenedor empaquetado se envía al repositorio en la nube, donde se convierte en el artefacto que se implementa, supervisa y actualiza en toda la flota de dispositivos sobre el terreno.
Cómo elegir el hardware de inferencia adecuado
Una conclusión importante de la demostración de inspección de la panadería fue lo mucho que varía el rendimiento de la inferencia entre los distintos niveles de hardware de inferencia y cómo la elección adecuada depende de la aplicación o del caso de uso. Las siguientes figuras proceden de la demostración en directo, en la que se utilizó el mismo modelo en las tres configuraciones.
| Acelerador |
Tiempo de inferencia |
El más adecuado |
| CPU (NXP i.MX 95) |
1,6 segundos |
Creación de prototipos; modelos de gatillo de pequeño tamaño |
| NPU interna (NXP Neutron, 2 TOPS) |
60 milisegundos |
La mayoría de las aplicaciones de inspección industrial |
| NPU externa (RBZ ARA240, hasta 16 TOPS) |
1,8 milisegundos |
Implementaciones de alto rendimiento, multimodelo u orientadas al crecimiento |
La CPU es el punto de partida adecuado durante el desarrollo. Permite iterar rápidamente y no requiere ninguna optimización especial. La NPU interna de lDigi ConnectCore e 95 ofrece una mejora de aproximadamente 27 veces con respecto a la CPU, lo cual es suficiente para muchos casos de uso de inspección de calidad automatizada. El RBZ ARA240 ofrece hasta 40 TOPS con 16 GB de RAM dedicada a través de PCIe, y es capaz de admitir grandes modelos de lenguaje además de cargas de trabajo de visión. Se trata de un factor importante a tener en cuenta para los equipos que trabajan en el desarrollo de sistemas de fabricación autónomos.
La precisión se mantuvo constante en las tres configuraciones de la demostración de panadería. El método de cuantificación ofreció resultados uniformes tanto si se ejecutaba en la CPU, en la NPU interna o en el ARA240. La capa de aplicación no tenía conocimiento de qué acelerador se estaba utilizando.
Una vía de implementación práctica: suministrar los dispositivos iniciales con la NPU interna, con la ranura ARA240 disponible en el hardware basado en la Digi ConnectCore 95. Cuando aumentan los requisitos de IA —por ejemplo, con más modelos, modelos más grandes y un mayor rendimiento—, la implementación del acelerador externo requiere una actualización del contenedor en lugar de una sustitución completa del hardware.
Gestión de flotas con los servicios en la nub Digi ConnectCore
La implantación de un único sistema de inspección por visión artificial es factible mediante procesos manuales. Sin embargo, la implantación de cincuenta sistemas en varias instalaciones, con modelos que deben mantenerse actualizados a medida que evolucionan los productos y los defectos, requiere una infraestructura operativa adecuada.
Digi ConnectCore Los servicios en la nube proporcionan la infraestructura de MLOps necesaria para implementaciones de IA en el borde a escala de producción. Entre sus capacidades clave se incluyen las siguientes.
Actualizaciones de contenedores por aire (OTA). Las nuevas versiones de los modelos se pueden enviar a dispositivos individuales, a grupos de dispositivos o a toda la flota. Los despliegues por fases permiten a los equipos validar un nuevo modelo en un grupo piloto antes de implementarlo de forma generalizada. Esto también cumple con los requisitos de actualizaciones de software y de seguridad OTA que ahora se incluyen en las normativas de ciberseguridad, incluida la Ley de Ciberresiliencia de la UE.
Supervisión remota y observabilidad. Cada módulo SOM de «Digi ConnectCore 95» desplegado envía datos de telemetría operativa al panel de control en la nube: carga de la CPU, uso de la RAM, E/S de red y métricas de la aplicación. En la demostración de la panadería, el panel de control mostraba los fotogramas por segundo, el tiempo de inferencia por dispositivo, el total de escaneos y las tasas de detección de defectos, todo ello accesible de forma remota. No se requiere la visita de ningún técnico.
Ciclo de mejora continua. Cuando un modelo empieza a desviarse en el campo —la precisión disminuye, aparecen nuevos tipos de defectos, cambian las condiciones ambientales—, los dispositivos pueden configurarse para enviar datos operativos a la nube. Esos datos se incorporan al proceso de entrenamiento, se entrena y se empaqueta un nuevo modelo, y el contenedor actualizado se envía a la flota. Este ciclo puede ejecutarse de forma idéntica tanto si la flota cuenta con un solo dispositivo como si tiene miles.
Plantillas de cumplimiento. El panel de control incluye una función de plantillas que define las versiones mínimas de firmware y de modelo. Los dispositivos comprueban la plantilla cuando se conectan a la red y se actualizan automáticamente si no cumplen los requisitos. Esto resulta especialmente útil para los dispositivos que hayan estado desconectados durante largos periodos de tiempo y garantiza que todos los dispositivos cumplan con los requisitos.
Seguridad para las implementaciones de IA industrial
Los entornos de control de calidad industrial exigen que solo se ejecuten cargas de trabajo verificadas y firmadas en el hardware de producción. La presencia de código no autorizado en un dispositivo que controle o supervise una línea de producción no es un riesgo aceptable.
Digi TrustFence proporciona seguridad integrada en el hardware para « Digi ConnectCore » 95, lo que garantiza que solo se puedan ejecutar cargas de trabajo firmadas y verificadas. Los servicios en la nube «Digi ConnectCore » cuentan con la certificación SOC 2 Tipo 2, y todas las comunicaciones entre dispositivos y la nube utilizan autenticación basada en certificados y cifrado TLS. Estas funciones de seguridad se incluyen con cada módulo SOM de « Digi ConnectCore » 95 sin coste adicional.
Cómo empezar
Aquí tienes algunos recursos muy útiles para ponerte en marcha con tu proyecto de IA en el borde basado en IA y aprendizaje automático:
Preguntas frecuentes sobre las implementaciones de IA en el borde
¿Cuál es el umbral mínimo de precisión para el control de calidad mediante IA en el sector manufacturero y cómo puedo alcanzarlo?
La mayoría de las aplicaciones de control de calidad en el sector manufacturero requieren una precisión del 95 % o superior. Para alcanzar ese nivel, es necesario contar con un conjunto de datos personalizado creado a partir de su entorno de producción real, y no con conjuntos de datos de imágenes genéricos de código abierto, cuya precisión suele limitarse al 75-80 %. Esto implica recopilar datos in situ, que abarquen sus productos específicos, las condiciones de iluminación y los tipos de defectos, y etiquetarlos en colaboración con personal que comprenda qué constituye un defecto real.
¿Cuánto tiempo suele llevar la recopilación de datos en un proyecto de inspección con IA en el borde?
Lleva más tiempo de lo que la mayoría de los equipos esperan. La implantación en la panadería descrita en esta entrada requirió varios meses de recopilación de datos, incluidas semanas de grabación de vídeo continua in situ. El plazo se alargó debido a que la panadería elabora diferentes tipos de pan en días distintos, lo que exigió cubrir una amplia variedad de condiciones. Los equipos deberían comenzar a recopilar datos antes de lo que les parezca necesario y prever que el conjunto de datos crezca con el tiempo, a medida que los dispositivos implantados revelen nuevos casos extremos.
¿Cuánta precisión se pierde al optimizar un modelo para la inferencia en el borde?
La cuantificación de 32 bits en coma flotante a 8 bits en entero, necesaria para ejecutar modelos en una NPU integrada, suele suponer una pérdida de precisión de entre el 5 % y el 10 %, y en ocasiones incluso mayor. El entrenamiento que tiene en cuenta la cuantificación, que ajusta el proceso de entrenamiento para anticipar esa reducción de precisión, es la forma más eficaz de gestionar dicha pérdida. El proyecto de la panadería mantuvo una precisión constante en las tres configuraciones de hardware (CPU, NPU interna y NPU externa) utilizando este enfoque.
¿Cuáles son las diferencias en el rendimiento de inferencia entre la CPU, la NPU interna y la NPU externa del Digi ConnectCore 95?
Las diferencias son sustanciales. La ejecución en la CPU (NXP i.MX 95) tarda aproximadamente 1,6 segundos por inferencia, lo cual es adecuado para la creación de prototipos, pero demasiado lento para la mayoría de las líneas de inspección en producción. La NPU interna (NXP Neutron, 2 TOPS) reduce ese tiempo a unos 60 milisegundos, lo que supone una mejora de aproximadamente 27 veces, suficiente para la mayoría de los casos de uso de inspección industrial. La RBZ ARA240 externa (hasta 16 TOPS) reduce el tiempo de inferencia a aproximadamente 1,8 milisegundos, lo que resulta adecuado para implementaciones de alto rendimiento o con múltiples modelos.
¿Tengo que cambiar el hardware si mis necesidades de IA aumentan tras la implementación inicial?
N.º Digi ConnectCore e 95 está diseñado con una vía de actualización integrada. Los dispositivos iniciales pueden suministrarse con la NPU interna, dejando libre la ranura PCIe para el acelerador externo RBZ ARA240. Cuando aumentan los requisitos —por ejemplo, al añadir más modelos, modelos más grandes o un mayor rendimiento—, la implementación del acelerador externo solo requiere una actualización del contenedor, en lugar de una sustitución del hardware.
¿Qué marco de entrenamiento debería utilizar para un proyecto de IA en el borde?
El marco debe elegirse en función del acelerador en el que se vaya a ejecutar la inferencia. Si el hardware de destino requiere TensorFlow Lite, entrenar en TensorFlow desde el principio evita una conversión complicada más adelante. Para el proyecto de la panadería, RBZ Robot Design seleccionó PyTorch y ONNX para trabajar tanto con la CPU como con el acelerador ARA240, y se creó un modelo independiente en TensorFlow para validarlo con la NPU interna del « Digi ConnectCore '95». Cambiar de marco de trabajo a mitad del proyecto resulta costoso, por lo que la decisión debe tomarse con antelación.
¿Cómo se envían las actualizaciones de los modelos a los dispositivos sobre el terreno?
Digi ConnectCore Los servicios en la nube gestionan las actualizaciones de contenedores por aire (OTA). Las nuevas versiones de modelo se pueden enviar a dispositivos individuales, a grupos de dispositivos o a toda una flota. Los despliegues por fases permiten a los equipos validar un nuevo modelo en un grupo piloto antes de proceder a un despliegue más amplio. Los dispositivos también se pueden configurar con plantillas de cumplimiento que definen las versiones mínimas de firmware y de modelo, y se activan actualizaciones automáticas cuando un dispositivo se conecta a Internet y se detecta que no cumple con los requisitos.
¿Cómo funciona en la práctica el ciclo de mejora continua?
Cuando un modelo implementado empieza a desviarse —ya sea debido a nuevos tipos de defectos, cambios en el producto o condiciones ambientales variables—, los dispositivos envían datos operativos a la nube. Esos datos se incorporan al proceso de entrenamiento, se entrena un nuevo modelo y se empaqueta en un contenedor, y el contenedor actualizado se envía a la flota mediante una actualización OTA. Este ciclo funciona de la misma manera tanto si la flota cuenta con un solo dispositivo como si tiene miles.
¿Qué medidas de seguridad protegen las cargas de trabajo de IA que se ejecutan en « Digi ConnectCore n 95»?
Digi ConnectCore Fence ofrece seguridad integrada en el hardware, lo que garantiza que solo se puedan ejecutar en el dispositivo cargas de trabajo verificadas y firmadas. Cloud Services cuenta con la certificación SOC 2 Tipo 2, y todas las comunicaciones entre el dispositivo y la nube utilizan autenticación basada en certificados y cifrado TLS.
¿Por qué recomienda el blog dividir las tareas complejas en dos modelos más sencillos en lugar de en un único modelo más grande?
Los modelos más pequeños se cuantifican con mayor precisión que los más grandes. Un único modelo que se encargue tanto de la localización como de la clasificación puede resultar más difícil de optimizar para la inferencia en el borde sin que se produzca una pérdida significativa de precisión. Dividir la tarea en dos modelos más ligeros, uno para la localización y otro para la clasificación, suele producir mejores resultados de cuantificación y resulta más fácil de gestionar durante el proceso de optimización.