Sistema de control de calidad basado en IA para la fabricación: guía completa para la implementación de la IA en el borde

Resumen

Implementar el control de calidad mediante IA en la planta de producción es más complejo que entrenar un modelo: requiere conjuntos de datos personalizados, una selección cuidadosa del hardware y una infraestructura periférica robusta. El módulo SOM ConnectCore 95 de Digi International, junto con los servicios en la nub Digi ConnectCore , ofrece una plataforma completa para la inspección mediante visión artificial: desde la inferencia acelerada por NPU y el empaquetado de modelos en contenedores hasta las actualizaciones inalámbricas, la supervisión remota y un ciclo de mejora continua que mantiene la precisión de los modelos a medida que cambian las condiciones del mundo real.

Los fabricantes se ven presionados para detectar los defectos con mayor rapidez, reducir los residuos y mantener las líneas de producción en marcha sin aumentar la plantilla. El software de control de calidad basado en la inteligencia artificial para el sector manufacturero se ha convertido en la respuesta más práctica a esa presión. Sin embargo, conseguir que funcione de forma fiable en la planta de producción es más difícil de lo que la mayoría de los equipos esperan.

El reto no consiste en crear un modelo que detecte defectos. La mayoría de los equipos pueden hacerlo en un entorno controlado. El reto consiste en implementar ese modelo en hardware integrado en el borde de la red, mantener su precisión a medida que cambian las condiciones de producción y gestionarlo en toda una flota de dispositivos repartidos por múltiples instalaciones sin que haya un científico de datos presente en cada una de ellas.

Un seminario web reciente de Digi International, titulado«Cerrar la brecha de la IA en el borde: del entrenamiento de modelos a la implementación en el mundo real», abordó este problema de principio a fin. La sesión, presentada en colaboración con RBZ Robot Design, utilizó un sistema de inspección visual automatizado en tiempo real que funciona en una panadería de Valencia (España) para mostrar todas las fases del proceso de implementación, desde la recopilación de datos hasta las actualizaciones de modelos OTA sobre el terreno. En esta entrada se revelan las lecciones clave y se aplican a las implementaciones de control de calidad industrial.

Principales conclusiones:

  • Para alcanzar el umbral de precisión superior al 95 % que exige el control de calidad en la fabricación, es necesario disponer de un conjunto de datos personalizado creado a partir de tu propio entorno de producción, y no de imágenes genéricas de código abierto.
  • El marco de entrenamiento que elijas debe estar determinado por el acelerador en el que tengas previsto ejecutar la inferencia. Cambiar de marco a mitad del proyecto resulta costoso.
  • La cuantificación reduce el tamaño del modelo aproximadamente cuatro veces y acelera considerablemente la inferencia, pero conlleva una pérdida de precisión de entre el 5 % y el 10 %. El entrenamiento adaptado a la cuantificación es la forma más eficaz de gestionarla.
  • El rendimiento de la inferencia varía considerablemente según el nivel de hardware. La NPU interna de l Digi ConnectCore e 95 ofrece una inferencia aproximadamente 27 veces más rápida que la CPU, mientras que el acelerador externo RBZ ARA240 reduce ese tiempo a menos de 2 milisegundos.
  • La contenedorización permite que las implementaciones de IA en el borde sean portátiles, estén controladas por versiones y se puedan actualizar sin necesidad de intervenir en la capa de aplicación superior.
  • Digi ConnectCore Los servicios en la nube ofrecen actualizaciones de modelos OTA, supervisión remota y un ciclo de mejora continua que se adapta tanto a un solo dispositivo como a miles de ellos.
  • El Digi ConnectCore 95 está diseñado con una vía de actualización integrada. Pasar de la NPU interna a un acelerador externo requiere una actualización del contenedor, no una sustitución del hardware.

1. Recopilación y anotación de datos

En esta fase es donde la mayoría de los proyectos subestiman el esfuerzo necesario. Los conjuntos de datos de imágenes de código abierto pueden generar modelos que alcanzan una precisión del 75 al 80 %, pero el control de calidad en la fabricación suele exigir un 95 % o más. Alcanzar ese umbral implica crear un conjunto de datos a medida que refleje el entorno de producción real: tus productos, tu iluminación y tus tipos de defectos.

El proyecto de la panadería tardó varios meses en recopilar datos útiles. La panadería elabora diferentes tipos de pan en días distintos en función de la demanda, por lo que el conjunto de datos tenía que abarcar una amplia gama de productos y condiciones. Para ello, fueron necesarias semanas de grabación continua en vídeo in situ, seguidas de la extracción de fotogramas y el etiquetado manual en colaboración con el personal de la panadería, que podía identificar qué constituía realmente un defecto.

La lección práctica: la recopilación de datos debe comenzar antes de lo que parezca necesario, y los equipos deben planificar desde el primer día que el conjunto de datos evolucione a medida que los dispositivos sobre el terreno pongan de manifiesto nuevos casos extremos.

2. Selección del marco de formación

El marco utilizado para entrenar el modelo debe elegirse en función del entorno en el que se vaya a ejecutar finalmente. Si el acelerador de destino requiere TensorFlow Lite, entrenar en TensorFlow desde el principio evita tener que realizar una conversión complicada más adelante. Los aceleradores que admiten ONNX o PyTorch ofrecen otras opciones.

Para el sistema de inspección de panadería, RBZ Robot Design eligió PyTorch y ONNX porque permitían aprovechar tanto la CPU como el acelerador externo ARA240. Se creó un modelo independiente de TensorFlow para validarlo con la NPU interna de l Digi ConnectCore e 95. La elección del marco de trabajo determinó todos los pasos posteriores, y dar marcha atrás a mitad del proyecto resultaría muy costoso.

3. Formación sobre modelos en la nube

El entrenamiento en la nube basado en GPU suele generar un modelo de punto flotante. Este paso es la parte más conocida del proceso para la mayoría de los equipos de IA, pero una tarea que se suele pasar por alto es el registro de puntos de control. Cada sesión de entrenamiento, incluidos sus hiperparámetros y resultados, debería registrarse y almacenarse. Cuando un modelo empieza a desviarse en el entorno real seis meses después de su implementación, la capacidad de rastrear el problema hasta un estado de entrenamiento específico resulta inestimable.

4. Optimización de modelos para la inferencia en el borde

Este es el paso que distingue la IA en el borde de la IA en la nube. Los modelos que se ejecutan en una NPU integrada deben cuantificarse, pasando de una representación en coma flotante de 32 bits a una representación en números enteros de 8 bits. Las ventajas son significativas: una reducción de aproximadamente cuatro veces en el tamaño del modelo, menores requisitos de ancho de banda de memoria y una inferencia más rápida. Sin embargo, la cuantificación conlleva una pérdida de precisión de entre el 5 % y el 10 %, y en ocasiones incluso mayor.

La forma más eficaz de gestionar esa pérdida es el entrenamiento sensible a la cuantificación, que modifica el propio proceso de entrenamiento para tener en cuenta la reducción de precisión que se producirá en el momento de la inferencia. Para el NXP i.MX 95 y la plataforma «Digi ConnectCore » 95, el marco de software eIQ de NXP proporciona la cadena de herramientas completa: cuantificación, recuperación de la precisión e implementación de la inferencia en los tres niveles de computación.

Un principio de arquitectura que se cumplió en el proyecto de la panadería: los modelos más pequeños se cuantifican con mayor precisión que los más grandes. Dividir una tarea compleja en dos modelos más ligeros —por ejemplo, uno para la localización y otro para la clasificación— puede resultar más fácil de optimizar para el dispositivo periférico que crear un único modelo que se encargue de ambas funciones.

5. Envases

Una vez optimizado el modelo, se empaqueta en un contenedor junto con su entorno de ejecución de inferencia, sus dependencias y su configuración. La contenedorización es ahora una práctica habitual en la IA de borde en producción. El contenedor es portátil, está versionado y es reproducible. Además, desacopla la capa de aplicación de la capa de inferencia: si el acelerador de destino cambia de la NPU interna al ARA240, un cambio de contenedor se encarga de la transición sin afectar a la aplicación que se ejecuta por encima de él.

Digi ConnectCore Los servicios en la nube son compatibles con los formatos de contenedores LXC, Docker y Podman. El contenedor empaquetado se envía al repositorio en la nube, donde se convierte en el artefacto que se implementa, supervisa y actualiza en toda la flota de dispositivos sobre el terreno.

Descarga la ficha técnica
Más información sobre el módulo SMARC SOM « Digi ConnectCore » 95