Una cámara instalada en una línea de producción puede generar imágenes de forma continua y necesitar una respuesta inmediata cuando detecta una pieza defectuosa. Si cada imagen debe viajar hasta un servidor remoto antes de ser analizada, la decisión dependerá de la conexión, del ancho de banda disponible y del tiempo de respuesta de la infraestructura externa. Edge AI traslada parte de ese procesamiento al propio equipo o a un dispositivo cercano.
Este enfoque es posible gracias a semiconductores capaces de ejecutar modelos de inteligencia artificial dentro de cámaras, robots, sensores, vehículos, controladores industriales y otros sistemas embebidos. Para diseñar una solución viable deben evaluarse conjuntamente la arquitectura de procesamiento, la memoria, la latencia total, el consumo energético, la temperatura y las herramientas disponibles para convertir, desplegar y actualizar el modelo.
Respalda la formación en tecnologías emergentes
Las organizaciones e instructores imparten la formación técnica. El Instituto Internacional de Ingeniería (3i) les permite respaldar las competencias desarrolladas por sus alumnos mediante credenciales verificables.
Qué es Edge AI
Edge AI consiste en ejecutar inferencias u otras tareas de inteligencia artificial cerca del lugar donde se originan los datos. El procesamiento puede ocurrir dentro del sensor, en un microcontrolador, en una computadora embebida o en una puerta de enlace conectada a varios equipos. La ubicación depende de la capacidad del hardware, del volumen de datos y del tiempo máximo disponible para responder.
En un esquema basado principalmente en la nube, el dispositivo captura información, la transmite y espera una respuesta del servidor. En el borde, una parte del análisis se ejecuta localmente. Esto puede reducir el envío de datos sin procesar y permitir que ciertas funciones continúen cuando la conectividad es inestable. La nube sigue siendo útil para entrenar modelos, almacenar registros, coordinar equipos o distribuir actualizaciones.
TinyML representa una categoría especialmente restringida de Edge AI, enfocada en modelos que funcionan en microcontroladores con memoria, capacidad de cálculo y energía limitadas. Una revisión sistemática sobre TinyML describe la necesidad de coordinar algoritmos compactos, herramientas de implementación y plataformas embebidas para procesar datos cerca de los sensores.
Arquitecturas de procesamiento
Los semiconductores para Edge AI pueden integrar varias unidades de procesamiento. Cada una ejecuta de forma distinta las operaciones del modelo, por lo que la arquitectura debe evaluarse junto con el software, el compilador y las bibliotecas disponibles.
Una NPU no admite automáticamente cualquier red neuronal. Si un operador no está soportado, esa parte del modelo puede ejecutarse en la CPU, aumentando el movimiento de datos y la latencia. La publicación de Arm Getting started with PyTorch, ExecuTorch, and Ethos-U85 in three easy steps describe este mecanismo de ejecución alternativa y muestra por qué debe comprobarse la compatibilidad del modelo antes de seleccionar el acelerador.
Memoria, latencia y consumo
La capacidad teórica de cálculo es solo una parte del rendimiento. Los parámetros del modelo, las activaciones intermedias y los datos de entrada deben almacenarse y trasladarse entre memoria y procesador. Cuando el ancho de banda es insuficiente, el acelerador puede permanecer esperando información. Dos chips con valores de TOPS similares pueden ofrecer resultados distintos al ejecutar la misma carga.
La cuantización representa pesos y activaciones mediante formatos numéricos de menor precisión. Puede reducir el tamaño del modelo, el uso de memoria y el movimiento de datos. La mejora de rendimiento depende de que el hardware, el compilador y las bibliotecas ejecuten eficientemente el formato cuantizado. La documentación de cuantización posterior al entrenamiento de LiteRT indica que la precisión del modelo cuantizado debe verificarse y que los operadores no compatibles pueden permanecer en coma flotante.
La latencia total tampoco equivale únicamente al tiempo de inferencia. Puede incluir captura de la señal, preprocesamiento, transferencia a la memoria del acelerador, ejecución del modelo, posprocesamiento y comunicación con otros subsistemas. Un modelo rápido puede formar parte de un sistema lento si la adquisición de imágenes, la copia de datos o el control posterior consumen la mayor parte del tiempo disponible.
El consumo debe medirse bajo el perfil real de trabajo. Un sensor puede permanecer inactivo y ejecutar inferencias breves, mientras una cámara procesa imágenes continuamente. En este último caso, la potencia sostenida y la disipación térmica pueden reducir la frecuencia del procesador. Plataformas como NVIDIA JetPack reúnen controladores, bibliotecas y herramientas para analizar y optimizar aplicaciones Edge AI sobre el hardware objetivo.
Aplicaciones profesionales
En inspección industrial, una cámara puede clasificar piezas o localizar anomalías y transmitir resultados, imágenes seleccionadas o alertas, en lugar de enviar todo el flujo de video. El resultado depende de que la iluminación, el enfoque, la velocidad de la línea y los datos utilizados para desarrollar el modelo representen las condiciones reales de producción.
En mantenimiento, sensores de vibración, sonido o corriente pueden extraer características y ejecutar una clasificación cerca de la máquina. En robótica, el procesamiento local puede combinar imágenes, distancias y movimiento para alimentar el sistema de control. Los comandos de voz, la detección de presencia y el monitoreo ambiental también pueden ejecutarse en microcontroladores cuando el modelo y las entradas son suficientemente compactos.
La guía oficial de LiteRT para microcontroladores presenta un flujo que separa el entrenamiento y la conversión del modelo de la inferencia ejecutada en el dispositivo. Esta distinción permite preparar el modelo en una plataforma con más recursos y desplegar únicamente los componentes necesarios en el sistema embebido.
Cómo seleccionar el hardware
La selección no debe basarse únicamente en TOPS, frecuencia, número de núcleos o capacidad teórica. Primero se define el modelo, los operadores utilizados, el tipo de entrada y la latencia total permitida. Después se revisan memoria, ancho de banda, consumo, temperatura, interfaces, herramientas, disponibilidad, ciclo de vida y mecanismo de actualización.
Una cámara que analiza video puede necesitar una NPU o GPU, memoria externa y una canalización de imagen. Un sensor alimentado por batería puede priorizar un microcontrolador que despierte periódicamente, procese una ventana de datos y vuelva a un estado de bajo consumo. Ambos ejecutan inteligencia artificial en el borde, pero sus restricciones térmicas, energéticas y temporales son diferentes.
La evaluación final debe realizarse con el modelo convertido, los datos representativos y la versión concreta del entorno de desarrollo. También conviene comprobar cuánto tiempo requiere actualizar el software, qué ocurre si una operación vuelve a la CPU y si el fabricante mantendrá herramientas y componentes durante la vida prevista del producto.
Riesgos y limitaciones
La implementación puede quedar condicionada por herramientas propietarias, operadores incompatibles, memoria insuficiente o dificultad para actualizar equipos desplegados. La cuantización, la poda y otras optimizaciones modifican el modelo, por lo que deben evaluarse nuevamente con el conjunto de datos y los criterios de aceptación del proyecto.
El procesamiento local puede reducir la transmisión de imágenes, audio o señales sin procesar, pero no garantiza privacidad ni seguridad. Deben revisarse el almacenamiento local, los registros, las comunicaciones, los controles de acceso, las actualizaciones y la protección del firmware y del modelo. Un dispositivo comprometido puede exponer información aunque no dependa continuamente de la nube.
En automatización, sistemas críticos y entornos operativos exigentes, las pruebas deben incluir pérdida de conectividad, variaciones de temperatura, entradas diferentes de las utilizadas durante el entrenamiento y fallos de sensores. La salida del modelo debe integrarse con reglas de control y mecanismos de respuesta acordes con el nivel de riesgo de la aplicación.
Conclusión
Los semiconductores hacen viable Edge AI al combinar procesamiento general, aceleración especializada, memoria e interfaces dentro de plataformas que pueden operar cerca de los sensores. La elección del hardware depende del sistema completo: las especificaciones comerciales orientan la comparación, pero no sustituyen las pruebas con el modelo, los datos, la latencia y las condiciones reales de funcionamiento.
Documenta los logros de tus alumnos
Las organizaciones que imparten programas en semiconductores, sistemas embebidos, automatización e inteligencia artificial pueden emitir credenciales verificables para documentar los logros alcanzados por sus alumnos.
Fuentes consultadas
Schizas, Nikolaos; Karras, Aristeidis; Karras, Christos; y Sioutas, Spyros. TinyML for Ultra-Low Power AI and Large Scale IoT Deployments: A Systematic Review. 2022.
Google for Developers. Get started with microcontrollers. s. f.
Google for Developers. Post-training quantization. s. f.
Arm. Getting started with PyTorch, ExecuTorch, and Ethos-U85 in three easy steps. 2024.
NVIDIA. NVIDIA JetPack. s. f.