La próxima era de la competencia por las cámaras: la esencia de la carrera reside en su capacidad de comprensión.

La competencia en el mundo de las cámaras está cambiando: ahora se trata de comprender la escena y tomar fotos inteligentes con tecnología de IA, yendo más allá de las especificaciones técnicas.

Las cosas más importantes que necesitas saber

  • La función del sensor cambia: pasa de capturar imágenes bellas para el ojo humano a proporcionar señales nítidas que pueden ser procesadas por la máquina, convirtiéndose así en una herramienta de percepción esencial.
  • El cuello de botella en el procesamiento de IA en tiempo real se está desplazando hacia el sensor, lo que impulsa la búsqueda de soluciones como el procesamiento en chip, los sensores basados ​​en eventos, los obturadores universales y las tecnologías HDR modificadas para mejorar la legibilidad de las máquinas.
  • La próxima competición en el sector de las cámaras girará en torno al sistema integrado que incluye el sensor, el procesamiento de imágenes y la computación periférica, con especial énfasis en la "calidad de inferencia" como prioridad estratégica que va más allá de la tradicional "calidad de imagen".

La demostración que me convenció tuvo lugar en una galería de arte que yo mismo construí.

No pudimos proporcionar un equipo de guías, así que desarrollé un proyecto paralelo para reemplazarlos. No había ningún campo de texto ni nada que escribir. Simplemente apuntabas con el teléfono a algo y te decía qué estabas viendo. Luego terminó la exposición, pero la gente siguió usándolo.

Lo dirigieron hacia los edificios, las flores, los juguetes de sus hijos, los carteles en la calle, y nada de eso tenía que ver con la exposición.

Sin que nadie se lo pidiera, decidieron que la cámara debía ser capaz de explicarles el mundo.

Ahora es responsabilidad de la industria cumplir con esta expectativa, y esto ocurre en un momento en que la inteligencia artificial está pasando de ser un problema de entrenamiento a un problema de inferencia, donde la mayor parte del trabajo real se realiza en el propio dispositivo mientras alguien apunta su teléfono a un mundo real que no coopera.

Una modelo necesita cosas distintas de un encuadre que el ojo humano: bordes en los que apoyarse y estructura que recuperar cuando la imagen está llena de reflejos o borrosa. Los colores y el contraste que hacen que una foto se vea bien, para una modelo, suelen ser un obstáculo.

El sensor que se necesita para un observador humano y el sensor que se necesita para un modelo requieren diseños diferentes.

El sensor se ha convertido en un problema de percepción, y quienes construyen sistemas de visión en tiempo real ahora están preocupados por él de la misma manera que lo estaban los fotógrafos en el pasado.

¿De dónde salió el sensor?

El sensor CMOS de píxeles activos, inventado por Eric Fossum y desarrollado a principios de la década de 1990, es la razón por la que hoy en día casi todos llevamos una cámara de buena calidad en el bolsillo.

Su trabajo posterior toma un rumbo completamente diferente: el sensor de imagen cuántico, que cuenta fotones individuales. Esta trayectoria ilustra lo que está sucediendo actualmente con la inteligencia artificial: está pasando de capturar una imagen que le guste a una persona a capturar la señal más nítida para que la máquina la procese.

El sensor se convierte en una herramienta de percepción, y la fotografía es solo uno de sus usos.

¿Por qué el razonamiento cambia la naturaleza del trabajo?

La inferencia es lo que hace que el problema sea urgente. Anteriormente, cuando la IA se centraba principalmente en el entrenamiento, el papel de la cámara era indirecto: generaba datos para ser categorizados y analizados posteriormente, a un ritmo pausado. La inferencia no es lenta. Se produce en tiempo real, en un dispositivo con recursos limitados y que ya se calienta, como ocurre con las aplicaciones de IA que requieren una respuesta rápida.

Cuando un sistema tiene que reconocer algo mientras la cámara todavía lo apunta y responder antes de que sea demasiado tarde, el eslabón más débil es el que llega hasta el modelo, y este establece el límite de todo lo que el producto puede hacer.

Parte de la industria sigue apostando por lo incorrecto. Se asume que un modelo suficientemente grande limpiará cualquier cosa que la cámara le envíe. He visto cómo esto ha retrasado los planes de desarrollo de productos durante dos años consecutivos, y no creo que se sostenga ante las leyes de la física.

Ningún modelo de tamaño puede restaurar detalles ya destruidos por el desenfoque de movimiento o los reflejos, ni aquellos descartados por un procesamiento que prioriza la belleza antes incluso de que el modelo vea el fotograma. El cuello de botella ahora se desplaza hacia arriba, hacia el sensor y lo que se encuentra entre este y el modelo.

¿Qué hacen realmente estos dispositivos?

Algunos sensores ahora procesan parte de la información en el propio chip, por lo que los cálculos iniciales se realizan antes de que los datos salgan de la matriz de píxeles. Los sensores basados ​​en eventos, a veces llamados neuromórficos, solo registran las partes cambiantes de la escena, lo que resulta mucho más adecuado para la percepción en tiempo real que la transmisión de fotogramas completos. Los obturadores globales también ayudan a reducir las distorsiones por movimiento que pueden afectar las lecturas de la máquina.

Incluso el alto rango dinámico (HDR), diseñado desde hace tiempo para recrear el cielo de forma espectacular, ahora se está recalibrando para que coincida con lo que el modelo puede leer con claridad en alto contraste. A pesar de sus diferencias, todas estas tecnologías apuntan en la misma dirección: hacia una versión del mundo que el modelo pueda procesar.

Desde la identificación hasta la conclusión

Lo más intuitivo de crear es la búsqueda visual: apuntas la cámara a un objeto y obtiene una etiqueta. Pero cuando apuntas tu teléfono a un menú, lo que buscas es ayuda para decidir qué comer; al apuntarlo a un cartel, un paso útil podría ser guardar el evento en tu calendario. El reconocimiento de objetos es solo el punto de partida. La esencia del producto reside en saber qué debería suceder a continuación. Aquí es donde el sensor se convierte en el primer eslabón de una cadena de interpretación más larga, que va más allá de la simple captura de información.

Nunca tuve la intención de crear una cámara; empezó como una forma económica de evitar contratar guías para una sola exposición. Pero este pequeño proyecto me enseñó que ese instinto ya estaba ahí. El próximo reto en el mundo de la fotografía girará en torno al sistema completo: el sensor, el procesamiento de la imagen, la computación periférica , el formato del modelo y, en definitiva, la función del sistema.

Los fabricantes de hardware han dedicado años a mejorar la calidad de imagen, y ahora deberán tomarse la calidad de la inferencia con la misma seriedad. Los desarrolladores de software no pueden considerar la captura como un problema ajeno: la forma en que se captura y enruta una señal determina el resultado mucho antes de que el usuario lo perciba. Las antiguas fronteras entre hardware y software pierden importancia a medida que profundizamos en la percepción en tiempo real.

Todavía hay espacio para las startups. Su ventaja radica en la rapidez de identificación: formulan el problema antes de que los grandes actores terminen de debatir sobre él. La propia capacidad del modelo general se está volviendo más difícil de defender. La pregunta es: ¿qué sucederá cuando un solo sistema pueda prever, anticiparse y actuar sobre el mismo evento? ¿Quién llegará primero con un producto completamente funcional?

Ojos humanos contra mentes de máquina

Apuesto a que en los próximos años las empresas se dividirán en dos bandos: las que optimizan el rendimiento para la vista humana y las que lo optimizan para lo que la máquina debe leer. En un teléfono de gama alta, estos objetivos aún se superponen lo suficiente como para que la diferencia resulte difusa.

Pero, como estrategia, estos objetivos ya han comenzado a divergir. La posición más sostenible será la de quien logre transformar el caótico mundo real en la señal más nítida que la máquina pueda interpretar.

Esto comienza con el sensor.

Hemos analizado, evaluado y clasificado los mejores teléfonos con cámara.

Los comentarios están cerrados.