Takafumi Horiuchi

Tesis de maestría sobre el diseño de interacción entre humanos y robots

Resumen

En un robot grande operado por una persona, es difícil distinguir solo con los sensores circundantes entre un movimiento hacia el objeto de trabajo y un movimiento hacia un obstáculo pasado por alto. Por lo tanto, diseñamos un sistema de evitación de colisiones que utiliza la zona que el operador está mirando como una pista de su intención de 'tocar', y desacelera o detiene el brazo al acercarse a objetos que no está mirando.

No es necesario registrar previamente los objetos como "manipulables" o "objetos protegidos". La distinción se actualiza según la línea de visión del operador durante la operación. Se implementó en un robot humanoide de construcción de 1,9 m de altura, y en cinco ensayos de demostración se confirmó que el comportamiento definido se cumplía. El funcionamiento real se puede ver en Video de demostración.

Como tesis de maestría en Diseño e Ingeniería en la Universidad Politécnica de Milán, se llevó a cabo durante una pasantía de investigación en Human-Machine Integration Inc., y se presentó en La 39ª Conferencia Anual de la Sociedad Japonesa de Robótica (RSJ2021).


  1. Diapositiva de título. Prevención de colisiones basada en la conciencia para la manipulación robótica controlada por humanos, Máster en Diseño e Ingeniería de la Universidad Politécnica de Milán, curso 2020–2021.
  2. Antecedentes. El tema de la tesis se decidió durante una pasantía de investigación en la empresa Corporation Human-Machine Integration, que desarrolla maquinaria pesada humanoide y la opera mediante un sistema maestro-esclavo.
  3. Comparación entre robots autónomos y robots operados por humanos. Los primeros trabajan de manera eficiente en un espacio diseñado dentro de una valla, mientras que los segundos trabajan junto a las personas en un espacio incierto.
  4. Estadísticas de Europa, Estados Unidos y Japón. Indican que el contacto con objetos en movimiento constituye una proporción considerable de los accidentes en los sitios de construcción.
  5. Investigaciones previas sobre la evitación de colisiones. Piel sensorial que cubre el manipulador y sensor de profundidad que recrea virtualmente el entorno.
  6. Problema actual. El sistema existente requiere definir de antemano si un objeto es
  7. Propuesta. Los sistemas tradicionales solo utilizan información de sensores pasivos, pero en los robots operados por humanos ya hay una persona dentro del bucle de control, y se puede usar su mirada como un parámetro activo.
  8. Reglas de clasificación. Los objetos dentro del campo visual central del operador son manipulables, mientras que los objetos fuera de él se convierten en objetos a proteger.
  9. Visión general del prototipo. Combina un robot físico con un espacio de cálculo virtual, y siguen tres elementos tecnológicos.
  10. Elemento ①. Representar el campo visual central como un cono de 60°×55° y aproximar su orientación hacia la dirección frontal del casco de realidad virtual.
  11. Elemento ②. El LIDAR colocado en la cabeza del robot escanea el entorno como una nube de puntos, y cada uno se representa como un voxel que tiene un colisionador.
  12. Elemento ③. El gemelo digital del robot se mueve igual que el robot real, y cuando su brazo toca un voxel que está fuera del campo de visión, se emite una advertencia de proximidad.
  13. Demostración de prueba de concepto. Imagen fija de un robot que extiende la mano hacia una pelota sobre un poste, y visualización de voxeles en un espacio virtual.
  14. Tareas futuras. Detección de personas dentro del espacio de trabajo, verificación de otros métodos para medir la dirección de la mirada, y evaluación cuantitativa en campo.
  15. Resumen de la conclusión. El tema de investigación, el valor del método, la novedad y cómo se verificó el sistema.

Desafío: la configuración previa para la seguridad limita el lugar de trabajo

Se necesitan robots controlados por humanos en lugares que no están preparados para robots autónomos. Lugares como obras de construcción o escenarios de desastre, donde la disposición de personas y equipo cambia y lo que se puede tocar varía según la tarea. Para usar la gran fuerza de la máquina, se debe poder tocar los objetos necesarios mientras se evita el contacto no intencionado.

En la evitación de colisiones existente, existen métodos como cubrir al robot con sensores de proximidad o reproducir el entorno en un espacio virtual mediante sensores de profundidad. Sin embargo, ambos requieren clasificar previamente los objetos como 'manipulables' o 'objetos a proteger'. Si no se registra nada, por seguridad no se puede tocar nada, y para registrar todo se necesitan configuraciones y calibraciones específicas del lugar. Esta carga de preparación reducía la practicidad de los robots que se usan moviéndose de un lugar a otro.

Idea: cambiar la mirada a una 'condición que se puede tocar'

En el bucle de control de un robot operado por humanos, ya hay una persona que juzga la situación. Si se pudiera transmitir a la máquina hacia dónde dirige su atención la persona, pensé que sería posible estimar la intención de contacto durante el trabajo en lugar de registrar los objetivos de antemano.

Entonces, se utiliza el campo visual central del operador como límite. Los objetos dentro del campo visual se consideran "objetos operables" que el operador está comprendiendo. Los objetos fuera del campo visual se consideran "objetos a proteger" que podrían ser pasados por alto. Las personas, sin importar la posición de la mirada, siempre se consideran objetos a proteger.

Este no es un sistema para enviar órdenes al robot con la mirada. Es un sistema que convierte el estado cognitivo del operador en condiciones en las que el robot puede moverse.

Vista desde arriba. Frente al robot, el campo de visión central del operador está representado como un cono. El objeto A, que se encuentra dentro del cono, se muestra como un círculo blanco, mientras que los objetos B, C y D, que están fuera, se indican con cuadrados oscuros, y dos personas están de pie dentro y fuera del cono.
El objeto A que se encuentra dentro del campo visual central del operador puede ser manipulado, mientras que los objetos B, C y D que se encuentran en el exterior se consideran objetos a proteger. Las personas están protegidas sin importar dónde se encuentren.

Diseño de interacción

El sistema no convierte la posición de la mirada en un simple interruptor de encendido y apagado. Cuando el brazo se acerca a un objeto que no se está mirando, reduce la velocidad gradualmente según la distancia y se detiene antes de entrar en contacto. Después de detenerse, si el operador dirige su mirada hacia el objeto, las restricciones se levantan gradualmente. Se evita el comportamiento de detenerse o moverse de repente, para que el operador pueda prever los cambios.

Por otro lado, incluso si se aparta temporalmente la vista del objeto que ya se ha tocado, el trabajo en curso no se detiene. Esto se debe a que si la sujeción o la operación se interrumpen solo al apartar la vista, se vuelve más inestable. Solo el acercamiento a las personas se trata de manera diferente, limitándose independientemente de que el operador esté mirando o no.

El objetivo no era ralentizar uniformemente las operaciones por seguridad. Se trata de mantener la capacidad del robot dentro del alcance que el operador puede controlar y proteger únicamente el área que no puede supervisar, logrando así un equilibrio entre seguridad y operatividad.

Un diagrama de flujo que comienza desde un estado de movimiento libre. Se ramifica según si el objeto está cerca, si es una persona, si el manipulador está en dirección a acercarse a la persona o si el objeto está en el área de atención, y conduce a movimientos precisos, parada gradual o bloqueo.
El único nodo que lee los parámetros activos del operador durante el proceso de juicio es 'si el objeto está en la zona de atención'. Todas las demás ramificaciones funcionan con información sensorial pasiva.

Escenarios de uso previstos

El objetivo fueron lugares como sitios de construcción o lugares de desastre, donde se manejan grandes fuerzas cerca de las personas. En estos lugares, es difícil separar completamente el área con cercas o registrar todos los objetos de antemano. Un sistema que requiera rehacer la configuración de seguridad cada vez que cambie la disposición pierde urgencia y versatilidad.

La distinción basada en la mirada utiliza la percepción situacional de la persona en ese momento, en lugar de un modelo de entorno fijo. Esto podría reducir la carga de preparación en el lugar y limitar la proximidad a los objetos pasados por alto. Sin embargo, lo que se confirmó en este estudio fue solo que el sistema funciona según lo definido, y no se evaluó en condiciones reales el efecto sobre la reducción de accidentes.

Prototipo y evaluación preliminar

Implementación

El sistema se implementó en un robot de 1,9 m de altura, 600 kg de peso y 30 grados de libertad, con una forma similar a la parte superior del cuerpo humano. El operador se coloca un casco de realidad virtual y controla el robot sincronizando la vista y la orientación de la cabeza del robot con sus propios movimientos.

Se adquirió el espacio de trabajo en forma de nube de puntos con LIDAR sobre el robot y, en el espacio virtual, se representó como vóxeles con detección de colisiones. Un gemelo digital que sincroniza ese espacio con la máquina real está en funcionamiento. El campo de visión central del operador se representa como un cono de 60° × 55°, y la orientación se aproxima mediante la dirección frontal del casco. Cuando el brazo se acerca a un vóxel fuera del campo de visión, se envía una advertencia a la máquina real para que reduzca la velocidad o se detenga.

Escena en un espacio virtual. Vóxeles amarillos reconfiguran el entorno, y una zona roja translúcida marcada como 'campo visual central del operador' lo atraviesa, mientras un robot gemelo digital blanco extiende la mano hacia un obstáculo que se encuentra fuera de esa zona.
Un espacio virtual que contiene nubes de puntos escaneadas y un robot. Aquí, el robot está tocando obstáculos que se encuentran fuera del campo de visión central del operador.

Evaluación preliminar

Se intentó la serie de operaciones de acercar el brazo al objeto mientras el operador apartaba la vista de este, luego devolver la mirada al objeto para liberar la restricción y, finalmente, agarrar la pelota. De los cinco intentos, cuatro fueron realizados por operadores experimentados y uno por un operador en su segundo intento a bordo. En todos los intentos, el brazo se detuvo cuando la vista no estaba sobre el objeto y la operación continuó al mirar hacia el objeto. Esta no es una prueba de usuario para medir la eficacia, sino una evaluación preliminar para verificar si el comportamiento diseñado funciona en la máquina real.

Foto de un robot. En el marco superior está el operador montado, mirando hacia un lado. La mano del robot se detiene frente a la bola azul y amarilla sobre el poste amarillo, mostrando la distancia restante.
La mirada del operador se desvía, y el brazo se detiene a cierta distancia del objetivo.
Foto desde un ángulo bajo. El operador está mirando hacia el poste, y la mano del robot está agarrando la pelota azul y amarilla sobre el poste amarillo.
Si la mirada está dirigida al objeto, la misma acción puede progresar sin restricciones.

Límites y la siguiente verificación

No se ha implementado la detección de personas en el prototipo. Se estableció una regla de proteger siempre a las personas sin importar la dirección de su mirada, pero en un entorno real será necesario un mecanismo que identifique a las personas de manera fiable. Además, se utilizó la dirección frontal del casco como valor proxy en lugar de la mirada en sí, por lo que si solo se mueven los ojos, no se podrán detectar.

Si se utilizan cámaras fijas o gafas inteligentes con seguimiento ocular, cambiarán las condiciones del dispositivo que se lleva puesto y la precisión estimada. En el caso de implementarlo en robots móviles, también será necesario un procesamiento de nubes de puntos que pueda seguir el cambio de posición del propio robot.

La evaluación se limita a una verificación cualitativa mediante cinco intentos de demostración. Para juzgar la seguridad, la velocidad de trabajo y la carga sobre el operador, es necesario realizar una comparación cuantitativa con el método convencional en condiciones de trabajo reales.

Perspectiva obtenida de este estudio

En este estudio, en lugar de usar la mirada de las personas como un dispositivo de entrada, se trató como una condición para permitir el comportamiento de la máquina. El comportamiento del robot hacia el mismo objeto cambia según lo que la persona esté comprendiendo en ese momento. Lo que se diseñó no son acciones individuales, sino la relación entre el estado cognitivo de la persona y la autoridad de la máquina.

Esta forma de pensar también está conectada con el Mi filosofía de diseño actual. Se trata de comprender el estado de las personas, convertirlo en restricciones que el sistema debe cumplir, y dentro de eso, las máquinas o la IA despliegan sus capacidades. La investigación de maestría se convirtió en el punto de partida para eso.

Agradecimientos

Este estudio se llevó a cabo durante el período de prácticas en la empresa Jinki Ittai como parte del programa de maestría en Design & Engineering de la Universidad Politécnica de Milán. Agradezco profundamente a ambas organizaciones por hacer posible esta oportunidad.

Takafumi Horiuchi, Katsuya Kanaoka, “Gaze-based Unintended Contact Prevention for Human-Operated Robots,” The 39th Annual Conference of the Robotics Society of Japan, 2021, 2J2-07. Conference programme