Takafumi Horiuchi

Dissertação de mestrado sobre design de interação entre humanos e robôs

Resumo

Em robôs grandes operados por humanos, é difícil distinguir apenas com sensores ao redor os movimentos de aproximação ao objeto de trabalho dos movimentos em direção a obstáculos negligenciados. Portanto, foi projetado um sistema de prevenção de colisões que usa a área que o operador está olhando como uma pista da intenção de "permitir toque" e desacelera ou para o braço quando se aproxima de um objeto que não está sendo observado.

Não é necessário registrar antecipadamente o alvo como "operável" ou "protegido". Essa distinção é atualizada de acordo com o olhar do operador durante o trabalho. Foi implementado em um robô pesado humanóide de 1,9 m de altura e, em cinco ensaios de demonstração, foi confirmado que o comportamento definido funciona. O funcionamento real pode ser visto em Vídeo de demonstração.

Como parte da tese de mestrado em Design & Engineering na Universidade Politécnica de Milão, trabalhei nisso durante um estágio de pesquisa na empresa Jinki Ittai Corporation e apresentei na 39ª Conferência Acadêmica da Sociedade Japonesa de Robótica (RSJ2021).


  1. Slide de título. Prevenção de Colisão Baseada em Consciência para Manipulação Robótica Controlada por Humanos, Mestrado em Design & Engineering da Universidade Politécnica de Milão, ano letivo de 2020–2021.
  2. Contexto. O tema da tese foi decidido durante um estágio de pesquisa na empresa Jinki-ittai Co., Ltd., que desenvolve máquinas pesadas humanoides e as opera no modo master-slave.
  3. Comparação entre robôs autônomos e robôs operados por humanos. Os primeiros trabalham de forma eficiente em espaços projetados dentro de cercas, enquanto os últimos trabalham junto com pessoas em espaços incertos.
  4. Estatísticas da Europa, dos Estados Unidos e do Japão. Indica que o contato com objetos em movimento representa uma proporção considerável dos acidentes em canteiros de obras.
  5. Pesquisa anterior sobre prevenção de colisões. Pele sensorial que cobre o manipulador e sensor de profundidade que reproduz virtualmente o ambiente ao redor.
  6. Desafios atuais. O sistema existente exige que o alvo seja previamente definido como 'protegido' ou 'operável' por meio de etiquetas acopladas, análise de imagens e um classificador aprendido.
  7. Proposta. Os sistemas convencionais utilizam apenas informações de sensores passivos, mas os robôs operados por humanos já têm pessoas dentro do loop de controle, e o olhar delas pode ser usado como um parâmetro ativo.
  8. Regras de classificação. Os objetos dentro do campo de visão central do operador podem ser manipulados, enquanto os objetos fora dele devem ser protegidos.
  9. Visão geral do protótipo. Combinando o robô real com o espaço de cálculo virtual, três elementos tecnológicos seguem.
  10. Elemento ①. Representar o campo visual central como um cone de 60° × 55° e aproximar sua direção para a frente do headset de VR.
  11. Elemento ②. O LIDAR colocado na cabeça do robô escaneia o ambiente como uma nuvem de pontos, sendo cada ponto representado como um voxel com um colisor.
  12. Elemento ③. O gêmeo digital do robô se move da mesma forma que o equipamento real, e quando seu braço toca um voxel fora do campo de visão, um aviso de proximidade é emitido.
  13. Demonstração de prova de conceito. Imagem parada de um robô estendendo a mão para a bola em um mastro e exibição de voxels em um espaço virtual.
  14. Desafios futuros. Detecção de pessoas no espaço de trabalho, verificação de outros métodos para medir a direção do olhar e avaliação quantitativa em campo.
  15. Resumo da conclusão. Tema da pesquisa, valor do método, novidade, e como o sistema foi verificado.

Problema — As configurações prévias para segurança restringem o local

Os robôs operados por humanos são necessários em locais que não estão preparados para robôs autônomos. Em lugares como canteiros de obras ou locais de desastres, a disposição de pessoas e equipamentos muda, e o que pode ser tocado também muda a cada tarefa. Para usar a grande força das máquinas, é necessário poder tocar nos objetos necessários enquanto se previne contatos indesejados.

Para a prevenção de colisões existente, há métodos como cobrir o robô com sensores de proximidade ou reproduzir o ambiente circundante em um espaço virtual usando sensores de profundidade. No entanto, ambos exigem classificar previamente os objetos como "operáveis" ou "a proteger". Se nada for registrado, não será possível tocar em nada por segurança, e registrar tudo requer configuração e calibração em cada local. Esse peso de preparação reduzia a praticidade de robôs que são usados em diferentes locais.

Ideia — transformando o olhar em uma 'condição em que se pode tocar'

No loop de controle de um robô operado por humanos, já há uma pessoa que julga a situação. Se conseguirmos transmitir à máquina para onde a pessoa está direcionando sua atenção, pensei que, em vez de registrar o alvo antecipadamente, talvez seja possível estimar a intenção de contato durante o trabalho.

Portanto, utiliza-se o campo visual central do operador como limite. Os objetos dentro do campo visual são considerados "alvos operáveis" que o operador compreende. Os objetos fora do campo visual são considerados "alvos a proteger" que podem ter sido negligenciados. As pessoas, independentemente da posição do olhar, são sempre consideradas alvos a proteger.

Isto não é um mecanismo para enviar comandos ao robô usando o olhar. É um mecanismo que converte o estado cognitivo do operador em condições para que o robô possa se mover.

Figura vista de cima. À frente do robô, o campo de visão central do operador é desenhado como um cone. O objeto A, que está dentro do cone, é representado por um círculo branco, enquanto os objetos B, C e D, que estão fora, são mostrados como quadrados escuros, e duas pessoas estão posicionadas dentro e fora do cone.
O objeto A dentro do campo de visão central do operador pode ser manipulado, enquanto os objetos B, C e D do lado de fora se tornam objetos de proteção. A pessoa é protegida esteja ela onde estiver.

Design de interação

O sistema não transforma a posição do olhar em um simples interruptor de ligar e desligar. Quando se aproxima de um objeto que não está sendo observado, o braço desacelera gradualmente de acordo com a distância e para antes de entrar em contato. Após a parada, quando o operador dirige o olhar para o objeto, as restrições também são gradualmente liberadas. Isso evita comportamentos de parada ou movimento súbito, permitindo que o operador possa prever as mudanças.

Por outro lado, mesmo que se desvie temporariamente o olhar de um objeto que já está sendo tocado, o trabalho em andamento não é interrompido. Isso ocorre porque, se a apreensão ou a operação forem interrompidas apenas por desviar o olhar, isso se tornaria mais instável. A aproximação de pessoas é tratada de forma diferente, sendo limitada independentemente de o operador estar observando ou não.

O objetivo não é retardar uniformemente o trabalho por razões de segurança. Trata-se de manter a capacidade do robô dentro do alcance do que o operador compreende e proteger apenas as áreas fora de sua atenção, equilibrando assim segurança e operacionalidade.

Um fluxograma que começa a partir de um estado de movimento livre. Ele se ramifica dependendo se o objeto está próximo, se é uma pessoa, se o manipulador está na direção de aproximação à pessoa, ou se o objeto está na área de atenção, levando a movimentos precisos, parada gradual ou travamento.
O nó que lê os parâmetros ativos do operador no processo de julgamento é apenas aquele que verifica se o objeto está na área de atenção. Todos os outros ramos funcionam com informações sensoriais passivas.

Cenários de uso previstos

O foco foi em locais como canteiros de obras e áreas de desastres, onde se lida com grandes forças perto das pessoas. Nesses lugares, é difícil cercar completamente o entorno ou registrar previamente todos os objetos. Um sistema que exige refazer as configurações de segurança sempre que a disposição muda comprometeria a urgência e a versatilidade.

A distinção baseada no olhar utiliza a percepção da situação da pessoa no momento, em vez de um modelo de ambiente fixo. Isso pode reduzir a carga de preparação no local e limitar a aproximação de alvos negligenciados. No entanto, o que foi confirmado neste estudo é apenas que o sistema funciona conforme definido, e os efeitos na redução de acidentes não foram avaliados na prática.

Protótipo e avaliação preliminar

Implementação

O sistema foi implementado em um robô de 1,9 m de altura, 600 kg de peso e 30 graus de liberdade, com uma forma semelhante à parte superior do corpo humano. O operador usa um headset de VR e controla o robô sincronizando sua visão e a direção da cabeça com seus próprios movimentos.

O espaço de trabalho foi adquirido como uma nuvem de pontos com LIDAR no robô, e no espaço virtual foi representado como voxels com detecção de colisão. Um gêmeo digital sincronizado com a máquina real opera nesse espaço. O campo de visão central do operador foi representado como um cone de 60° × 55°, e a direção foi aproximada pela frente do headset. Quando o braço se aproxima de voxels fora do campo de visão, um aviso é enviado para a máquina real, fazendo com que ela desacelere ou pare.

Cena de um espaço virtual. Voxels amarelos estão reconstruindo o entorno, e uma área vermelha semitransparente, marcada como
Um espaço virtual que contém o robô e a nuvem de pontos escaneada. Aqui, o robô está tocando obstáculos que estão fora do campo de visão central do operador.

Avaliação preliminar

Foi testada uma sequência de operações na qual o operador aproximava o braço do alvo enquanto desviava o olhar, após a parada retornava o olhar para o alvo para desbloquear a restrição e, por fim, pegava a bola. Das cinco tentativas, quatro foram realizadas por operadores experientes e uma pelo operador que estava em seu segundo uso do equipamento. Em todas as tentativas, o braço parava quando o olhar não estava no alvo e a operação podia ser continuada quando o olhar era direcionado. Esta não é uma experiência de usuário para medir a eficácia, mas uma avaliação preliminar para verificar se o comportamento projetado funciona no equipamento real.

Foto de um robô. No quadro acima dele, o operador está a bordo, olhando para o lado. A mão do robô para na frente da bola azul e amarela em cima do poste amarelo, e a distância restante é indicada.
O operador desviou o olhar, e o braço parou mantendo distância do alvo.
Foto de ângulo inferior. O operador está olhando para o poste, e a mão do robô está segurando a bola azul e amarela em cima do poste amarelo.
Se o olhar estiver direcionado ao alvo, a mesma ação pode prosseguir sem restrições.

Limite e próxima verificação

O protótipo não implementa a detecção de pessoas. Foi estabelecida a regra de sempre proteger as pessoas independentemente da linha de visão, mas em um ambiente real será necessário um mecanismo para identificar pessoas com segurança. Além disso, em vez de usar a própria linha de visão, foi utilizado como valor substituto a direção frontal do headset, de modo que, se apenas os olhos forem movidos, não será detectado.

Se você usar câmeras fixas ou óculos inteligentes com rastreamento ocular, as condições de dispositivos vestíveis e a precisão da estimativa mudam. No caso de ser aplicado a robôs móveis, também será necessário o processamento de nuvem de pontos que possa acompanhar as mudanças de posição do próprio robô.

A avaliação se limita à verificação qualitativa por cinco tentativas de demonstração. Para julgar a segurança, a velocidade de trabalho e o esforço do operador, é necessário uma comparação quantitativa com o método convencional sob condições de trabalho reais.

Perspectiva obtida a partir desta pesquisa

Neste estudo, ao invés de usar o olhar humano como dispositivo de entrada, ele foi tratado como uma condição para permitir o comportamento da máquina. Dependendo do que a pessoa está percebendo no momento, o comportamento do robô em relação ao mesmo alvo muda. O que foi projetado não foram ações individuais, mas a relação entre o estado cognitivo humano e a autoridade da máquina.

Essa forma de pensar também se conecta ao atual Minha filosofia de design. Compreender o estado das pessoas, transformar isso em restrições que o sistema deve proteger e, dentro disso, permitir que máquinas e IA desempenhem suas capacidades. A pesquisa de mestrado se tornou o ponto de partida para isso.

Agradecimentos

Este estudo foi realizado durante o estágio na empresa Jinki Ittai Co., Ltd., como parte do programa de mestrado em Design & Engineering do Politécnico de Milão. Agradeço profundamente a ambas as organizações por terem possibilitado esta oportunidade.

Takafumi Horiuchi, Katsuya Kanaoka, “Gaze-based Unintended Contact Prevention for Human-Operated Robots,” The 39th Annual Conference of the Robotics Society of Japan, 2021, 2J2-07. Conference programme