Pastlens: granting temporal consistency to multi-person pose estimation through longer receptive fields

Eduardo Souza dos Reis · 2019

Estimar com precisao poses de varios individuos em cenas sem restricoes beneficiaria muitas aplicacoes de visao computacional. Alguns exemplos: reidentificacao de pessoas, interacao humano-computador, analise comportamental e compreensao de cenas. Atraves dos avancos na arquitetura das redes convolucionais, detectores de partes do corpo sao precisos e podem estimar o posicionamento das partes em imagens estaticas em tempo real (30 FPS), tanto em cenarios com uma unica pessoa, quanto com varias pessoas interagindo. No entanto, varios individuos na mesma cena impoem desafios adicionais, como oclusao inter-pessoas, partes do corpo truncadas, etapas adicionais de atribuicao e mais fontes para contagem dupla. Nos ultimos anos, muitos avancos contribuiram para esse objetivo e resolveram parcialmente alguns desafios. Mas, lidar com a oclusao inter-pessoas de longo prazo nao e possivel em imagens estaticas, devido a falta de atributos discriminativos para detectar o individuo ocluido. A maioria dos trabalhos revisados resolve esse problema coletando atributos de movimento que relacionam as partes do corpo em varios quadros do video, explorando a consistencia temporal. Normalmente, esses trabalhos consideram apenas quadros adjacentes para correlacionar esses atributos em tempo real ou processam o video inteiro de antemao, para depois impor consistencia global de maneira offline. Como a maioria das aplicacoes citadas dependem do processamento proximo ao tempo real, em conjunto com a analise de movimentos humanos complexos, que nao sao detectaveis em poucos quadros, propomos o modelo PastLens. Nosso principal objetivo e prover uma alternativa com melhor custo beneficio do que a atual escolha entre o numero de quadros a serem correlacionados e o tempo de estimacao. O modelo impoe restricoes espaco-temporais a propria rede convolucional, ao inves de depender de atributos temporais definidos de forma arbitraria. Nos alongamos o campo receptivo das camadas intermediarias para tambem conter o quadro anterior, forcando as camadas subsequentes a detectarem atributos que correlacionam as poses nos dois frames, sem perder a configuracao das poses quadro-a-quadro. Alem disso, nos nao restringimos a representacao destes atributos, permitindo que a mesma seja aprendida durante o processo de treinamento, juntamente com a estimativa de poses. Por estimativa e rastreamento de poses, nos referimos a localizacao e rastreamento da cabeca, membros e torso, seguidos da combinacao dessas partes em poses que descrevam corretamente a cena. Nos nao avaliaremos nossa abordagem em benchmarks para keypoints faciais ou reconhecimento de gestos. PoseTrack e a base de dados escolhida para avaliar nosso modelo, visto que ela fornece uma referencia publica para estimacao e rastreamento de poses em videos, alem de um quadro de classificacao, permitindo a comparacao direta de nossos resultados com o estado-da-arte. Os resultados dos experimentos indicam que nosso modelo atinge acuracia competitiva nos videos com multiplas pessoas, mas contem menos operacoes e e mais facil de adaptar para modelos pre-treinados. Em relacao as contribuicoes cientificas, nos disponibilizamos uma alternativa eficiente para impor consistencia temporal a estimativa de poses humanas usando apenas o aumento dos campos receptivos, deixando que a representacao de atributos temporais seja definida pelos dados. Assim, nossos resultados podem levar a novas formas de explorar a consistencia temporal na estimativa de poses humanas em videos.

Read the paper · More papers on PaperTik