A Microsoft lançou recentemente o VASA-1, uma nova ferramenta de inteligência artificial capaz de transformar imagens estáticas em vídeos curtos. Esse modelo utiliza tecnologia deepfake, sendo capaz de sincronizar os lábios com um áudio e reproduzir expressões faciais realisticamente. Além de criar vídeos a partir de imagens de pessoas reais, a IA também pode gerar vídeos de representações artísticas, como uma animação da Mona Lisa cantando rap. A empresa não pretende disponibilizar a ferramenta para o público geral devido ao impacto negativo de seu uso indevido na sociedade, porém planeja incorporar a tecnologia em seus serviços.
Uma das aplicações potenciais desse modelo é no Microsoft Teams, plataforma de comunicação corporativa, permitindo que os usuários façam videochamadas com a câmera desligada e a imagem do perfil animada pelo VASA, sincronizando os lábios com o áudio em tempo real. O Teams já permite a utilização de avatares em videoconferências, mas a nova IA da Microsoft poderia levar essa funcionalidade a um novo nível, proporcionando representações digitais mais realistas. A empresa está focada em aprimorar as representações de humanos do VASA para reproduzir com mais precisão nuances de expressões faciais e movimentações corporais.