O que são modelos de IA do tipo VLM e o que é o FastVLM?
Os modelos de visão e linguagem (VLMs, na sigla em inglês) são sistemas de IA capazes de entender imagens e texto ao mesmo tempo. Isso permite que eles realizem tarefas como:
- Responder a perguntas sobre fotos
- Analisar gráficos
- Ler textos dentro de imagens
Se você já tentou enviar uma imagem para o ChatGPT e fazer perguntas sobre ela, você já usou um VLM.
Historicamente, esses modelos enfrentaram um problema enorme: processar imagens de alta qualidade exige muito poder de processamento e causa atrasos significativos.
Voltando ao mesmo exemplo do ChatGPT — ele pode demorar um pouco para responder sobre a imagem, certo?
Além disso, os codificadores de visão tradicionais, especialmente os Vision Transformers (ViTs), não funcionam tão bem quanto deveriam em resoluções de imagem mais altas.
Imagens de resolução mais alta geram mais tokens visuais, que são as unidades básicas de informação que a IA processa.
Todos nós sabemos o que acontece quando enviamos um documento muito grande para o ChatGPT — aqui funciona da mesma maneira. Isso também aumenta o tempo que o modelo de linguagem leva para começar a gerar respostas. Esse atraso é chamado de tempo até o primeiro token (TTFT, na sigla em inglês). Esse tem sido um grande problema que impediu os VLMs de serem úteis em muitas situações.
O que a Apple fez
A equipe de pesquisa da Apple resolveu o problema da lentidão, e também o problema de precisão, criando o FastViTHD, um codificador de visão híbrido inédito que está no coração do FastVLM. Agora, isso vai ficar um pouco técnico, então peço que tenha um pouco de paciência.
O FastViTHD é um codificador que usa um design de cinco etapas, combinando diferentes técnicas de processamento para trabalhar da forma mais eficiente possível.
- As três primeiras etapas usam blocos RepMixer para processar os dados rapidamente
- As duas últimas etapas usam mecanismos de autoatenção com múltiplas cabeças (multi-headed self-attention).
Isso parece muito complexo, mas, em essência, a Apple criou o próprio DLSS dela para o mundo dos modelos de imagem com IA.
A solução deles também tem um design especial que permite ao codificador gerar quatro vezes menos tokens visuais para o modelo de linguagem processar, o que faz com que tudo funcione muito mais rápido.
Quando esse modelo é usado em dispositivos de consumo, ele poderia, por exemplo, deixar você apontar a câmera para a sua mesa de cozinha com os ingredientes em cima. A IA poderia então processar isso em tempo real e dar sugestões de receitas na hora.
Benchmarks do FastVLM
As melhorias de desempenho entregues pelo FastVLM são notáveis em diversos benchmarks:
- O FastVLM é 3,2 vezes mais rápido que a configuração LLaVA-1.5, amplamente utilizada.
- Em comparação com o LLaVA-OneVision na resolução máxima (1152 x 1152), o FastVLM é igualmente preciso, mas 85 vezes mais rápido.
- O codificador de visão é 3,4 vezes menor que sistemas semelhantes, o que o torna mais prático para uso em dispositivos que não têm muitos recursos.
Em testes contra outros modelos recentes, o FastVLM costuma se sair melhor. Em comparação com o ConvLLaVA, que usava o mesmo modelo de linguagem e os mesmos dados de treinamento, o FastVLM teve desempenho 8,4% melhor no TextVQA e 12,5% melhor no DocVQA. Ele também operou 22% mais rápido. A vantagem é ainda mais perceptível em resoluções mais altas. Nessas resoluções, o FastVLM processa as informações duas vezes mais rápido que o ConvLLaVA.
Em comparação com outro modelo de visão e linguagem bem conhecido, o MM1, o FastVLM se sai igualmente bem, ou até melhor, em vários testes, enquanto produz cinco vezes menos tokens visuais. Ele também supera o Cambrian-1, rodando 7,9 vezes mais rápido.
Por que isso importa
O FastVLM é um grande avanço para tornar a IA de visão e linguagem útil em aplicações do mundo real. A enorme redução no tempo de processamento e nas necessidades computacionais cria novas oportunidades para:
- Rodar em dispositivos móveis: o tamanho menor do modelo e o processamento mais rápido tornam possível usar uma IA de visão e linguagem avançada em smartphones e tablets.
- Funcionar em tempo real: a melhoria de velocidade de 85x permite análise de documentos, respostas a perguntas visuais e compreensão de imagens em tempo real.
- Experiências aprimoradas: os assistentes de IA respondem mais rápido, tornando-os mais naturais e ágeis ao conversar sobre imagens.
O FastVLM tem um desempenho tão bom porque equilibra de forma inteligente a resolução da imagem, a velocidade de processamento, a quantidade de tokens e o tamanho do modelo. Enquanto modelos mais antigos usavam estratégias complicadas de poda de tokens ou processavam vários blocos de menor resolução, o FastVLM atinge o equilíbrio ideal simplesmente ajustando a escala da imagem de entrada de forma adequada.
Onde acessar o FastVLM
A Apple disponibilizou o FastVLM ao público, no Hugging Face Model Hub. Você encontra o modelo com o nome "apple/FastVLM-0.5B" se estiver procurando a versão com 0,5 bilhão de parâmetros.
Para rodar o FastVLM, você vai precisar de:
- Framework de deep learning PyTorch
- Biblioteca Hugging Face Transformers (recomenda-se a versão 4.37.0 ou posterior)
- PIL (Python Imaging Library) para o processamento de imagens
- GPU compatível com CUDA para desempenho ideal (embora a inferência em CPU seja possível com configurações ajustadas)
Conclusão
A Apple lançou o próprio modelo de IA, mas não é uma nova versão do ChatGPT. Em vez disso, é um modelo de visão e linguagem (VLM) chamado FastVLM.
Os VLMs são uma categoria de modelos de IA que conseguem processar texto. O lançamento da Apple é importante porque o modelo é até 85 vezes mais rápido e cerca de 3 vezes menor que modelos semelhantes da concorrência. Isso deve permitir que ele rode com eficiência em hardware de consumo.
Isso pode abrir caminho para muitos usos interessantes de um assistente de IA capaz de processar imagens, ou até vídeo, em tempo real e interagir com eles. E, como tudo isso acontece no seu próprio dispositivo, não há preocupação com privacidade. Provavelmente veremos novos recursos com a tecnologia do FastVLM em breve, e isso é empolgante.