Durante anos, criar um vídeo de qualidade profissional exigiu equipamentos caros, equipas de produção e horas de edição. Hoje, esse cenário está a mudar de forma acelerada. A Alibaba acaba de apresentar o Wan3.0, a sua mais recente versão de um modelo de inteligência artificial capaz de gerar vídeos a partir de simples descrições escritas, e os resultados colocam esta tecnologia a par das melhores ferramentas disponíveis no mundo.
O que é o Wan3.0 e o que faz de diferente
Para entender o que o Wan3.0 representa, podemos pensar numa câmara de cinema que não filma o mundo real, mas sim o mundo que lhe descrevemos com palavras. O utilizador escreve algo como “um barco a vela ao pôr do sol num mar agitado, com luz dourada a refletir nas ondas” e o modelo produz um vídeo fluido e coerente com essa descrição, sem que seja necessário qualquer filmagem ou edição manual.
A novidade desta versão está em três melhorias fundamentais. Primeiro, a consistência visual ao longo do tempo: versões anteriores de modelos semelhantes tendiam a “esquecer” detalhes entre um fotograma e o seguinte, criando vídeos com objetos que mudavam de forma ou cor de forma estranha. O Wan3.0 resolve este problema com uma arquitetura interna mais robusta, que mantém a coerência de cena para cena como se o modelo “se lembrasse” do que estava a construir.
Segundo, a qualidade do movimento humano melhorou de forma notória. Nos primeiros modelos de geração de vídeo, as pessoas moviam-se de forma robótica ou com distorções nos membros. O Wan3.0 foi treinado com volumes maiores de dados de movimento humano natural, o que resulta em figuras que andam, gesticulam e interagem de forma muito mais convincente.
Terceiro, o modelo aceita tanto texto como imagens como ponto de partida. Ou seja, os utilizadores podem fornecer uma fotografia e pedir ao modelo que a “anime”, transformando uma imagem estática num clip de vídeo dinâmico. Esta funcionalidade abre portas enormes para criadores de conteúdo, equipas de marketing e até jornalistas visuais.
Por que razão isto importa para nós
A Alibaba não é apenas uma empresa de comércio eletrónico. É um dos maiores investidores em infraestrutura de inteligência artificial do mundo, e o Wan3.0 é a sua resposta direta a ferramentas como o Sora da OpenAI e o Veo da Google. O facto de existir concorrência real neste espaço é uma boa notícia para os utilizadores, porque significa que os preços tendem a baixar e o acesso tende a democratizar-se.
Para quem trabalha em Portugal com criação de conteúdo digital, redes sociais, publicidade ou educação, esta geração de ferramentas representa uma mudança comparável à que aconteceu quando os telemóveis passaram a ter câmaras de qualidade. De repente, toda a gente passou a poder produzir conteúdo visual sem equipamento especializado. Com o Wan3.0 e os seus concorrentes, a produção de vídeo pode seguir o mesmo caminho.
Está disponível e como aceder
O Wan3.0 foi disponibilizado em formato de código aberto, o que significa que programadores e empresas podem descarregar e adaptar o modelo para os seus próprios projetos, sem custos de licença diretos. A Alibaba disponibilizou também uma versão de demonstração na sua plataforma Tongyi, embora o acesso completo possa exigir conta na plataforma e, em alguns casos, estar sujeito a restrições geográficas que ainda limitam o uso fora da China de forma fluida.
Para os utilizadores mais técnicos, o modelo está disponível no repositório Hugging Face, uma plataforma internacional onde a comunidade de inteligência artificial partilha e testa modelos. Para quem não tem perfil técnico, é provável que nos próximos meses comecem a surgir aplicações e plataformas europeias que integrem esta tecnologia de forma mais acessível, tal como aconteceu com outros modelos de linguagem nos últimos dois anos.
O que ainda não consegue fazer
É importante ser honesto quanto às limitações atuais. O Wan3.0 não gera vídeos de longa duração com narrativa complexa. Os clips produzidos têm tipicamente poucos segundos a menos de um minuto, e a coerência narrativa ao longo de sequências mais longas ainda é um desafio não resolvido. Além disso, tal como todos os modelos generativos, pode produzir resultados inesperados ou incorretos quando as instruções são ambíguas, exigindo que os utilizadores aprendam a escrever descrições claras e detalhadas para obter bons resultados.
A questão dos direitos de autor e do uso ético também permanece em aberto. Quando um modelo é treinado com vídeos existentes para aprender a gerar novos, surgem questões legítimas sobre a origem desse material de treino. Este é um debate que a indústria e os legisladores europeus estão ainda a resolver, e que deve fazer parte da conversa sempre que se fala de adoção destas ferramentas.
O panorama que se desenha
O Wan3.0 é mais um sinal de que a geração de vídeo por inteligência artificial deixou de ser ficção científica para se tornar uma realidade técnica funcional. A velocidade a que estes modelos evoluem, de versão para versão, sugere que dentro de dois a três anos teremos ferramentas capazes de produzir vídeo de qualidade broadcast a partir de texto, acessíveis a qualquer pessoa com um computador ligado à internet.
Para a Arena Digital, acompanhar esta evolução não é apenas uma questão de curiosidade tecnológica. É uma preparação para um conjunto de ferramentas que vai redefinir a forma como comunicamos, criamos e contamos histórias em formato digital.
Fonte: Notícia Original





