O modelo GPT-4 da OpenAI é de longe o melhor modelo generativo de IA atualmente disponível no mercado, mas isso não significa que não estamos olhando para o futuro. Com o CEO da OpenAI, Sam Altman, regularmente dando dicas sobre a chegada iminente do GPT-5, parece provável que veremos em breve um modelo novo, atualizado e mais avançado de IA.
Pelo menos é isso que esperamos. Não há uma data de lançamento definida para o GPT-5, e muito do que pensamos que sabemos vem da junção de outras informações e da tentativa de conectar os pontos. Verificar Razões para começar a usar Claude 3 em vez de ChatGPT.

No entanto, independentemente da data de entrega, existem alguns recursos importantes que gostaríamos de ver quando o GPT-5 for lançado.
Links Rápidos
O que é o GPT-5 da OpenAI?
O modelo GPT-5 é o possível sucessor do modelo GPT-4 AI da OpenAI, que é amplamente esperado como o modelo generativo mais poderoso do mercado. Embora atualmente não haja uma data oficial de lançamento para o GPT-5, há indícios de que ele poderá ser lançado já no verão de 2024. Muito poucos detalhes são conhecidos sobre o modelo neste momento, mas muitas coisas podem ser ditas ao seu redor. com confiança. Para confirmação:
- OpenAI registrou uma marca registrada para o nome no Office of... Patentes e marcas registradas Nos Estados Unidos.
- Vários executivos da OpenAI discutiram ou sugeriram as capacidades potenciais do modelo.
- Sam Altman, CEO da OpenAI, mencionou o modelo repetidamente durante uma entrevista no YouTube Em março de 2024 com Lex Friedman.
Tudo isso aponta para um fato interessante: o GPT-5 está chegando! No entanto, muitas coisas são apenas especulações neste momento. Mas existem alguns recursos que esperamos ver e estamos bastante confiantes de ver neste modelo. Aqui estão alguns deles:
1. Suporta mais multimídia

Uma das melhorias mais interessantes na família GPT de modelos de IA é a multimodalidade. Para maior clareza, multimodalidade é a capacidade de um modelo de IA de processar mais do que apenas entrada de texto, mas também outros tipos de entrada, como imagens, áudio e vídeo. A multimodalidade será um importante padrão de avanço para a família de modelos GPT no futuro.
Com o GPT-4 já apto a lidar com entrada e saída de imagens, as melhorias que abrangem o processamento de áudio e vídeo são o próximo avanço para OpenAI, e o GPT-5 é um bom lugar para começar. O Google já está fazendo grandes progressos neste tipo de multimídia com um modelo IA de Gêmeos Ela mesma. Seria incomum que a OpenAI não respondesse. Mas, claro, não acredite apenas na nossa palavra. Em seu podcast Desconfunda-me [versão PDF], Bill Gates perguntou a Sam Altman, CEO da OpenAI, quais marcos importantes ele espera para a série GPT nos próximos dois anos. Sua primeira resposta? Foi processamento de vídeo.
Portanto, para o GPT-5, esperamos ser capazes de lidar com vídeos – enviar vídeos como prompts, criar vídeos em qualquer lugar, editar vídeos com prompts de texto, extrair clipes de vídeos e encontrar cenas específicas de grandes arquivos de vídeo. Esperamos poder fazer coisas semelhantes com arquivos de áudio. É uma grande pergunta, sim. Mas dada a rapidez com que a IA está evoluindo, é uma expectativa bastante razoável.
2. Janela de contexto maior e mais eficiente

Apesar de ser um dos modelos de IA mais avançados do mercado, a família GPT de modelos de IA possui uma das menores janelas de contexto. Por exemplo, o Claude 3 da Anthropic apresenta uma janela de contexto com 200.000 tokens, enquanto o Gemini do Google pode lidar com impressionantes 1.000.000 de tokens (128.000 para uso padrão). Em contraste, o GPT-4 tem uma janela de contexto relativamente menor de 128.000 tokens, com aproximadamente 32.000 ou menos tokens realisticamente disponíveis para uso em interfaces como ChatGPT.
Com a multimídia avançada ganhando destaque, melhorar a janela de contexto tornou-se quase inevitável. Um aumento de um fator de dois ou quatro pode ser suficiente, mas esperamos ver algo como um fator de dez. Isso permitirá que o GPT-5 processe mais informações de maneira mais eficiente. Agora, uma janela de contexto maior nem sempre significa melhor. Portanto, em vez de apenas aumentar a janela de contexto, gostaríamos de ver um aumento na eficiência do processamento de contexto.
Veja, um modelo pode ter uma janela de contexto de 1.000.000 de tokens (capacidade de cerca de 700.000 palavras), mas falha em produzir um resumo abrangente quando solicitado a resumir um livro de 500.000 palavras porque não consegue processar adequadamente todo o contexto, apesar de ter a capacidade de fazer isso em teoria. Só porque você pode ler um livro de 500.000 palavras não significa que você pode lembrar ou processar tudo razoavelmente bem. Verificar Por que a janela de contexto de 1.5 milhão de tokens no Gemini XNUMX é uma virada de jogo.
3. Proxies GPT

Talvez uma das possibilidades mais interessantes para o lançamento do GPT-5 seja a estreia dos proxies GPT. Embora o termo “virador de jogo” provavelmente tenha sido usado em demasia na IA, a adição de agentes GPT será um divisor de águas em todos os sentidos da palavra. Mas quão grande será essa mudança potencial?
Atualmente, modelos de IA como o GPT-4 podem ajudá-lo a completar a tarefa. Ela pode escrever um e-mail, contar uma piada, resolver um problema de matemática ou criar uma postagem no blog para você. No entanto, ele só pode realizar esta tarefa específica e não pode concluir um conjunto de tarefas relacionadas que podem ser necessárias para concluir o seu trabalho.
Digamos que você seja um desenvolvedor web. Como parte de seu trabalho, espera-se que você faça muitas coisas: projetar, escrever código, solucionar problemas e muito mais. Atualmente, você só pode delegar uma parte dessas tarefas aos modelos de IA por vez. Talvez você possa pedir a um modelo GPT-4 para escrever código para configurar a página inicial e, em seguida, fazer isso para a página de contato, depois para a página sobre e assim por diante. Você precisará concluir essas tarefas com frequência. Existem tarefas que os modelos não conseguem concluir.
Este processo iterativo de motivar modelos de IA para realizar subtarefas específicas é demorado e ineficiente. Neste cenário, você — o desenvolvedor web — é o agente humano responsável por coordenar e motivar o modelo de IA com uma tarefa por vez até que ele conclua um conjunto completo de tarefas relacionadas.
Os agentes GPT prometem robôs especializados coordenados pelo GPT-5 e, esperançosamente, capazes de se autodirigir e lidar de forma autônoma com todos os subconjuntos de uma tarefa complexa. Concentre-se na “auto-motivação” e na “autonomia”.
Portanto, se o GPT-5 vier com agentes GPT, você poderá solicitar que ele “construa um site para o portfólio de Maxwell Timothy” em vez de apenas “escreva o código para a página inicial”. O GPT-5 seria então, teoricamente, capaz de iniciar prompts autônomos, convocando agentes especialistas em IA para lidar com as várias subtarefas necessárias para criar um site. Pode chamar um GPT para navegar na web em busca de informações sobre Maxwell Timothy, outro agente para escrever código para páginas diferentes, outro agente para criar e aprimorar imagens e até mesmo outro agente de IA para publicar o site, tudo sem exigir intervenção humana frequente por meio de Comandos. Verificar Vale a pena usar Auto-GPT sem GPT-4?
4. Menos alucinações
Embora a OpenAI tenha percorrido um longo caminho no tratamento das alucinações nos seus modelos de IA, o verdadeiro teste do GPT-5 será a sua capacidade de resolver o problema persistente das alucinações, que tem dificultado a adoção generalizada da IA devido aos elevados riscos associados. , especialmente em... Segurança crítica, como saúde, aviação e segurança cibernética. Todas estas são áreas que beneficiariam enormemente de um envolvimento intenso com a IA, mas que atualmente evitam qualquer adoção significativa.
# Sobre o "problema da alucinação"
Sempre tenho um pouco de dificuldade quando sou questionado sobre o "problema da alucinação" nos LLMs. Porque, em certo sentido, alucinação é tudo o que os LLMs fazem. São máquinas de sonhos.
Direcionamos seus sonhos com instruções. As instruções iniciam o sonho e com base no…
- Andrej Karpathy (@karpathy) 9 de dezembro de 2023
Para maior clareza, as alucinações neste contexto referem-se a situações em que um modelo de IA cria e apresenta informações que parecem plausíveis, mas são completamente fabricadas com um elevado grau de confiança. Verificar Métodos para prevenir alucinações em modelos de inteligência artificial.
Imagine um cenário onde o GPT-4 está integrado a um sistema de diagnóstico para analisar os sintomas dos pacientes e relatórios médicos. As alucinações podem levar a IA a fornecer com segurança um diagnóstico incorreto ou a recomendar um tratamento potencialmente perigoso com base em fatos imaginados e lógica falsa. As consequências de tal erro na área médica podem ser catastróficas.
Reservas semelhantes aplicam-se a outras áreas de grande preocupação, como a aviação, a energia nuclear, as operações marítimas e a cibersegurança. Não esperamos que o GPT-5 resolva completamente o problema das alucinações, mas esperamos que reduza significativamente a probabilidade de tais incidentes ocorrerem.
Enquanto aguardamos ansiosamente o lançamento oficial deste tão aguardado modelo de IA, uma coisa é certa: o GPT-5 tem o potencial de redefinir os limites do que é possível com a IA, anunciando uma nova era de colaboração e inovação homem-máquina. Agora você pode visualizar Os melhores geradores de sinistros inteligentes para qualquer formulário com tecnologia de IA.










