Pesquisa de IA
50 articles
GPT-6 Astra publica pontuação ARC-AGI-3 de última geração, supera os humanos em eficiência de ação
O Prêmio ARC relata que o GPT-6 Astra obteve 99,9% no ARC-AGI-3 com equipamento de provedor e 62,7% sob regras padrão, superando a eficiência da ação humana em 96% dos níveis.
Google DeepMind lança WeatherNext 3, um modelo meteorológico de IA com previsões horárias de 5 km
O WeatherNext 3 do Google DeepMind fornece previsões meteorológicas de IA de hora em hora com resolução de 5 km usando dados de satélite ao vivo, agora disponíveis em Search, Maps, Gemini e Cloud.
NSF concede US$ 35 milhões para lançar centro nacional de operações de recursos de pesquisa de IA liderado por SDSC e TACC
A National Science Foundation concedeu US$ 35 milhões ao longo de cinco anos ao SDSC da UC San Diego e ao TACC da UT Austin para administrar o Centro de Operações NAIRR, fazendo a transição do recurso de pesquisa de IA de infraestrutura piloto para infraestrutura permanente.
Astra da OpenAI usará raciocínio de “profundidade recorrente” e especialistas em segurança estão alarmados
As informações relatam que o Astra da OpenAI usará um raciocínio de “profundidade recorrente” que poderia tornar sua cadeia de pensamento mais difícil de monitorar, alarmando os especialistas em segurança.
World Labs de Fei-Fei Li revela Atlas, um modelo mundial Omni para inteligência espacial
O Atlas do World Labs é um transformador de difusão autoregressivo multimodal que gera, reconstrói e simula mundos 3D a partir de texto, imagens e vídeo.
IA 'sobre-humana' detecta doenças cardíacas em menos de 2 segundos em um ECG de rotina
Uma ferramenta de IA treinada em milhões de ECGs detectou até 90% dos casos de doenças valvulares cardíacas em um ensaio com 67.000 pacientes, oferecendo rastreamento rápido para pacientes que enfrentam esperas de um mês.
Anthropic abre 10.000 vagas Claude gratuitas para cientistas em IA expandida para impulso científico
A Anthropic dará a 10.000 cientistas assinaturas gratuitas do Claude e até US$ 50.000 em créditos de IA para Ciência por projeto, ao mesmo tempo em que mantém as salvaguardas biológicas em vigor.
Pesquisadores automatizados da Anthropic mostram que a IA pode corrigir suas próprias falhas de alinhamento
O novo artigo da Anthropic diz que os pesquisadores automatizados de IA melhoraram o alinhamento em todos os 10 benchmarks de teste a US$ 4 por hora, contra US$ 150 por hora para pesquisadores humanos.
Incidentes de perda de controle de IA quase dobraram em julho, descobriu uma pesquisa apoiada pelo Reino Unido
Os incidentes de perda de controle de IA atingiram mais de 300 em julho, quase o dobro da contagem de junho, com 1.600 casos em 2026, de acordo com relatórios X de monitoramento de pesquisa financiados pela AISI do Reino Unido.
Cocientista de IA do Google DeepMind agora planeja experimentos, opera equipamentos de laboratório e escreve artigos
O Google DeepMind expandiu seu cocientista de IA para um parceiro de laboratório de circuito fechado que projeta experimentos, controla equipamentos de laboratório e escreve artigos de pesquisa.
Agentes OpenAI exploraram falha do kernel do Linux para fazer root em seus próprios sistemas, revela relatório
O relatório de incidente da OpenAI diz que os agentes de IA usaram uma exploração pública para CVE-2026-53362 para obter acesso root na infraestrutura da empresa, solicitando uma listagem CISA KEV.
Terminal-Bench-Science liderado por Stanford testa agentes de IA em fluxos de trabalho de pesquisa reais - Melhor modelo pontua 30%
Terminal-Bench-Science 0.1, um benchmark liderado por Stanford de 70 tarefas científicas com curadoria de especialistas, descobre que até mesmo o agente de IA mais forte, Claude Opus 5, resolve apenas 30% dos fluxos de trabalho reais de pesquisa.
Google DeepMind pilota as primeiras avaliações duplo-cegas de IA do mundo para superar a contaminação de benchmark
A caixa de avaliação criptográfica da DeepMind mantém os pesos do Gemini e os prompts de testes externos mutuamente privados, em um piloto inédito com o instituto de segurança de IA de Cingapura.
OpenAI rastreia o hack do agente Hugging Face até o hacking de recompensas da era do treinamento: modelos foram inadvertidamente ensinados a trapacear
O novo relatório técnico da OpenAI diz que os agentes que hackearam o Hugging Face foram recompensados por trapacear e se comunicar durante o treinamento – e a solução não virá da noite para o dia.
A primeira cirurgia de tumor cerebral assistida por IA do mundo salva a visão do paciente de Londres
Cirurgiões do NHNN de Londres removeram um tumor cerebral de 11 mm com orientação de IA ao vivo que codificava por cores a anatomia crítica, salvando a visão do paciente Rhys Hibbert.
O Google usou o Gemini para reescrever uma biblioteca C onipresente – e evitou um dia zero antes de ser relatado
O Google usou o Gemini para reescrever a biblioteca de imagens C giflib no Rust, validou-a em 30 milhões de GIFs e ficou imune ao CVE-2026-26740 antes da divulgação.
Agentes de IA se conformam espontaneamente com a opinião da maioria – e a pressão dos colegas pode alterar seus valores, conclui estudo
Os pesquisadores de Konstanz descobriram que os agentes de IA seguem a maioria como partículas magnetizadas, cedem à pressão dos pares no estilo Asch e podem ser transformados em desalinhamento coletivo.
Agentes de IA estreitam lacuna com o registro humano no teste NanoGPT Speedrun da Prime Intellect
A Prime Intellect realizou 153 pesquisas autônomas de IA no speedrun nanoGPT. O melhor agente fechou 81,7% da lacuna em relação ao registro humano. Tabela de classificação completa.
Modelos abertos de IA estão capturando modelos de fronteira fechada na metade do tempo, constata SemiAnalysis
A SemiAnalysis descobre que os modelos de IA de peso aberto agora correspondem aos modelos de fronteira fechada na metade do tempo com cada era LLM, aumentando a ameaça às margens dos laboratórios de fronteira.
DeepMind Alumni's Faraday Agent Beats Claude Opus 4.8 and GPT-5.5 at Replicating Research
London startup Inherent says its Faraday agent, built on a 27-billion-parameter Qwen 3.6 model, beat frontier systems at reproducing science papers.
Estudo de lição de casa de IA: pontuação aumenta 18%, desempenho no exame cai 20%
Um estudo com 27.000 estudantes chineses descobriu que a IA aumentou as notas dos trabalhos de casa em 18%, enquanto as notas dos exames caíram 20%, já que a maioria dos utilizadores terceirizou inteiramente as tarefas.
Google DeepMind leva sua pesquisa de IA de jogos para o universo persistente de 23 anos de EVE Online
O Google DeepMind detalha como 15 anos de pesquisa de IA em jogos, do Atari ao AlphaStar, agora se estendem ao EVE Online com a Fenris Creations.
Agente AVO da Nvidia atinge 100% no ARC-AGI-3 com Claude Opus 5 – Prova de que o chicote agora supera o modelo
A arquitetura de agente AVO da Nvidia levou Claude Opus 5 a uma pontuação ARC-AGI-3 perfeita de 100% em todos os 183 níveis – o mesmo modelo obteve apenas 30% sozinho.
Terence Tao diz que a IA está levando a matemática ao seu maior patamar desde Gödel
O novo ensaio do Medalhista Fields argumenta que a IA está testando a resistência dos valores não escritos da matemática – o que conta como uma contribuição e quem realmente fez o trabalho.
Claude projeta ligantes de proteínas funcionais, bem como os principais especialistas humanos, afirma a Anthropic
A Anthropic diz que Claude projetou ligantes de proteínas funcionais para 14 dos 15 alvos com o dobro da taxa de acerto típica e analisou dados químicos brutos em minutos.
LLMs são 'camaleões ideológicos': estudo descobre que todos os 21 modelos testados refletem a política dos usuários
Um estudo da Scientific Reports com 47.376 respostas revela que todos os 21 grandes modelos de linguagem mudam a sua postura política para corresponder aos utilizadores, arriscando câmaras de eco.
Estudo do MIT descobre que imagens geradas por IA muitas vezes não podem ser atribuídas a nenhum dado de treinamento
Uma pesquisa do MIT publicada na Nature Communications mostra que os resultados do modelo de difusão tornam-se inatribuíveis em escala, complicando os litígios de direitos autorais de IA.
The Benchmarkpocalypse: Dan Luu mostra como os agentes de IA comparam silenciosamente o desempenho do jogo
O engenheiro Dan Luu demonstra que os agentes de IA podem superar facilmente os principais conjuntos de benchmark, produzindo falsos ganhos de desempenho – e falsas afirmações de pesquisa de IA.
Pesquisadores treinaram um LLM apenas com material de quinta série – e encontraram seu teto de capacidade
LittleLearner, um modelo 5B treinado apenas em um currículo K-5, mostra que o escalonamento e o pós-treinamento ampliam o conhecimento, mas não consegue ir além do que o pré-treinamento forneceu.
Novo relatório de risco da Anthropic aumenta classificação de desalinhamento e revela ‘Modelo 2’ arquivado
O segundo Relatório de Risco da Anthropic eleva o risco de desalinhamento catastrófico para “baixo” e revela um modelo interno mais forte e não divulgado que ela afirma não enviar.
O compilador HEIR do Google traz criptografia homomórfica para inferência privada de IA
O Google apresenta o HEIR, um compilador de código aberto que executa inferência de IA diretamente em dados criptografados para IA criptograficamente privada.
Anthropic desencadeia agentes de IA na mesma tarefa e eles iniciam uma guerra territorial
A nova pesquisa multiagente da Anthropic mostra agentes Claude conspirando sobre preços, inundando filas de trabalho e implantando malware auto-replicável para sabotar rivais.
Pesquisadores roubam raciocínio oculto de IA de traços criptografados de cadeia de pensamento em Claude, GPT e Gemini
Os pesquisadores decodificaram 315.320 blocos de raciocínio criptografados de repositórios públicos, expondo 182 credenciais e 367 artefatos PII nos principais provedores de IA.
AMIE AI do Google combina médicos em consultas médicas por vídeo em tempo real em estudo histórico
O sistema de IA de vídeo AMIE do Google Research demonstrou desempenho de nível especializado em consultas clínicas por vídeo em tempo real, combinando médicos certificados em métricas-chave em um estudo randomizado.
Claude, da Anthropic, faz avanços matemáticos inesperados na função Riemann Zeta, elevando o limite de 41,6% para 67,2%
Uma versão de pesquisa inédita de Claude da Anthropic melhorou um limite inferior de longa data da função zeta de Riemann de 41,6% para 67,2% após um desafio improvisado para resolver um dos maiores problemas em aberto da matemática.
AI Model Evo gera 16 novos vírus do zero em estudo científico histórico
Os cientistas de Stanford e do Arc Institute usaram o modelo Evo AI para projetar 16 bacteriófagos viáveis do zero, com resultados publicados na revista Science.
Agentes de IA consomem cerca de 600 vezes mais energia do que um prompt de bate-papo, revela nova análise
A auditoria Claude Code de oito semanas do cientista climático Zeke Hausfather descobriu que os agentes de IA usam cerca de 600 vezes mais energia por solicitação do que uma simples consulta de bate-papo, expondo uma grande lacuna nas alegações de baixo consumo de energia da Big Tech.
Departamento de Energia dos EUA lança iniciativa Genesis Open Models para descoberta científica baseada em IA
A iniciativa Genesis Open Models do DOE revela Genesis-Science-1 com Arcee, oferecendo modelos de IA de peso aberto para acelerar pesquisas de materiais, energia, fusão e biologia.
IA projeta 16 vírus viáveis não encontrados na natureza, relatório de pesquisadores de Stanford e do Broad Institute
Pesquisadores de Stanford e do Broad Institute usaram IA generativa para criar 16 vírus funcionais que matam bactérias, publicando o primeiro resultado desse tipo na Science.
Stanford AI projeta 16 novos vírus não encontrados na natureza, aumentando o alarme de biossegurança
Os cientistas de Stanford usaram modelos de linguagem genômica para projetar 16 bacteriófagos sintéticos que infectam bactérias, os primeiros genomas virais completos projetados por IA. Especialistas pedem nova supervisão.
O modelo de IA do Google WeatherNext 2 oferece aos meteorologistas um dia extra de aviso de ciclone
O modelo WeatherNext 2 AI do Google DeepMind oferece mais de 24 horas de tempo extra para ciclones, corresponde a uma década de progresso e agora é de código aberto. Publicado na Natureza.
Claude Fable 5 da Anthropic refuta uma conjectura matemática de 87 anos com uma pequena fórmula
Um matemático antrópico usou o modelo Claude Fable 5 para encontrar um contra-exemplo para a conjectura jacobiana, derrubando um problema que existe desde 1939.
NSF lança centros de infraestrutura de IA estaduais e regionais de US$ 100 milhões para espalhar a computação pela América
O novo programa de centros de infraestrutura de IA estaduais e regionais da National Science Foundation, no valor de US$ 100 milhões, financiará até 10 consórcios para ampliar o acesso à computação de IA para pesquisa e treinamento de força de trabalho.
Anthropic descobre modelos de IA de fronteira sabotando código secretamente e auxiliando na fraude em novo estudo de alinhamento
A equipe de Alignment Science da Anthropic documenta quatro novas falhas de desalinhamento de agentes em modelos de fronteira de seis empresas, incluindo sabotagem de código secreto e assistência a fraudes.
Orchard de código aberto da Microsoft, uma estrutura de IA de agente onde pequenos modelos rivalizam com sistemas de fronteira
A Microsoft Research lançou o Orchard, uma estrutura de código aberto para treinar agentes de IA. Seu modelo de 3 bilhões de parâmetros atinge 69,7% no SWE-bench Verified, aproximando-se dos sistemas de fronteira.
Agentes de codificação de IA modernizam software de pesquisa sobre envelhecimento, mas não conseguem dizer se a ciência está certa
Um relatório de campo da OpenAI e de parceiros acadêmicos mostra que os agentes de codificação de IA podem reconstruir ferramentas de pesquisa de décadas atrás até 60 vezes mais rápido, mas permanecem “confiantemente errados” em termos de precisão científica.
O modelo ‘Astra’ da OpenAI resolve 10 problemas matemáticos abertos por menos de US$ 2.000 em computação
A OpenAI diz que seu modelo ‘Astra’ não lançado resolveu 10 problemas de matemática e ciência da computação anteriormente não resolvidos por menos de US$ 2.000 em computação, apresentando-o aos senadores dos EUA como um possível GPT-6.
Ranking de segurança de IA da FAR.AI revela diferença de cem vezes nas proteções de modelos de IA de fronteira
O novo ranking de segurança de IA da FAR.AI constatou que Claude Fable 5 e GPT-5.6 Sol resistiram a jailbreaks, enquanto Grok 4.5 e Gemini 3.1 Pro foram quebrados por menos de 300 dólares cada um, expondo uma enorme lacuna de segurança entre os modelos de fronteira.
Pesquisador demonstra verme de IA que se autopropaga no Microsoft Copilot para Word
Uma divulgação coordenada mostra que instruções ocultas podem se propagar por documentos do Word via Copilot, copiando a si mesmas e sobrevivendo a uma atualização do modelo para o GPT-5.6.
Modelo Claude ‘Mythos’ da Anthropic encontra falhas reais na criptografia que protege a Internet
A Anthropic diz que seu modelo Claude Mythos Preview descobriu fraquezas genuínas nos algoritmos de criptografia AES e HAWK, incluindo uma cifra pós-quântica que os humanos revisaram por dois anos.
