Schema Dataset para publicar dados abertos citáveis
O schema Dataset descreve um conjunto de dados para que o Google Dataset Search o encontre, e o Google exige nele só name e description. O que torna os dados reutilizáveis são as propriedades recomendadas, como distribution com o arquivo, license e temporalCoverage. Nos benchmarks que publiquei em 2026, cada estudo sai com arquivos em CSV e JSON sob licença CC BY 4.0. Nenhuma marcação garante citação por IA, mas dado próprio, datado e aberto oferece um fato que não existe em outro lugar.
Principais pontos
- O Google exige name e description no Dataset, e a descrição precisa ter entre 50 e 5.000 caracteres.
- O Google Dataset Search saiu da fase beta em 23 de janeiro de 2020, com quase 25 milhões de conjuntos de dados indexados.
- A documentação do Google recomenda identificar o criador pessoa pelo ORCID no sameAs e a instituição pelo ROR.
- O benchmark de agências de GEO de setembro de 2026 publicou a tabela por sinal técnico em CSV e os dados completos em JSON, sob licença CC BY 4.0.
- O artigo que introduziu o GEO, aceito no KDD 2024, relatou aumento de até 40% na visibilidade em respostas de motores generativos.
O que o Google exige e recomenda no Dataset?
O schema Dataset tem só dois campos obrigatórios na documentação do Google, name e description. A descrição precisa ter entre 50 e 5.000 caracteres, aceita Markdown, e o Dataset Search usa apenas os primeiros 5.000 caracteres de qualquer campo de texto. O resto é recomendado, e é justamente o que separa um cartão de catálogo de um dado que alguém consegue baixar e reusar.
| Propriedade | Status | O que o Google pede |
|---|---|---|
| name | Obrigatório | Nome descritivo e único para cada conjunto |
| description | Obrigatório | Resumo de 50 a 5.000 caracteres |
| distribution | Recomendado | DataDownload com contentUrl obrigatório e encodingFormat |
| license | Recomendado | URL da licença ou CreativeWork com licença própria |
| temporalCoverage | Recomendado | Data ou intervalo em ISO 8601, com .. para intervalo aberto |
| creator | Recomendado | Person com ORCID no sameAs, ou Organization com ROR |
| identifier | Recomendado | DOI ou identificador compacto, repetido se houver mais de um |
| isAccessibleForFree | Recomendado | Verdadeiro quando o acesso não exige pagamento |
O Google recomenda pôr a marcação na página canônica de cada conjunto e usar sameAs nas cópias que aparecem em listagens.
Um nó Dataset para o benchmark de agências
Um nó Dataset útil liga o arquivo, a licença, o período da coleta e o pesquisador em poucos campos. Para o benchmark de agências de GEO, com as rodadas feitas entre 28 de agosto e 14 de setembro de 2026, o desenho que recomendo fica assim:
{
"@type": "Dataset",
"@id": "https://lucasferrazseo.com/blog/benchmark/prontidao-ia-agencias-geo/#dataset",
"name": "Prontidão para IA das agências de GEO no Brasil (2026-09)",
"license": "https://creativecommons.org/licenses/by/4.0/",
"isAccessibleForFree": true,
"temporalCoverage": "2026-08-28/2026-09-14",
"creator": { "@id": "https://lucasferraz.com/#person" },
"distribution": [
{ "@type": "DataDownload", "encodingFormat": "text/csv",
"contentUrl": "https://lucasferrazseo.com/wp-content/uploads/2026/09/prontidao-ia-agencias-geo-2026-09.csv" },
{ "@type": "DataDownload", "encodingFormat": "application/json",
"contentUrl": "https://lucasferrazseo.com/wp-content/uploads/2026/09/prontidao-ia-agencias-geo-2026-09.json" }
]
}
O @id do dataset tem casa no domínio da agência, onde o relatório completo foi publicado, e a ficha do estudo neste site aponta para ele como referência tipada. A pessoa entra por @id, e o nó completo dela, com o ORCID no sameAs, fica na Home deste site.
O Dataset Search e o que ele indexa
O Google Dataset Search indexa as descrições de conjuntos de dados marcadas com schema.org e leva quem busca até o lugar onde os dados estão. O serviço saiu da fase beta em 23 de janeiro de 2020, com quase 25 milhões de conjuntos indexados, mais de 6 milhões deles em formato de tabela. O anúncio de Natasha Noy, do Google Research, repetia a regra de entrada: quem publica dados fica encontrável ao descrever o conjunto com o padrão aberto na própria página.
A DataCite, que registra DOIs de dados de pesquisa, resume as condições em duas: a página usa a classe Dataset e é alcançável por navegação ou sitemap. A mesma documentação avisa que DOIs registrados com o tipo Text, em vez de Dataset, não aparecem no Dataset Search. Artigo e dados são nós diferentes, e o relatório de um benchmark não vira dataset só porque tem uma tabela no meio.
Por que pesquisa própria é citável?
Um dado próprio, datado e aberto é um fato que só existe em uma fonte, e quem o repete precisa citar a origem. O guia de IA generativa do Google, atualizado em julho de 2026, pede conteúdo com ponto de vista único e diferencia o conteúdo commodity, baseado em conhecimento comum, do conteúdo que vai além do óbvio. A página de conteúdo útil do Search Central pergunta se o texto traz informação, pesquisa ou análise originais.
Um dado próprio, datado e aberto é um fato que só existe em uma fonte, e quem o repete precisa citar a origem.
Lucas Ferraz, especialista em SEO
Do lado acadêmico, o artigo que introduziu o GEO, aceito no KDD 2024, relatou aumento de até 40% na visibilidade em respostas de motores generativos com otimizações de conteúdo, e mostrou que a eficácia varia por domínio. Nos meus estudos, os números centrais só existem nos arquivos publicados: 8 de 19 agências com llms.txt curado, 82 marcas em 24 rodadas de recomendação, 4 de 25 escritórios de advocacia em mais de uma IA. Detalhes nas fichas do benchmark de agências e do benchmark de advocacia.
O que conferir antes de publicar os dados?
A publicação de dados abertos passa por seis conferências antes de o Dataset ir ao ar. Nenhuma delas garante citação, mas cada uma remove um motivo para o dado ser ignorado ou mal usado.
- Licença explícita por URL no campo license e em texto na página.
- Arquivo com URL estável, com a data no nome, porque a próxima edição não substitui a anterior.
- temporalCoverage igual ao período real da coleta, e não à data de publicação.
- Método e limitações ao lado dos números, com o tamanho da amostra.
- Criador identificado, com ORCID quando for pessoa.
- Um @id por conjunto, com o nó completo só na página-casa do relatório, que no caso dos benchmarks é o relatório da agência.
O que a IA desdobra desta pergunta?
Quando alguém faz esta busca em uma IA, o sistema abre subperguntas antes de responder. Estas são as que apareceram na medição, e onde cada uma é respondida.
Perguntas frequentes
O schema Dataset faz os dados aparecerem no Google Dataset Search?
Deixa o conjunto elegível, sem garantia de inclusão. O Google diz que os dados ficam mais fáceis de encontrar quando nome, descrição, criador e formatos de distribuição estão em dados estruturados na página. A página também precisa ser rastreável, e a DataCite recomenda sitemap para que o Google ache as páginas de cada conjunto.
Qual licença usar em dados abertos de pesquisa de SEO?
Uma licença padrão, indicada por URL no campo license, evita dúvida sobre reuso. Nos meus benchmarks uso CC BY 4.0, que permite copiar e adaptar com atribuição. O Google aceita tanto a URL de uma licença conhecida quanto um CreativeWork que descreva uma licença própria, mas a conhecida é mais simples de interpretar.
Como preencher temporalCoverage em uma pesquisa feita em rodadas?
Com o intervalo real da coleta, no padrão ISO 8601, início e fim separados por barra. As rodadas do benchmark de agências de GEO foram de 28 de agosto a 14 de setembro de 2026, então o valor fica 2026-08-28/2026-09-14. Para coleta contínua, o Google aceita intervalo aberto, com dois pontos-finais no lugar da data final.
Fontes citadas
- Google Search Central, dados estruturados de Dataset (2026)
- Google, Discovering millions of datasets on the web (Natasha Noy) (2020)
- DataCite, landing pages e Google Dataset Search (2026)
- Google Search Central, criação de conteúdo útil, confiável e feito para pessoas (2025)
- Aggarwal e outros, GEO, Generative Engine Optimization (arXiv, KDD 2024) (2024)
- Google Search Central, guia de otimização para recursos de IA generativa (2026)
- Prontidão para IA das agências de GEO no Brasil (benchmark, dados abertos) (2026)
Versão em markdown para agentes de IA: https://lucasferraz.com/blog/schema-dataset-e-dados-abertos/md/