Lição 3 de 8 · 3 min

O sentido como proximidade: a pesquisa semântica

Os vetores servem também para encontrar um documento pelo seu sentido, sem partilhar uma única palavra com a pergunta.

ObjetivoExplicar como funciona uma pesquisa por similaridade e o que a distingue de uma pesquisa por palavras-chave.

O que vale para uma palavra vale para uma frase ou um parágrafo. Um modelo pode produzir um vetor para um excerto inteiro, que resume o seu sentido. Dois excertos que falam da mesma coisa com palavras diferentes obtêm vetores próximos.

É a base da pesquisa semântica. Calcula-se antecipadamente um vetor para cada excerto dos seus documentos. Quando faz uma pergunta, calcula-se o vetor dela e procuram-se os excertos mais próximos, em geral pela similaridade do cosseno, que mede o ângulo entre dois vetores.

Menos eficaz

Pesquisa por palavras-chave: «rescisão» não encontra um contrato que fala de «cessação antecipada do mandato».

Mais eficaz

Pesquisa semântica: a pergunta sobre a rescisão encontra o excerto sobre a cessação antecipada, porque os dois sentidos são próximos.

A proximidade diz respeito ao sentido, não às palavras exatas.

Os seus limites

  • Pode trazer um excerto próximo pelo tema mas errado no ponto preciso, por exemplo outro artigo do mesmo contrato.
  • Os números, as datas e as referências exatas encontram-se melhor por palavras-chave. Os bons sistemas combinam as duas abordagens.
  • A qualidade depende da divisão dos documentos em excertos.

Referências

  1. Mikolov, Chen, Corrado et al. (2013). Efficient Estimation of Word Representations in Vector Space. Pré-publicação no arXiv. arxiv.org/abs/1301.3781
  2. Devlin, Chang, Lee et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL-HLT 2019, p. 4171–4186. doi.org/10.18653/v1/N19-1423