O sentido como proximidade: a pesquisa semântica
Os vetores servem também para encontrar um documento pelo seu sentido, sem partilhar uma única palavra com a pergunta.
ObjetivoExplicar como funciona uma pesquisa por similaridade e o que a distingue de uma pesquisa por palavras-chave.
O que vale para uma palavra vale para uma frase ou um parágrafo. Um modelo pode produzir um vetor para um excerto inteiro, que resume o seu sentido. Dois excertos que falam da mesma coisa com palavras diferentes obtêm vetores próximos.
É a base da pesquisa semântica. Calcula-se antecipadamente um vetor para cada excerto dos seus documentos. Quando faz uma pergunta, calcula-se o vetor dela e procuram-se os excertos mais próximos, em geral pela similaridade do cosseno, que mede o ângulo entre dois vetores.
Pesquisa por palavras-chave: «rescisão» não encontra um contrato que fala de «cessação antecipada do mandato».
Pesquisa semântica: a pergunta sobre a rescisão encontra o excerto sobre a cessação antecipada, porque os dois sentidos são próximos.
A proximidade diz respeito ao sentido, não às palavras exatas.
Os seus limites
- Pode trazer um excerto próximo pelo tema mas errado no ponto preciso, por exemplo outro artigo do mesmo contrato.
- Os números, as datas e as referências exatas encontram-se melhor por palavras-chave. Os bons sistemas combinam as duas abordagens.
- A qualidade depende da divisão dos documentos em excertos.
Referências
- Mikolov, Chen, Corrado et al. (2013). Efficient Estimation of Word Representations in Vector Space. Pré-publicação no arXiv. arxiv.org/abs/1301.3781
- Devlin, Chang, Lee et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL-HLT 2019, p. 4171–4186. doi.org/10.18653/v1/N19-1423