Rotulagem, ou labeling, é o trabalho humano de anotar dados com a resposta certa: dizer "esta foto é um gato", "este e-mail é spam", "este sentimento é negativo". Sem rotulagem, aprendizado supervisionado não acontece.
É um trabalho subestimado mas crítico: empresas investem milhões em modelos sofisticados que falham porque os dados de treino foram rotulados às pressas, com critérios inconsistentes ou por anotadores sem treinamento.
Tipos de rotulagem
- Classificação: escolher uma categoria (spam/não-spam).
- Detecção: marcar caixas em torno de objetos numa imagem.
- Segmentação: pintar pixel a pixel as regiões da imagem.
- Anotação de texto: marcar entidades (pessoas, locais), sentimentos, intenções.
- Ranking: ordenar respostas por qualidade (usado em RLHF).
Quem rotula
- Anotadores internos: equipe da própria empresa. Caro, mas qualidade alta.
- Crowdsourcing (Mechanical Turk, Scale AI, Surge): trabalhadores remotos no mundo todo. Barato, qualidade variável.
- Especialistas (médicos, advogados): para domínios técnicos. Caro mas insubstituível.
- Active learning: o modelo escolhe quais exemplos rotular para maximizar aprendizado por rótulo.
- Pseudo-labeling com IA: usar um modelo grande para rotular, humanos só revisam.
Boas práticas
- Guidelines claros: documentar critérios com exemplos.
- Múltiplos anotadores por exemplo: medir concordância (Cohen's kappa).
- QA contínuo: revisar amostras regularmente.
- Dataset cards: documentar quem rotulou, como, com quais vieses.
Um exemplo para praticar
Imagine uma loja fictícia que classifica mensagens em pedido, troca e dúvida sobre o produto. Escreva uma regra para cada categoria e inclua casos ambíguos, como “quero trocar, mas ainda não recebi”. Duas pessoas rotulam a mesma amostra sem consultar a resposta da outra; depois comparam as divergências e revisam a regra.
Uma tabela útil guarda o texto anonimizado, a categoria, a justificativa e a dúvida pendente. Não é necessário citar uma empresa real para demonstrar esse processo. O exemplo é didático e não representa operação, custo ou resultado de cliente.
Modelos podem sugerir rótulos, mas uma sugestão não vira verdade só por ter sido gerada automaticamente. Revise os casos limítrofes e documente as mudanças de critério antes de usar a amostra para treinar ou avaliar um sistema.