













Este trabalho propõe a identificação de vieses sociais em português nos modelos GPT-4o, GPT-4o-mini, Sabiá-3 e Sabiázinho-3, utilizando a métrica de estima a fim de avaliar o nível de respeito e deferência dos modelos sobre diferentes grupos demográficos. A avaliação abrange sujeitos com marcadores sociais explícitos de género, raça e região brasileira, em condições com e sem o uso de uma técnica de contorno das restrições de moderação (jailbreaking). Os achados mostram que os modelos de linguagem avaliados reproduzem padrões sistemáticos de valoração diferenciada entre grupos sociais, revelando vieses de estima associados a marcadores de gênero, raça e região no português brasileiro. Sujeitos com marcadores sociais enfatizados, especialmente os de raça, tendem a receber estimas mais baixas. A utilização da técnica de jailbreaking não apresentou um impacto uniforme, podendo tanto ampliar quanto reduzir as diferenças de estima.
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。