Conversión de datos al formato SQuAD para ajustar modelos LLM
| LINKEDIN | Twitter | MEDIO | SUBPILA |
Equipo
SQuAD (Stanford Question Answering Dataset ) es un formato popular para entrenar y evaluar modelos de lenguaje como LLM (Large Language Models) para tareas de respuesta a preguntas.
El formato SQuAD incluye un conjunto de pasajes de contexto y preguntas correspondientes que están asociadas con una respuesta específica. Cada pasaje de contexto va acompañado de una lista de preguntas y la(s) respuesta(s) correspondiente(s) para cada pregunta. En formato SQuAD, el pasaje de contexto y la pregunta se proporcionan como cadenas, mientras que la respuesta se representa como un espacio de texto. A continuación se muestra un ejemplo de los datos en formato SQuAD.
{
"data": [
{
"paragraphs": [
{
"context": "The quick brown fox jumps over the lazy dog.",
"qas": [
{
"question": "What does the fox jump over?",
"id": "q1",
"answers": [
{
"text": "the lazy dog",
"answer_start": 32
}
]
}
]
}
],
"title": "Example"
}
],
"version": "2.0"
}
anotación de texto
La anotación de texto es el proceso de agregar información estructurada a datos de texto no estructurados para que sea más comprensible y útil para las aplicaciones posteriores. En el contexto de LLM (modelos de lenguaje grande), la anotación de texto se usa a menudo para entrenar y mejorar la precisión de estos modelos para tareas específicas de procesamiento de lenguajes naturales, como el reconocimiento de entidades nombradas, el etiquetado de partes del discurso y el análisis de sentimientos.
Hay varios tipos de anotaciones de texto que se usan comúnmente en LLM, que incluyen:
Reconocimiento de entidades nombradas (NER): NER implica identificar y clasificar entidades nombradas en el texto, como personas, organizaciones, ubicaciones y fechas.
Etiquetado de parte del discurso (POS): el etiquetado de POS consiste en etiquetar cada palabra en una oración con su parte del discurso correspondiente, como sustantivo, verbo, adjetivo o adverbio.
Análisis de dependencia : el análisis de dependencia implica identificar las relaciones sintácticas entre las palabras en una oración, como sujeto-verbo u objeto-preposición.
Análisis de sentimiento : el análisis de sentimiento implica identificar la polaridad (positiva, negativa o neutra) de una oración o documento.
Resolución de correferencia : La resolución de correferencia implica identificar cuando dos o más palabras o frases en un texto se refieren a la misma entidad.
La anotación de texto generalmente la realizan manualmente anotadores humanos, aunque también hay algunas herramientas automatizadas disponibles que pueden ayudar con ciertos tipos de anotaciones. Los datos de texto anotados resultantes se pueden usar para entrenar y mejorar la precisión de los modelos LLM para tareas específicas de procesamiento de lenguaje natural.
Convirtamos nuestros datos sin procesar al formato SQuAD. Hay muchas formas en que podemos hacer esta conversión, pero te cuento lo que he explorado.
Paso 1:
Finaliza tu conjunto de datos
Finalice los documentos de texto que desea enviar a los modelos LLM para realizar ajustes. luego trae todas las cosas a una carpeta común.
Paso 2:
Ve a la herramienta de anotación Haystack y regístrate
enlace: herramienta de anotación Haystack
Obtendrá una ventana como esta. Puedes ver proyectos y otras opciones.
En la esquina derecha, verá una ventana como esta.
Cree un nuevo proyecto y asígnele un nombre propio.
Paso 3:
Desde acciones, vaya dentro del proyecto. Luego haga clic en importar
Arrastra tus documentos aquí.
Haga clic en agregar preguntas personalizadas.
Seleccione un párrafo donde haya una respuesta a su pregunta. Seleccione la categoría de respuesta como breve, concisa, SÍ o NO. [Estas cosas que Haystack agregó recientemente].
Etapa 4:
Después de crear todas las preguntas, expórtelas en su formato requerido [Excel, CSV y SQaAD].
Lo exportaremos en SQuAD.
Como se muestra, el archivo inicial es un archivo de texto puro [no estructurado], y debajo de eso, puede ver un archivo JSON convertido en formato SQuAD [estructurado]. Básicamente, estamos asignando etiquetas al texto como lo hacemos en el aprendizaje supervisado. Después de esto, puede enviar este archivo a cualquier modelo como BERT, etc.
Si has encontrado este artículo revelador
Es un hecho comprobado que “ La generosidad te hace una persona más feliz ”; por lo tanto, dale aplausos al artículo si te ha gustado. Si este artículo te ha resultado útil, sígueme en Linkedin y medium . También puedes suscribirte para recibir notificaciones cuando publique artículos. ¡Creemos una comunidad! ¡Gracias por su apoyo!
Puedes leer mis otros blogs relacionados con:
Cómo elegir el mejor algoritmo para su proyecto de aprendizaje automáticocerrar sesión,
chinmay
CONVIÉRTETE EN ESCRITOR en MLearning.ai
Sugerencias de envío de Mlearning.ai
![¿Qué es una lista vinculada, de todos modos? [Parte 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































