Tutoriales

14 principales LLM de código abierto para investigación y uso empresarial

Los modelos de lenguaje grande (o LLM) son modelos de aprendizaje automático (Construido sobre una red neuronal transformadora) está diseñado para resolver problemas de lenguaje como autocompletado, clasificación de texto y generación de texto. Es un subconjunto del aprendizaje profundo.

«Grande» significa que el modelo se entrena previamente con grandes cantidades de datos (quizás petabytes), acompañado de millones o miles de millones de parámetros, y se ajusta aún más para casos de uso específicos.

Si bien el LL.M. hace posibles cursos como ChatGPT y Google Gemini, son propietarios. Por lo tanto, hay una falta de transparencia y todo el control del LLM (y su uso) queda a discreción exclusiva de la empresa propietaria.

Entonces, ¿hay alguna forma de solucionar este problema? LL.M. de código abierto.

Con Open Source LLM, puede obtener una variedad de beneficios, como Transparencia, sin dependencia de proveedores, gratuito para fines comerciales y control total sobre la personalización del modelo (en términos de rendimiento, huella de carbono, etc.).

Razones similares por las que necesitamos una alternativa al chatbot ChatGPT de código abierto:

Las 13 mejores alternativas de ChatGPT de código abierto

¿Busca una alternativa ChatGPT de código abierto? Hemos seleccionado algunos de los mejores para que los consultes.

📋

Como promotores del código abierto, no estamos solos. IBM, Meta, Intel, AMD, CERN, Hugging Face y muchas más empresas reconocen el concepto de innovación abierta en inteligencia artificial y propusieron la Alianza de Inteligencia Artificial en 2023.

Ahora que sabe por qué necesitamos un LLM de código abierto, permítame resaltar algunos de los mejores LLM disponibles.

1.Halcón 180B

El Instituto de Innovación Tecnológica (TII) de los Emiratos Árabes Unidos (EAU) ha lanzado un LL.M abierto que se está desempeñando cerca de sus rivales propietarios.

El modelo contiene 180 mil millones de parámetros y fue entrenado utilizando 3,5 billones de tokens.

Dentro de la familia de modelos Falcon AI, hay modelos más pequeños/más nuevos, como el Falcon 2 11B, que es una solución escalable y supera a modelos similares de Meta y Google.

💡

parámetro: 180 mil millones
licencia: Licencia Falcon-180B TII (basada en Apache 2.0)
uso: El uso comercial está permitido y debe ajustarse para tareas específicas

2. Carro 2.0

Dolly 2.0 es uno de los modelos LLM de código abierto más conocidos desarrollado por Databricks, ajustado en un conjunto de datos de instrucciones generado por humanos. A diferencia de su predecesor, este conjunto de datos es un conjunto de datos sin procesar, generado por los más de 5.000 empleados de la empresa.

Contiene 12 mil millones de parámetros y es adecuado para resúmenes, control de calidad, clasificación y algunas lluvias de ideas. El propósito de Dolly 2.0 no es competir con los modelos existentes, sino centrarse más en proporcionar conjuntos de datos generados por humanos, así como LL.M. Afirmaron que era el primer producto de este tipo que intentaba imitar las interacciones ChatGPT en ese momento.

💡

parámetro: 12 mil millones
licencia:Instituto de Tecnología de Massachusetts
uso: Se permite la investigación y el uso comercial.

📋

Muchos LL.M. de código abierto ofrecen variaciones del modelo, ajustados para tareas específicas. Tendrás que verificar su licencia; puede ser diferente a la que se enumera aquí.

3. Cerebras-GPT

Estadísticas de GPT de Cerebras

Cerebras-GPT es una familia de siete modelos LLM de código abierto GPT-3 con parámetros que van desde 111 millones a 13 mil millones de parámetros.

Estos modelos están diseñados para mejorar la precisión, acortar el tiempo de entrenamiento, reducir costos y consumir menos energía. Se entrena utilizando la fórmula Chinchilla de DeepMind.

💡

parámetro: 12 mil millones
licencia:apache 2.0
uso: Permite la investigación y el uso comercial, y está optimizado para interacciones similares a ChatGPT.

4. florecer

Bloom es un modelo LLM multilingüe de acceso abierto que se puede entrenar para continuar el texto basándose en indicaciones y se puede entrenar para otras tareas basadas en texto.

El modelo contiene 176 mil millones de parámetros y se puede generar en 46 lenguajes diferentes y 13 lenguajes de programación.

💡

parámetro:176 mil millones
licencia: Licencia ferroviaria v1.0
uso: Se permiten entidades de investigación y no comerciales.

5.DLite V2

página de cara de abrazo dlite

DLite de AI Squared tiene como objetivo proporcionar un LL.M. liviano que puede usar en casi cualquier lugar.

La familia de modelos contiene entre 123 millones y 1,5 mil millones de variaciones de parámetros. Utiliza la misma base de datos que Databricks creó para Dolly 2.0. Por lo tanto, está optimizado para el mismo caso de uso.

💡

parámetro: 1,5 mil millones
licencia:apache 2.0
uso: Permite la investigación y el uso comercial, y está optimizado para interacciones similares a ChatGPT.

6.MPT-7B

MPT7B

MPT-7B es otro modelo famoso de código abierto de Databricks. A diferencia del Dolly 2.0, compite y supera al LLaMA-7B de Meta en muchos aspectos.

El modelo se entrena utilizando un conjunto de datos mixtos de diferentes fuentes, incluidos 6,7 mil millones de parámetros. También pretende ser una alternativa económica a los modelos LL.M de código cerrado disponibles.

💡

parámetro: 6,7 mil millones
licencia:apache 2.0
uso: Permite la investigación y el uso comercial, y está optimizado para interacciones similares a ChatGPT.

7.XGen 7B

xgen7b

XGen 7B es el modelo LLM de Salesforce, una de las empresas líderes de la industria. El modelo ha sido entrenado en tareas de codificación y generación de texto y afirma tener ventajas de rendimiento sobre modelos similares como MPT.

💡

parámetro: 6,7 mil millones
licencia:apache 2.0
uso: Permite la investigación y el uso comercial, y está optimizado para tareas de generación/codificación de texto.

8.OpenLLaMA

abierto

OpenLLaMA es una réplica del popular modelo LLaMa de Meta, entrenado utilizando un conjunto de datos diferente, lo que lo hace disponible bajo una licencia menos restrictiva que la licencia comercial personalizada de Meta.

Actualmente, puede encontrar modelos OpenLLaMA 7Bv2 y 3Bv3, todos los cuales están entrenados utilizando conjuntos de datos mixtos.

Puede obtener más información en su página de GitHub.

💡

parámetro: 7 billones
licencia:apache 2.0
uso: Se permite la investigación y el uso comercial.

9. Codificador de estrellas

codificador de estrella

StarCoder es un interesante LLM de código abierto, capacitado con materiales de GitHub (compromisos, problemas, etc.) y optimizado para tareas de codificación.

Contiene 15 mil millones de parámetros y está entrenado en más de 80 lenguajes de programación. Teniendo en cuenta que el material proviene de GitHub, deberá agregar atribución cuando sea necesario al utilizar el modelo.

💡

parámetro: 15 mil millones
licencia: Encienda RAIL-M v1
uso: Investigación y uso comercial permitidos (pero no mal uso)

10.Código T5

Diagrama de código t5

Otro proyecto de código abierto de Salesforce, optimizado para tareas de codificación y generación de código. CodeT5 es uno de los LLM de codificación más competitivos con 16 mil millones de parámetros y pretende superar al modelo code-cushman001 de OpenAI.

💡

parámetro: 16 mil millones
licencia: Cláusula BSD 3
uso: Se permite la investigación y el uso no comercial.

11. Fácil-1.5

Fácil 1.5 Estadísticas

Yi-1.5 es un interesante LLM de código abierto con hasta 34,4 mil millones de parámetros.

Está optimizado para capacidades de codificación, matemáticas, razonamiento y seguimiento de instrucciones. Inicialmente este modelo no era de código abierto, pero luego pasó a ser de código abierto. Y eso es algo bueno.

💡

parámetro:34,4 mil millones
licencia:apache 2.0
uso: Se permite la investigación y el uso comercial.

12. Solar-10.7B

Estadísticas de LLM Solar

SOLAR-10.7B es un LLM de código abierto previamente entrenado por Upstage.ai que solo genera texto aleatorio. Deberá ajustarlo para adaptarlo a sus requisitos específicos.

En comparación con los modelos con parámetros más grandes, incluso con 10,7 mil millones de parámetros, se espera que proporcione una buena escalabilidad y eficiencia en el rendimiento del modelo. Es un modelo de lenguaje adaptativo muy popular.

💡

parámetro: 10,7 mil millones
licencia:apache 2.0
uso: Se permite la investigación y el uso comercial.

13. Mistral 7B

Estadísticas de rendimiento de Mistral

Mistral 7B es un potente modelo de lenguaje que pretende ser mejor que LLaMa 1/2 en todos los aspectos. Los modelos de lenguaje a gran escala tienen funciones como matemáticas, razonamiento, conocimiento de textos y control de calidad.

Es un modelo de texto generativo previamente entrenado con 7 mil millones de parámetros. Por tanto, no cuenta con ningún mecanismo regulatorio. Por lo tanto, debe ajustarlo para generar resultados ajustados.

💡

parámetro: 7 billones
licencia:apache 2.0
uso: Se permite la investigación y el uso comercial.

14.OLMo-7B

bienestar olmo

OLMo-7B es otro modelo de lenguaje abierto previamente entrenado utilizando el conjunto de datos Dolma con un corpus abierto de 3 billones de tokens. Todos los datos de entrenamiento, los pesos del modelo y el código son de código abierto y se pueden utilizar sin restricciones.

💡

parámetro: 7 billones
licencia:apache 2.0
uso: Se permite la investigación y el uso comercial.

💬 ¿Cuál es tu LLM de código abierto favorito? ¿Has intentado ejecutar alguno de estos? ¡Comparte tus pensamientos en los comentarios a continuación!

Publicaciones relacionadas

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Botón volver arriba