
Bienvenido de nuevo al Semanario Local de Inteligencia Artificial. Prometí enviar una vez por semana y luego me tomó un mes enviar una segunda vez. Por eso llamamos al primer episodio el episodio piloto. El programa se transmitirá semanalmente de aquí en adelante 🤘
Esta pregunta se inclina en gran medida hacia los agentes, ya que es aquí donde aterrizan actualmente la mayoría de las interesantes herramientas locales de IA.
Antes de que veamos todo esto, déjame agradecerte. Chat atómicoquien apoya este número de Local Artificial Intelligence Weekly.
Atomic Chat le permite ejecutar LLM de código abierto de forma privada en su propio dispositivo, completamente fuera de línea. Tiene Turboquant incorporado, que proporciona una inferencia local más rápida a través de ventanas de contexto más largas. Esto significa que puede ejecutar modelos más grandes sin problemas en su dispositivo.
Explora el chat atómico
🧪 En mi banco: no soy perezoso
descargué no perezoso Esta semana. Es un marco de código abierto que permite ajustar y ejecutar modelos abiertos más rápido que las configuraciones habituales y utilizando mucha menos VRAM. Probablemente sea mejor conocido por su cuantificación dinámica GGUF, que permite ejecutar modelos de nivel 27B en aproximadamente 17 GB de RAM, con compilaciones de 1 bit comprimibles a 8 GB.
Sí… No quiero repetir esa afirmación hasta que la pruebe yo mismo. Por lo tanto, considere esto como un recordatorio y no como un comentario o sugerencia. lo probaré en el mio Cubo Zima (Con Nvidia RTX Ada 2000) y le brindaremos la conclusión completa en el próximo número.
Tres de los hallazgos de esta semana tienen que ver con lograr que los agentes locales se «comporten». Son inteligentes, pero también deben ser responsables. Todas estas herramientas son de código abierto.
El primero es verificación de poderun depurador nativo para agentes de IA de TypeScript. Convierte la ejecución de un agente en un árbol de ejecución legible, de modo que pueda ver cada llamada de herramienta, llamada de modelo y exactamente dónde salió mal algo. Cuando un agente toma la ruta equivocada, también puede provocar que las comprobaciones de CI fallen y que el seguimiento editado se agrupe para compartirlo con otros.
El siguiente es memoria automáticauna capa de memoria persistente que inserta agentes a través de MCP. La mayoría de los agentes inician cada sesión desde cero. AutoMem almacena contenido importante en diagramas de relaciones y significado en índices vectoriales, por lo que la recuperación puede brindarle pistas sobre las respuestas y a dónde pertenecen. Puede ejecutar todo el proceso localmente y sin conexión en Docker, mientras los datos permanecen en su computadora.
El tercero es Habilidades del navegador De Tencent. Permite a los agentes de IA utilizar su navegador real con el que ha iniciado sesión en lugar de una nueva zona de pruebas con una cuenta desechable. Curiosamente, ejecuta tareas en una ventana gráfica de agente visible e independiente, y solo toma prestadas las pestañas abiertas cuando lo solicita explícitamente, por lo que puede continuar trabajando mientras se ejecuta. Cuando encuentra un código de verificación o inicio de sesión, le devuelve el control y luego responde. Parece que los agentes todavía no pueden comprobar todos los semáforos 😉
🖥 ¿En qué modelo funciona realmente tu hardware?
Esta es la pregunta que más me hacen. Ves un modelo que quieres probar, pero no sabes si se ejecutará en tu sistema. Descargarlos y probarlos todos es una pérdida de tiempo y ancho de banda.
Adecuado están ahí para ayudarte. Es una herramienta de terminal que detecta su CPU, RAM y GPU, luego clasifica los modelos abiertos según qué tan bien funcionan realmente en su máquina, calificándolos según el tamaño, la velocidad, la calidad y el contexto. Si estás ejecutando Ollama, puedes incluso extraer modelos directamente desde su interfaz. Es de código abierto y está escrito en Rust (si eso es importante para ti).
llmfit, cientos de modelos y proveedores, descargue el código fuente de llmfit_GitHub_Help para encontrar qué se está ejecutando en su hardware con un solo comando.
Cientos de modelos y proveedores. Encuentre lo que se está ejecutando en su hardware con un solo comando. -AlexsJones/llmfit

🧩 Open WebUI se vuelve popular
Un rápido signo de los tiempos. Abrir interfaz web Se ha vuelto tan popular que los proveedores de hosting ahora lo ofrecen como un servicio con un solo clic. Por ejemplo, PikaPods ahora puede ejecutarlo por ti..
Como sabes, soy consultor de crecimiento de PikaPods, así que tenlo en cuenta. Pero el punto es que las interfaces de IA autohospedadas han pasado de ser una Raspberry Pi para aficionados a algo que la gente quiere ejecutar a tiempo completo sin tener que administrar servidores.
🎙 La transcripción de voz está disponible en Linux
En el primer número, dije que la IA de voz se estaba convirtiendo en la próxima gran novedad. Versión biónica de LM Studio, v1.1.3 Lo que demuestra mi punto, ya que ahora lleva la transcripción de voz a Linux, incluso en máquinas con GPU NVIDIA.
LM Studio es gratuito pero de código cerrado, así que tenlo en cuenta. Si está utilizando Linux, encontrará que Bionic AppImage tiene aproximadamente 1 GB. Esta es la AppImage más grande que he descargado jamás.
📡 Noticias de modelos abiertos
El espacio modelo abierto ha seguido el ritmo desde la última vez. Destacan tres versiones, y las tres son modelos MoE, que es claramente la dirección en la que va el mundo abierto.
Qwen3.8-Flash-Siguiente Del equipo Alibaba Qwen. Este es un modelo híbrido experto de 125B que se lanza con solo 6B de parámetros por token y es una vista previa de la arquitectura detrás de la próxima serie Qwen4. Sin embargo, se requieren sólidas capacidades de hardware.
Memoria flash DeepSeek V4.1 También aquí. En teoría, es un MoE enorme de 552 B, pero solo activa parámetros de 8 B en la entrada y 16 B en la salida, y utiliza una nueva arquitectura construida alrededor de un caché KV agresivamente comprimido, a aproximadamente 890 bytes por token. Esperando que la comunidad cuantifique esto.
Estos dos son pesos pesados, por lo que el próximo es «relativamente asequible» para los trabajadores a domicilio. pájaro pájaro 1.5 DeepReinforce está disponible en tres tamaños: 397B MoE Ultimate, 35B MoE (que arranca solo 3B por token y se ejecuta en una sola tarjeta de 24GB) y un modelo denso de 9B con una construcción cuantificada lo suficientemente pequeña para uso móvil. Se entrena a través de un ciclo de superación personal, donde el modelo escribe sus propias tareas y califica sus propios intentos.
👀 Gran reloj tecnológico
Hay dos cosas que merecen su atención.
Primero, OpenRouter adquirido por Stripe. OpenRouter es una puerta de enlace de enrutamiento de modelos grandes que mueve más de 10 billones de tokens entre más de 400 modelos cada día. Dijo que el producto, el nombre y la ruta neutral no cambiarían. Vale la pena prestar atención porque gran parte del mundo de las herramientas nativas y abiertas depende de portales que permanecen neutrales.
En segundo lugar, la industria ha llegado a un consenso poco común. Dario Amodei de Anthropic publicó un artículo titulado “Debemos estar a la vanguardia”, cree que los laboratorios de inteligencia artificial deberían reducir deliberadamente la velocidad a la que avanzan las capacidades de sus modelos.
A los pocos días, Sam Altman, Elon Musk y Demis Hassabis de Google DeepMind dijeron que estaban de acuerdo con la idea central. Los boicoteadores más notables no eran laboratorios en absoluto. El presidente de Estados Unidos, Trump, rechazó rotundamente la idea y dijo que «quien gane en inteligencia artificial, gana».
Sería bueno para nosotros, los entusiastas locales de la IA, si la frontera se desacelera y el peso de apertura continúa aumentando.
🗂 Terminología de IA: aprovechar
Notarás que la palabra «tachuela» se usa mucho últimamente. Eso es lo que significa.
Piense en el LLM como el cerebro y en el cinturón de seguridad como el cuerpo real. El modelo en sí es un cerebro en un frasco. Lee texto y predice texto. El arnés lo convierte en un agente que puede hacer cosas. El arnés ejecuta un bucle, que envía su solicitud al modelo, lee las llamadas a la herramienta que el modelo desea realizar, ejecuta esas herramientas, retroalimenta los resultados y repite hasta que se realiza el trabajo. También gestiona la memoria, el contexto y a qué modelo puede acceder y a qué no.
La razón por la que todo el mundo construye su propio arnés es que el modelaje se ha convertido en pan comido. Ahora, el valor está en los cables de los que te rodeas: tus datos, tus herramientas, tu flujo de trabajo, tus barreras de seguridad.
Usando un LL.M. como herramienta de chat glorificada no ayudará mucho. Conectando un LL.M. en el arnés que se adapta a su trabajo o al de su empresa le permitirá lograr una verdadera automatización de la IA.
⚡ CONSEJO RÁPIDO: Mantén abrigado tu modelo Ollama
Si ejecuta Ollama y nota que la primera respuesta después del descanso es lenta, he aquí por qué. De forma predeterminada, Ollama descarga modelos de la memoria de la GPU después de 5 minutos sin solicitudes. Noté esto en mi configuración de Zima. Luego, la siguiente solicitud debe recargar todo el modelo desde el disco a la VRAM, lo que retrasa la siguiente respuesta.
Puedes cambiar esto. configuración OLLAMA_KEEP_ALIVE Las variables de entorno en el servicio Ollama tienen duraciones más largas, p. 30mo a -1 Mantenga el modelo en la memoria hasta que se reinicie.
Lo que quiero decir es que la memoria GPU libre sólo es útil si quieres usarla. En una computadora de un solo usuario donde usted es el único que usa este modelo, no tiene sentido liberar la GPU cada cinco minutos y, como resultado, sufrir respuestas lentas. Sin embargo, si utiliza varios modelos grandes en una tarjeta, los tiempos de espera preestablecidos pueden resultar útiles.
🎫 Actividades a las que vale la pena asistir
Si le gusta la agencia, se avecinan dos sesiones y los lectores de It’s FOSS pueden obtener descuentos en ambas.
AGNTCon + MCPCon Europa Se celebrará en Amsterdam los días 17 y 18 de septiembre. Usar código ITSFOSS_50 Al finalizar la compra, la inscripción cuesta $375. Es válido hasta la fecha del evento que es mañana.
AGNTCon + MCPCon Norteamérica Celebrada del 22 al 23 de octubre en San José, California. Usar código ITSFOSS El precio actual tiene un 20% de descuento o más; Debería costar alrededor de $375. Esta oferta vence el 7 de octubre.
al final…
Espero que no tarde mucho. No es que esté tratando de cerrar la enorme brecha entre las dos versiones… o tal vez sí lo estoy;)
Como de costumbre, algunos de estos funcionarán para usted y otros no, dependiendo de lo que esté creando o de cuáles sean sus intereses. Responde y cuéntame qué estás ejecutando localmente estos días. Leo cada respuesta.
Nos vemos la próxima semana (esta vez de verdad).
Si esto le ayuda, considere el software gratuito que lo admite.
Su FOSS ha ayudado a la gente a utilizar Linux durante los últimos 14 años. Ayúdanos a ser independientes de las grandes empresas tecnológicas. Conviértase en miembro Plus y disfrute de una lectura sin publicidad y obtenga 5 libros electrónicos.










