
Nos guste o no, AI se quedará aquí. Para aquellos que están preocupados por la privacidad de los datos, hay varias opciones de IA locales disponibles. Herramientas como Ollama y LM Studio facilitan las cosas.
Estas opciones ahora están disponibles para los usuarios de escritorio y requieren mucha potencia informática.
¿Qué pasa si quieres usar AI local en tu teléfono inteligente? Por supuesto, una forma es implementar Ollama en el servidor utilizando la GUI web y acceder a ella desde su teléfono.
Pero hay otra forma, es decir, usar una aplicación que pueda instalar y usar LLM directamente en su teléfono (o debería decir SLMS, modelo de idioma pequeño) en lugar de confiar en un servidor de IA local en otra computadora.
Permítame compartir mi experiencia de experimentar con LLM en mi teléfono.
📋
Hoy, los teléfonos inteligentes tienen procesadores poderosos, y algunos incluso procesadores de IA dedicados a bordo. El Snapdragon 8 Gen 3, el A17 Pro de Apple y Google Tensor G4 son algunos de ellos. Sin embargo, los modelos que pueden ejecutarse en su teléfono suelen ser muy diferentes de los que usa en el escritorio o servidor apropiado.
Esto es lo que necesitas:
- Una aplicación que le permite descargar modelos de idiomas e interactuar con ellos.
- Un LLM adecuado creado específicamente para ejecutarse en dispositivos móviles.
Aplicaciones que ejecutan LLM localmente en teléfono inteligente
Después de investigar, decidí explorar la siguiente aplicación para este propósito. Permítanme compartir sus características y detalles.
1. MLC Chat
Chat mlc Admite modelos Top como Llama 3.2, Gemma 2, Phi 3.5 y Qwen 2.5, proporcionando chat sin conexión, traducción y tareas multimodales a través de una interfaz suave. Cuenta con optimizaciones de NPU modelo preconfiguradas, como Snapdragon 8 Gen 2+ y configuraciones de complemento para características para principiantes, lo que lo hace ideal para la IA existente.
Puedes descargar el chat MLC APK de él Su página de lanzamiento de Github.
Android quiere prohibir la carga local de los archivos APK. No sé qué sucederá, pero ahora puede usar el archivo APK.
Coloque el archivo APK en su dispositivo Android, vaya al archivo y haga clic en el archivo APK para iniciar la instalación. Si se le solicita, habilite la instalación desde la fuente desconocida en la configuración del dispositivo. Siga las instrucciones en pantalla para completar la instalación.

Después de la instalación, abra la aplicación de chat MLC y seleccione un modelo de la lista, como PHI-2, Gemma 2BLlama-3 8b, Mistral 7b. Haga clic en el icono de descarga para instalar el modelo. Recomiendo elegir un modelo más pequeño como el PHI-2. Descargue el modelo en primer uso y caché localmente para uso fuera de línea.

Haga clic en el icono de chat junto al modelo de descarga. Comience a escribir las indicaciones para interactuar con LLM fuera de línea. Si es necesario, use el icono de reinicio para comenzar una nueva conversación.

2. Smolchat (Android)
Smolchat es una aplicación de Android de código abierto que puede ejecutar cualquier Modelo de formato Gguf (Al igual que Llama 3.2, Gemma 3n o Tinyllama) directamente en su dispositivo, proporcionando una interfaz limpia similar a ChatGPT para chat completamente fuera de línea, resumen, reescribir y más.
Instalar smolchat desde Tienda de juegos de Google. Abra la aplicación, seleccione el modelo GGUF en la lista de modelos de la aplicación o descargue manualmente una de la cara del abrazo. Si se descarga manualmente, coloque el archivo modelo en el directorio de almacenamiento especificado por la aplicación (la configuración de la aplicación para verificar la ruta).
3. Galería Googleai Edge
Galería Google Ai Edge Es una aplicación Android de código abierto experimental (iOS) que rápidamente lleva la potencia de IA del dispositivo de Google a su teléfono, lo que le permite ejecutar modelos potentes como el Gemma 3N y otros modelos faciales abrazados después de la descarga. Esta aplicación utiliza el marco de literas de Google.
puede Descargar desde Google Play Store. Abra la aplicación y explore la lista de modelos proporcionados, o descargue manualmente modelos compatibles de Hug Face.
Seleccione el modelo descargado y comience la sesión de chat. Ingrese las indicaciones de texto o las imágenes de carga (si es compatible con el modelo) para la interacción local. Explore características como descubrimiento oportuno o consultas basadas en la visión.
Top Mobile LLM puede intentar
Aquí está lo mejor que he usado:
| Modelo | Mi experiencia | El mejor |
|---|---|---|
| Gemma 3n de Google (2B) | Velocidad de quema para tareas multimodales que incluyen títulos de imágenes, traducciones e incluso resolviendo problemas matemáticos de fotos. | Ayuda rápida de IA basada en la visión |
| Meta’s Llama 3.2 (1B/3B) | Un equilibrio perfecto entre tamaño e inteligencia. Esto es perfecto para codificar la ayuda y el chat privado. La versión 1B funciona sin problemas incluso en teléfonos de rango medio. | Desarrolladores y usuarios de privacidad |
| Mini Phi-3 de Microsoft (3.8b) | Sorprendentemente, se resume la documentación larga a pesar de su pequeño tamaño. | PDF de un estudiante, investigador o cualquier ahogamiento |
| QWEN-2.5 de Alibaba (1.8b) | Sorprendentemente, la pregunta visual respondida por la pregunta visual es sorprendente: ¡preséntala a la imagen y realmente entiéndala! | Experimentos multimodales |
| Tinyllama-1.1b | El campeón liviano puede correr en casi cualquier dispositivo sin sudar. | Llamadas telefónicas antiguas o usuarios que solo necesitan chatbots simples |
Todos estos modelos usan cuantización positiva (formato GGUF/Safetensors), por lo que son pequeños pero aún potentes. Puede tomarlos de la cara abrazada: simplemente descargue, cargue en la aplicación y lo haya configurado.
Desafíos que enfrento al ejecutar LLM localmente en Android Smartphone
Es igual de emocionante y frustrante que un modelo de idioma grande (LLM) se ejecute sin problemas en su teléfono.
En mi teléfono Snapdragon 8 Gen 2, modelos como el Llama 3-4B funcionan en 8-10 tokens por segundo para una consulta rápida. Sin embargo, cuando probé lo mismo en un Galaxy A54 de respaldo (6 GB de RAM), se ahogó. Incluso la carga del modelo 2B empuja el dispositivo a sus límites. Lo he aprendido pronto Phi-3-Mini (3.8b) o Gemma 2B es más práctico Para hardware de rango medio.
Cuando participé por primera vez en una sesión de IA local, me sorprendió ver que el 50% de la batería desaparece en 90 minutos. El chat MLC proporciona el modo de ahorro de energía para este propósito. Desactivar la aplicación de fondo para lanzar RAM también es útil.
También probé modelos de cuantización de 4 bits (por ejemplo, QWEN-1.5-2B-Q4) para guardar el almacenamiento, pero noté que luchan con un razonamiento complejo. Para preguntas médicas o legales, tuve que volver a la versión de 8 bits. Es más lento, pero más confiable.
en conclusión
Me gusta la idea de tener un asistente de IA que funcione específicamente para mí, sin tarifas mensuales, sin fugas de datos. ¿Necesita una traducción en un pueblo remoto? ¿Asistente virtual en vuelos de larga distancia? ¿Ideas sensibles a la pareja privada de lluvia de ideas? Su teléfono estará todo fuera de línea y no se puede contratar.
No mentiré, no es perfecto. Su teléfono no es un centro de datos, por lo que enfrentará desafíos como el drenaje de la batería y el sobrecalentamiento ocasional. Pero esto también ofrece compensaciones como privacidad total, costo cero y acceso fuera de línea.
El futuro de la IA no solo está en la nube, sino también en sus dispositivos.
Información del autor

Bhuwan Mishra es un desarrollador a gran escala con Python y como su herramienta preferida. Se enorgullece de construir y garantizar aplicaciones web, tuberías de API y CI/CD, y servidores de ajuste para un rendimiento óptimo. También le apasiona trabajar con Kubernetes.









