cabecera
Descarga & Instalación  Pandorainside  News  Wallpapers  Licencia

AI PandoraLinux 

 
 La AI de PandoraLinux está en sus inícios, el desarrollo de esta funciona
a marchas forzadas, para ofrecer un producto de calidad en la entrega
de agosto o septiembre, el mayor reto que encuentro es la cantidad
de memoria que se requiere para algunas funciones, estoy buscando
 soluciones a este problema que a veces provoca una completa
congelación del sistema por falta de memoria fisica.
 
Las distribuciones live no acostumbran a utilizar la memoria swap
del disco interno, y PandoraLinux no lo hará porque los discos
tienen ciclos de uso ( lectura y escritura ) y esa practica reduce la vida
útil de los mismos, poniendo en riesgo los datos contenidos.

Panel de Alpaca
 
Modelos locales:
Al procesar los datos localmente, se garantiza la total confidencialidad
de la información del usuario y se reduce la latencia, siendo ideales
 para equipos desconectados de internet.



SmolLM2

E
s una familia de modelos de lenguaje compactos desarrollados por
Hugging Face,
diseñados principalmente para ejecutarse localmente en
 dispositivos con recursos limitados, como smartphones y hardware de borde.

- Procesamiento y generación de texto
:
Redacción de correos, resumen de documentos, traducción y escritura creativa. 

- Razonamiento y código

Resolución de problemas matemáticos y generación de código, destacando por
superar a modelos más grandes como Llama3.2-1B en ciertos benchmarks. 


- Automatización e integración
:
Soporte para 
llamadas a funciones (function calling) que permite a las
aplicaciones interactuar con servicios externos o dispositivos domésticos
inteligentes mediante comandos de lenguaje natural. 

 

 


Reader Lm

Es un modelo de lenguaje pequeño (SLM) diseñado específicamente para
 l
impiar y convertir código HTML en bruto y ruidoso a formato Markdown limpio
Desarrollado por 
Jina AI.

- Extracción eficiente:
 
Convierte estructuras web complejas en texto estructurado sin perder el contexto,
superando en esta tarea específica a modelos más grandes como GPT-4 o Llama-3. 

- Contexto largo:
 
Soporta longitudes de contexto de hasta 
256,000 tokens,
permitiendo procesar documentos web extensos. 

- Multilingüe:
 
Capaz de manejar texto en múltiples idiomas. 

En resumen, su utilidad principal es la preparación de datos para
RAG (Retrieval-Augmented Generation)
 o el entrenamiento de otros LLMs,
eliminando el "ruido" de las páginas web para obtener contenido puro y legible. 




Phi

Phi de Microsoft es una familia de 
pequeños modelos de lenguaje (SLM) diseñada
para ofrecer eficiencia, razonamiento avanzado y ejecución local sin
depender exclusivamente de la nube


- Razonamiento complejo y matemático:
 
Destaca en la resolución de problemas lógicos, matemáticos y generación de código,
superando a modelos mucho más grandes en benchmarks específicos. 


- Multimodalidad y contexto:
 
Las versiones recientes (Phi-4 y Phi-3.5) manejan 
texto, audio e imágenes, con
ventanas de contexto amplias (hasta 128k tokens) para analizar documentos
extensos, gráficos y resúmenes. 


- Accesibilidad y personalización:
 
Al ser 
open-source (licencia MIT), permite a desarrolladores y empresas descargar,
ajustar y comercializar los modelos para aplicaciones específicas como asistentes
virtuales, análisis jurídico o automatización de tareas. 


Moondream 

 

Es una familia de modelos de lenguaje visual (VLM) de código abierto diseñada
para ofrecer una 
comprensión visual potente y eficiente con una huella de memoria
extremadamente pequeña, permitiendo su ejecución local en dispositivos de borde,
como Raspberry Pi, smartphones o laptops, sin necesidad de GPUs especializadas. 


- Subtítulos y descripción de imágenes
:
Generar descripciones textuales automáticas de contenido visual. 

-
Detección de objetos:
Identificar elementos específicos en imágenes mediante cajas
delimitadoras o puntos coordenados. 


- Preguntas y respuestas visuales (VQA)
:
Responder consultas naturales basadas en el contenido de una imagen. 

-
Reconocimiento óptico de caracteres (OCR):
Extraer y transcribir texto de documentos o interfaces. 

-
Conteo y localización:
Contar objetos específicos o localizar puntos exactos en una imagen. 

Separador


Modelos cloud:
 

Qwen3.5


Lanzado por Alibaba en febrero de 2026, es un modelo de lenguaje grande
multimodal diseñado explícitamente para la 
"era de la IA agéntica", lo que
 significa que no solo responde preguntas, sino que 
planifica y ejecuta flujos
 de trabajo complejos de múltiples pasos
.


- Control de Agentes Visuales:
 
Puede interpretar capturas de pantalla y elementos de interfaz de usuario
(GUI) para controlar aplicaciones de escritorio (como Photoshop),
navegar por la web y ejecutar acciones en aplicaciones
móviles de forma autónoma. 


- Multimodalidad Nativa:

 Fusiona texto, imágenes y 
video (hasta 2 horas de duración) 
desde la primera etapa de preentrenamiento, permitiendo un
razonamiento intermodal sin fisuras. 


- Arquitectura de Alta Eficiencia:
 
Utiliza una estructura híbrida de 
Mixture-of-Experts (MoE); su modelo
insignia de 397 mil millones de parámetros activa solo 17 mil millones por token,
lo que reduce drásticamente los costos de inferencia y aumenta la velocidad hasta
 
19 veces en contextos largos en comparación con generaciones anteriores. 

-
Llamada de Herramientas y API:
 Integra capacidades nativas para llamar a APIs externas, ejecutar código,
realizar búsquedas web y orquestar herramientas, actuando como
un asistente autónomo. 


- Soporte Multilingüe y Largo Contexto:
 
Opera en más de 
200 idiomas y maneja ventanas de contexto de hasta 
1 millón de tokens
 en su versión hospedada (Plus), ideal para 
analizar documentos extensos o bases de código completas


 
Gemma3

Los modelos Gemma 3 de Google son una familia de inteligencias artificiales
multimodales, ligeras y de código abierto. Sus funciones principales están
diseñadas para tareas de comprensión multimodal (texto e imágenes)
y generación de contenido.


- Procesamiento y comprensión multimodal:
Texto e Imágenes: Puede analizar imágenes de alta resolución,
comprender lo que contienen y responder preguntas o generar
texto relacionado.

Manejo de Audio (en variantes específicas): Ciertas versiones
del modelo también procesan datos de sonido para transcripción,
traducción y análisis.

- Generación y análisis de texto:
Respuestas y resúmenes: Es capaz de redactar correos, responder
preguntas complejas y resumir documentos extensos.

Traducción: Soporte nativo y preentrenado para comunicarse
en más de 140 idiomas (incluyendo el español).

Programación: Escribe, depura y explica código en una amplia variedad
de lenguajes de programación (como Python o JavaScript).


- Razonamiento y flexibilidad:

Ventana de contexto masiva: Puede procesar hasta 128.000 tokens
a la vez, lo que le permite recordar conversaciones muy largas o
 analizar libros enteros.

Capacidad mejorada de razonamiento: Cuenta con habilidades avanzadas
 para la resolución de problemas matemáticos y tareas lógicas.


- Eficiencia en hardware local:

Ejecución local: A diferencia de otros modelos gigantes, Gemma 3
fue optimizado para ejecutarse localmente en laptops, PC de escritorio
 o incluso teléfonos.

Optimización por tamaño: Está disponible en varias versiones
(desde modelos diminutos de 1 billón de parámetros hasta opciones más robustas
de 27 billones), permitiendo adaptar el consumo de memoria al equipo disponible.





Tux en su graduación