La
AI
de PandoraLinux está en sus
inicios,
su desarrollo avanza
a marchas
forzadas para ofrecer un producto de calidad en la entrega de septiembre.
Por este motivo, este mes habrá una entrega especial entre
los días 15 y 20.
El mayor reto que encuentro es la cantidad
de memoria que
se requiere
para algunas funciones. Estoy buscando soluciones
a este problema,
ya que a veces provoca una completa
congelación
del sistema por
falta de memoria física. De momento, he configurado el sistema para
que, cuando este consuma toda la memoria RAM, elimine el proceso
para evitar la congelación del equipo y su reinicio forzado.
Las
distribuciones live no acostumbran a utilizar la memoria swap
del disco interno y PandoraLinux no lo hará porque los discos
tienen ciclos de uso ( lectura y escritura ) y esa práctica
reduce la
vida
útil, poniendo en riesgo los datos contenidos.
|

La nueva sección está pensada para ayudar
a utilizar la AI, ofreciendo ideas y soluciones
propias o recibidas por correo electrónico.
A medida que crezca el contenido,
reconfiguraré la página para garantizar
que todo sea claro y fácil de encontrar.
Su actualización será semanal
El enlace estará operativo en los próximos días.
|
 |
|
|

Al procesar
los datos localmente, se garantiza la
total confidencialidad
de la
información
del usuario y se reduce la latencia, siendo ideales
para equipos desconectados de internet.
|
|
|

El modelo Dolphin-Phi (como el popular
Dolphin-2.6-Phi-2) es un modelo
de lenguaje pequeño (SLM) desarrollado por Eric Hartford y Cognitive
Computations.
Combina la arquitectura ligera y eficiente Phi de Microsoft Research
con el entrenamiento especializado y sin censura de la serie Dolphin.
- Razonamiento lógico avanzado:
Resuelve tareas complejas de sentido común y deducción, alcanzando
altas tasas de precisión en pruebas estándar como ARC.
- Resolución de problemas matemáticos:
Procesa lógica matemática y operaciones complejas con gran precisión,
ideal para soporte técnico o educativo.
- Generación y asistencia de código:
Escribe, completa y depura código en múltiples lenguajes
de programación (como Python).
- Procesamiento de texto sin censura:
Responde a consultas sin capas rígidas de alineación ética corporativa,
permitiendo análisis académicos o literarios profundos y sin
restricciones.
- Interacciones conversacionales empáticas:
Incorpora conjuntos de datos enfocados en la empatía (como Samantha)
para
ofrecer respuestas con un tono más natural, cercano y consciente del
contexto.
- Seguimiento preciso de instrucciones:
Interpreta comandos complejos del usuario a través de formatos
estructurados como ChatML, facilitando la automatización de tareas.
|
|
|
|
|

La familia de modelos de inteligencia artificial
Llama 3.2
fue desarrollada y
lanzada por Meta, esta
versión introdujo los primeros modelos
multimodales de la serie (capaces de procesar imágenes y texto)
y modelos ligeros optimizados para funcionar localmente
en dispositivos móviles. "Built
with Llama"
- Resumen de textos:
Condensa extensos historiales de chat, correos electrónicos o
notas
de reuniones locales.
- Llamada a herramientas (Tool
Calling):
Ejecuta comandos para controlar aplicaciones de terceros,
automatizar
tareas del sistema o activar dispositivos del hogar inteligente.
- Redacción y edición sobre la
marcha:
Reescribe, corrige o cambia el tono de textos en asistentes de
escritura móviles.
- Seguimiento de instrucciones:
Atiende indicaciones de manera fluida gracias a una amplia
ventana de
contexto de hasta 128,000 tokens.
- Generación multilingüe:
Maneja con gran precisión el procesamiento y traducción de
texto en
múltiples idiomas, incluyendo un excelente rendimiento en español.
|
|
|
|
|
Es una familia de modelos de lenguaje visual (VLM) de código
abierto diseñada
para ofrecer una comprensión
visual potente y eficiente con
una huella de
memoria
extremadamente pequeña, permitiendo su ejecución
local
en dispositivos de borde,
como Raspberry Pi, smartphones o
laptops,
sin necesidad de GPUs especializadas.
- Subtítulos y
descripción de imágenes:
Generar descripciones textuales automáticas de contenido visual.
- Detección de
objetos:
Identificar elementos específicos en imágenes mediante cajas
delimitadoras o puntos coordenados.
- Preguntas y
respuestas visuales (VQA):
Responder consultas naturales basadas en el contenido de una
imagen.
- Reconocimiento óptico de caracteres (OCR):
Extraer y transcribir texto de documentos o interfaces.
- Conteo y
localización:
Contar objetos específicos o localizar puntos exactos en una
imagen.
|
|
|
|
|

El modelo Phi-4-mini de Microsoft es un
Modelo de Lenguaje Pequeño (SLM) de
3.800 millones de parámetros diseñado para ofrecer un rendimiento de
alta
velocidad y baja latencia directamente en dispositivos locales.
- Resolución de problemas:
Descompone consultas complejas paso a paso (especialmente
en sus variantes Reasoning o Flash-Reasoning).
- Matemáticas avanzadas:
Resuelve problemas aritméticos, algebraicos y lógicos con una
precisión
que supera a otros modelos del doble de su tamaño.
- Comprensión y análisis de código:
Genera, completa y audita código de programación (por ejemplo, en
Python),
haciéndolo ideal para autocompletado en tiempo real en entornos de
desarrollo.
- Interacción con herramientas
externas:
Puede conectarse e interactuar de forma nativa con APIs,
bases de datos y motores de búsqueda de Internet.
- Automatización:
Ejecuta comandos estructurados basados en las intenciones del
usuario para
controlar herramientas de software o interactuar con dispositivos del
hogar inteligente.
- Análisis de documentos extensos:
Cuenta con una ventana de contexto de 128.000 tokens, lo que le
permite
procesar y resumir libros enteros, contratos legales o historiales de
chat
masivos sin perder el hilo.
- Seguimiento estricto de
instrucciones:
Está optimizado mediante técnicas de alineación para respetar
formatos
complejos como respuestas en JSON o estructuras específicas.
- Traducción y redacción:
Gracias a un vocabulario expandido de 200.000 tokens, comprende
y
genera texto de forma fluida en múltiples idiomas con mayor
precisión
que las versiones anteriores.
|
|
|
|
|

Qwen2-Math es un modelo de lenguaje de
código abierto desarrollado por
el equipo de Alibaba Cloud, especializado en razonamiento y resolución
de problemas matemáticos complejos.
- Resolución de problemas avanzados:
Resuelve desde matemáticas básicas escolares hasta problemas
complejos
a nivel de olimpiadas y exámenes de ingreso universitario.
- Razonamiento paso a paso:
Está entrenado para desglosar problemas complejos mediante la
cadena de
pensamiento (Chain-of-Thought), lo que le permite explicar el proceso
lógico
y la ruta de cálculo en lugar de solo ofrecer el resultado final.
- Soporte multilingüe:
Comprende y resuelve problemas en más de 27 idiomas.
- Integración de código y lógica:
Puede generar y evaluar código matemático (usando Python, por
ejemplo)
para llegar a la solución o verificar resultados de manera autónoma.
|
|
|
|
|

Es un avanzado modelo de inteligencia
artificial de código abierto desarrollado por Alibaba.
Sus funciones
abarcan desde la creación automatizada de páginas web y software
hasta
el análisis multimodal avanzado (texto, código, imagen, vídeo y audio),
integrando un modo de razonamiento profundo.
- Programación autónoma:
Los modelos orientados a código (como Qwen3-Coder) dominan decenas de
lenguajes de programación y actúan como agentes completos. Son capaces
de leer repositorios, ejecutar pruebas, depurar errores y corregirlos.
- Generación Visual:
Puede crear código ejecutable directamente a partir de capturas de
pantalla o
diseños, eliminando la necesidad de programar la interfaz
manualmente.
- Desarrollo con lenguaje natural:
Permite crear sitios web y aplicaciones funcionales con tan solo
describirlos
mediante una frase. La IA genera el código en tiempo real y
ofrece
publicarlo con un solo clic.
- Visión y Vídeo:
Procesa imágenes, capturas y vídeos, realizando reconocimiento óptico
de
caracteres (OCR) y respondiendo preguntas sobre el contenido visual.
- Análisis de documentos:
Es capaz de extraer y sintetizar información estructurada a partir de
documentos complejos como PDFs, Excel y Word.
- Pensamiento dual:
Permite alternar entre un modo de respuesta rápida y un modo de
razonamiento
profundo. En este último, la IA detalla su cadena de
pensamiento paso a paso
antes de responder, mejorando la precisión en
tareas lógicas y científicas.
- Búsqueda web:
Cuenta con la capacidad de buscar información actualizada directamente
en
Internet para fundamentar sus respuestas.
|
|
|
|
|

Desarrollado
por Jina
AI.es
un modelo de lenguaje pequeño (SLM)
diseñado específicamente para limpiar
y convertir código HTML
en bruto y ruidoso a formato
Markdown limpio,
su utilidad
principal es la preparación
de datos para
RAG
(Retrieval-Augmented Generation) o
el entrenamiento
de otros LLMs,eliminando el "ruido" de las páginas
web para obtener contenido puro y
legible.
- Extracción eficiente:
Convierte estructuras web complejas
en texto estructurado sin perder el contexto,
superando en esta tarea específica a modelos más grandes como GPT-4 o
Llama-3.
- Contexto largo:
Soporta longitudes de contexto de
hasta 256,000
tokens,
permitiendo procesar documentos web extensos.
- Multilingüe:
Capaz de manejar texto en múltiples
idiomas.
|
|
|
|
|

Es
una familia de modelos de lenguaje compactos desarrollados por
Hugging
Face, diseñados principalmente para ejecutarse
localmente en
dispositivos con recursos limitados,
como smartphones y hardware de borde.
- Procesamiento y generación de
texto:
Redacción de correos, resumen de documentos, traducción y escritura
creativa.
- Razonamiento y código:
Resolución
de problemas matemáticos y generación de código,
destacando por
superar a modelos más grandes como Llama3.2-1B en
ciertos benchmarks.
- Automatización e integración:
Soporte para llamadas
a funciones (function
calling) que permite a las
aplicaciones interactuar con servicios
externos o dispositivos domésticos
inteligentes mediante comandos de
lenguaje natural. |
|
|
|
|

El módulo de inteligencia artificial
TinyDolphin cumple la función principal
de generar resúmenes de textos concisos y directos, procesar
instrucciones
generales y ejecutar tareas lógicas en dispositivos de hardware limitado.
Este modelo destaca por su tamaño compacto de 1.1 millones de parámetros
(1.1B), lo que le permite funcionar de forma local en entornos con
recursos
mínimos como una CPU común o placas Raspberry Pi.
- Resumen de textos (Summarization):
Condensa artículos extensos, correos o documentos
extensos extrayendo las ideas y puntos clave.
- Procesamiento sin censura:
Al estar entrenado con el dataset Dolphin de Eric Hartford, procesa
información y responde preguntas sin las restricciones ni
bloqueos éticos comerciales típicos de otras IA.
- Seguimiento de instrucciones (Instruct-tuned):
Entiende formatos de comandos específicos y de conversación
directa
del usuario.
- Razonamiento y lógica básica:
Resuelve problemas sencillos de texto, ordenamiento
de información y clasificación de datos.
- Generación de código:
Escribe pequeños fragmentos de código o scripts basados en texto según
se le solicite.
|
|
|
|
|

Yi-Coder es una familia de modelos de
lenguaje de código abierto de 01.AI
diseñados específicamente para tareas de programación. Destaca por su
alta eficiencia en tareas de asistencia de software gracias a su ventana
de
contexto de 128K tokens y su entrenamiento en 52 lenguajes
principales (como Python, Java, C++ y JavaScript).
- Autocompletado y generación de
código:
Sugiere fragmentos de código mientras escribes y genera bloques
completos a partir de instrucciones en lenguaje natural.
- Comprensión a nivel de
repositorio:
Su amplia ventana de contexto permite al modelo analizar
proyectos de software
completos para comprender cómo se relacionan los diferentes archivos y
funciones.
- Edición y refactorización:
Puede realizar inserciones, correcciones y mejoras en código ya
existente
sin alterar el resto del documento.
- Control de calidad:
Ayuda en la revisión de código (code review) y en la
búsqueda de
fallos o errores de sintaxis.
- Conversión de lenguaje (NL2SQL):
Traduce preguntas o comandos de lenguaje natural en
consultas
estructuradas para bases de datos (SQL).
|
|
|
|
|
|
|
 |
|
|
|
|
Los modelos Gemma 3 de Google son una
familia de inteligencias artificiales
multimodales, ligeras y de código
abierto. Sus funciones principales están
diseñadas para tareas de
comprensión multimodal (texto e imágenes)
y generación de contenido.
- Texto e Imágenes:
Puede analizar imágenes
de alta resolución,
comprender lo que
contienen y responder preguntas o
generar
texto relacionado.
- Manejo de Audio (en variantes
específicas):
Ciertas versiones
del modelo también procesan datos de
sonido para transcripción,
traducción y análisis.
- Respuestas y resúmenes:
Es capaz de
redactar correos, responder
preguntas complejas
y resumir documentos
extensos.
- Traducción:
Soporte nativo y preentrenado
para comunicarse
en más de 140 idiomas (incluyendo el español).
- Programación:
Escribe, depura y explica
código en una amplia variedad
de lenguajes
de programación (como Python
o JavaScript).
- Ventana de contexto masiva:
Puede procesar
hasta 128.000 tokens
a la vez, lo que le permite recordar
conversaciones
muy largas o analizar libros enteros.
- Capacidad mejorada de razonamiento:
Cuenta
con habilidades avanzadas para la resolución de problemas
matemáticos y
tareas lógicas.
|
|
|
|
|

Lanzado por Alibaba en febrero de 2026, es un modelo de lenguaje grande
multimodal diseñado explícitamente para la "era
de la IA agéntica",
lo que
significa que no solo responde preguntas, sino que planifica
y ejecuta flujos
de trabajo complejos de múltiples pasos.
- Control de
Agentes Visuales:
Puede
interpretar capturas de pantalla y elementos de interfaz de usuario
(GUI) para controlar aplicaciones de escritorio (como Photoshop),
navegar por la web y ejecutar acciones en aplicaciones
móviles de
forma autónoma.
-
Multimodalidad Nativa:
Fusiona
texto, imágenes y video
(hasta 2 horas de duración)
desde
la primera etapa de preentrenamiento, permitiendo
un
razonamiento intermodal sin fisuras.
- Arquitectura
de Alta Eficiencia:
Utiliza
una estructura híbrida de Mixture-of-Experts
(MoE);
su modelo
insignia de
397 mil millones de parámetros activa solo 17
mil millones por token,
lo que reduce drásticamente los costos de
inferencia y aumenta
la velocidad hasta 19
veces en
contextos largos en comparación
con generaciones anteriores.
-
Llamada de
Herramientas y API:
Integra
capacidades nativas para llamar a APIs externas, ejecutar código,
realizar búsquedas web y orquestar herramientas, actuando como
un
asistente autónomo.
- Soporte
Multilingüe y Largo Contexto:
Opera
en más de 200
idiomas y
maneja ventanas de contexto de hasta
1
millón de tokens en
su versión hospedada (Plus), ideal para analizar
documentos extensos o bases de código completas.
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|