NVIDIA y la Comunidad Local de IA Impulsan Modelos de Código Abierto y Agentes Inteligentes
NVIDIA and Local AI Community Fuel Open Source Models and Intelligent Agents
El ecosistema de código abierto está facilitando a los entusiastas y desarrolladores de inteligencia artificial la construcción, personalización y ejecución de agentes cada vez más capaces de manera local. A lo largo de agosto, NVIDIA celebra a los socios y comunidades de código abierto que están avanzando en la IA local, junto con los modelos, aplicaciones y herramientas que emergen en todo el ecosistema. Esto incluye los últimos modelos abiertos de NVIDIA, software y herramientas para desarrolladores, además de la computación acelerada, bibliotecas y recursos educativos que ayudan a los usuarios a comenzar.
Se perfila como un gran mes para los agentes. Sigue las últimas novedades en esta serie especial del blog de NVIDIA Local AI, con nuevas actualizaciones que se añadirán en las próximas semanas.
NVIDIA lanzó recientemente Cosmos 3 Edge, un modelo de mundo abierto de 4 mil millones de parámetros para robótica, vehículos autónomos y visión artificial. A una cuarta parte del tamaño de Cosmos 3 Nano, se ejecuta en dispositivos como NVIDIA DGX Spark y NVIDIA Jetson. MiniMax-H3 es un modelo de pesos abiertos de 33 mil millones de parámetros que genera video y audio estéreo sincronizado nativamente a partir de texto, imágenes, video, audio o una mezcla de los cuatro. Los creadores pueden acceder a él a través de ComfyUI y ejecutarlo localmente con puntos de control optimizados para GPUs de NVIDIA.
Poolside AI lanzó Laguna S 2.1, un modelo de codificación agéntica de pesos abiertos de 118 mil millones de parámetros que trabaja en tareas de varias horas. Un punto de control NVFP4 permite a los desarrolladores ejecutar el modelo localmente en un único NVIDIA DGX Spark con menores requisitos de computación y memoria, sin sacrificar la precisión. DeepSeek actualizó recientemente DeepSeek-V4-Flash, un modelo MoE de 284 mil millones de parámetros con 13 mil millones de parámetros activos y una ventana de contexto de 1 millón de tokens. Los desarrolladores pueden ejecutarlo localmente en una estación NVIDIA DGX usando versiones GGUF construidas por la comunidad disponibles hoy.
Thinking Machines Lab presentó Inkling-Small, un modelo multimodal de pesos abiertos de clase frontera con razonamiento nativo a través de texto, imágenes y audio, además de un esfuerzo de pensamiento ajustable. Entrenado en NVIDIA GB300 NVL72, el modelo de 276 mil millones de parámetros activa solo 12 mil millones de parámetros por token y se ejecuta en una sola estación DGX o dos sistemas DGX Spark. Un punto de control NVFP4 optimizado para NVIDIA Blackwell está disponible en Hugging Face.
Unsloth está lanzando Unsloth Desktop el lunes. El producto trae inferencia de modelos locales, difusión de imágenes y videos, ajuste fino, integraciones de agentes, investigación web y ejecución de código en una sola aplicación de escritorio completamente de código abierto. Los materiales de lanzamiento lo posicionan como la primera aplicación de escritorio que entrena y ejecuta modelos de IA localmente.
Alibaba lanzó recientemente Wan-Animate-2, un modelo de pesos abiertos de 14 mil millones de parámetros que transfiere movimiento y expresiones faciales de un video conductor a una imagen estática de un personaje: humano, dibujo animado, robot o animal. Con soporte desde el primer día en ComfyUI, genera hasta 16 veces más rápido en NVIDIA RTX PRO 5000 Blackwell (48GB) y 26 veces más rápido en un NVIDIA RTX 5090 en comparación con Apple M3 Ultra.
LTX presentó LTX-2.5, el último modelo de generación de video de mundo abierto de vanguardia del equipo de investigación líder de LTX, proporcionando la base para casos de uso en medios y entretenimiento, robótica y generación en tiempo real, y ofreciendo videos de mayor calidad, mayor adherencia a las indicaciones y personajes, escenas y voces más consistentes a lo largo de las generaciones. El nuevo soporte multishot permite a los creadores generar secuencias que abarcan múltiples cortes mientras mantienen la continuidad, mientras que un decodificador de video de difusión mejorado mejora la fidelidad visual y reduce los artefactos.
Muse Glimmer de Meta es un modelo de pesos abiertos de 30 mil millones de parámetros optimizado para flujos de trabajo locales de agentes siempre activos. Es lo suficientemente pequeño como para ejecutarse en una PC con una sola GPU de consumo, permitiendo casos de uso que van desde agentes locales y llamadas a funciones hasta codificación local y evaluación de LLM como juez.
Fuente: https://blogs.nvidia.com/blog/local-ai-open-source-models-agents-nemotron/
¿Te ha interesado esta noticia?
Recibe cada mañana el resumen de IA y sociedad directo en tu email.
Suscríbete gratis →