Construye tu propio robot Xiaomi con el innovador código abierto Xiaomi-Robotics-0
hace 6 meses · Actualizado hace 6 meses

A 12 de febrero de 2026Xiaomi presentó oficialmente su primer modelo robótico VLA (Vision-Language-Action) de código abierto, bautizado como “Robótica Xiaomi-0”. Con 4,7 mil millones de parámetros, este sistema fusiona comprensión del lenguaje visual y ejecución en tiempo real, marcando nuevos récords SOTA en varias pruebas de referencia.
A continuación se muestran las características técnicas y capacidades clave del modelo:
Arquitectura: una sinergia entre cerebro y cerebelo
Para equilibrar comprensión general y control preciso, Xiaomi-Robotics-0 adopta una “Mezcla de Transformadores” (MoT) en su diseño.
Cerebro del lenguaje visual (VLM): Basado en una base VLM multimodal, entiende órdenes humanas vagas (por ejemplo, “dobla la toalla”) y capta relaciones espaciales a partir de entradas visuales de alta resolución.
Cerebelo de ejecución de acciones (experto en acciones): Para movimientos suaves y de alta frecuencia, se emplea una capa múltiple. Transformador de transmisión (DiT) se integra. En lugar de emitir una acción única, genera una “Parte de acción” y garantiza un fiable Ajuste de flujo tecnológico.
Formación: evitando el “tontizamiento”
Muchos modelos VLA pierden comprensión general al aprender acciones. Xiaomi aborda este reto con un entrenamiento híbrido que conjuga datos multimodales con datos de acción:
Entrenamiento VLM sinérgico: Con una “Propuesta de acción”, el mecanismo obliga al VLM a predecir distribuciones de acciones mientras comprende imágenes, alineando el espacio de características del VLM con el espacio de acción.
Formación de especialistas en DiT: El VLM permanece congelado y el DiT se entrena para recuperar secuencias de acción precisas del ruido, confiando plenamente en funciones KV para la generación condicional.

Movimientos fluidos y en tiempo real
Para abordar el “tartamudeo de acción” por la latencia de inferencia en robots reales, el equipo introdujo técnicas innovadoras:
Inferencia asincrónica: Desacopla razonamiento del modelo de la ejecución del robot, permitiendo que ambas partes trabajen de manera asíncrona para un movimiento más suave.
Prefijo de acción “Limpiar”: Emplea la acción prevista como entrada para mantener la trayectoria y reducir paradas innecesarias.
Máscara de atención Λ: Una máscara de atención especial fuerza al modelo a centrarse en la retroalimentación visual actual en lugar de la inercia histórica, permitiendo respuestas muy rápidas ante cambios del entorno.

Rendimiento y disponibilidad
Referencias líderes: En pruebas de simulación, el modelo obtuvo los mejores resultados entre 30 modelos en plataformas como LÍBERO, CALVINO y Env más simple.
Desafíos del mundo real: En pruebas con robots de dos brazos, demostró una coordinación ojo-mano superior en tareas prolongadas, como desmontar bloques y doblar toallas suaves.
Compatibilidad de hardware: Soporta inferencia en tiempo real en tarjetas gráficas de consumo.

Puntos de referencia de rendimiento
Artículo relacionado:


Resta asincrónica
Xiaomi ha publicado al público la página del proyecto, el código fuente y los pesos del modelo:
- Página del proyecto: https://xiaomi-robotics-0.github.io
- Código: https://github.com/XiaomiRobotics/Xiaomi-Robotics-0
- Pesos del modelo: https://huggingface.co/XiaomiRobotics
Gracias por confiar en nosotros y recuerda que puedes seguirnos en nuestras redes sociales tanto en nuestro grupo de ayuda en Telegram, Instagram, Facebook y Twitter para estar al tanto de las últimas noticias y novedades de Xiaomi. Si tienes alguna consulta estaremos encantados de poder ayudarte.
Últimos lanzamientos de la semana en Xiaomi:

Xiaomi lanza el acuario inteligente Mijia Fish Tank 2 Pro con autoalimentación por 85 dólares

Xiaomi revela cronograma de HyperOS 4 con Android 17 y nueva interfaz

