Muse Code: Verificación de crash-replay y worktrees
Un arnés de cinco comprobaciones para evaluar si Muse Code sobrevive a refactorizaciones largas, worktrees paralelos y una tarifa económica que entrena con tu código.

El intercambio de datos es el primer precio
Una refactorización larga es el momento en que un agente de codificación conserva su trabajo o lo pierde. Muse Code es el agente de codificación en beta temprana de Meta para trabajo de software de larga duración y multiagente, disponible para macOS y Linux en Muse Spark 1.2. La tarifa Contributor es aproximadamente 12 veces inferior a la tarifa estándar en entrada y 21 veces inferior en salida, y otorga a Meta permiso para usar tus prompts y respuestas generadas para el entrenamiento futuro de modelos. Las funciones que importan para una refactorización larga son el registro de reproducción y los worktrees paralelos. Si sobreviven a una falla real, el agente puede valer la pena; si no, la puntuación del benchmark es solo decoración.
Las cinco comprobaciones son la verdadera prueba
- Fuerza un crash a mitad de tarea en una refactorización larga, mata el proceso tras al menos una edición y una aprobación, luego reinicia y compara el registro con el trabajo declarado. Muse Code mantiene una pista de auditoría local previa a la ejecución de llamadas de modelo, ejecuciones de herramientas, aprobaciones y ediciones, y el registro permite al runtime reproducir exactamente y reiniciar de forma segura tras un crash; una tarea larga que falla a las 20 horas puede reiniciarse desde el punto exacto de interrupción sin perder trabajo. Usa una refactorización que abarque múltiples archivos, no una corrección de una línea. El reinicio debe coincidir con el registro, sin ediciones duplicadas, aprobaciones faltantes o ramas divergentes.
- Ejecuta subagentes paralelos en una refactorización grande, comienza con una tarea lo suficientemente grande para distribuirse, fusiona los resultados uno a la vez e inspecciona el estado del repositorio. Muse Code puede dividir una tarea grande entre subagentes con capacidad de escritura, asignando a cada subagente su propio worktree de git, de modo que el trabajo paralelo no colisione en los mismos archivos y tu copia de trabajo principal permanezca intacta. Vigila colisiones de archivos, ramas mezcladas o una copia principal que cambie mientras los hijos ejecutan.
- Calcula el coste de tokens para tu mezcla esperada de entrada y salida antes de elegir una tarifa. Separa el contexto nuevo del contexto en caché, porque las refactorizaciones largas reutilizan el estado previo. La tarifa Contributor se cobra a $0.10 por millón de tokens de entrada y $0.20 por millón de tokens de salida, mientras que la tarifa estándar se cobra a $1.25 por millón de tokens de entrada y $4.25 por millón de tokens de salida, con entrada estándar en caché a $0.15. Estás listo para elegir una tarifa cuando puedas indicar la diferencia en dólares para entrada y salida nuevas.
- Comprueba si tu código puede entrenar a Meta. Los prompts y completaciones de la tarifa estándar están excluidos del entrenamiento de modelos. Meta impuso límites estrictos a los ingenieros de su división de IA aplicada que usan Claude Code de Anthropic y Codex de OpenAI, citando preocupaciones sobre destilación involuntaria. Lee los términos de la tarifa antes del primer prompt, no después del primer incidente. Si la tarifa puede usar tu trabajo para el entrenamiento futuro de modelos, trata tu código como datos de entrenamiento. Precia la tarifa como un intercambio de datos, no como un descuento. Si tu código contiene datos de clientes, algoritmos propietarios o secretos, la tarifa estándar es la opción predeterminada más segura. La respuesta debe ser sí o no, no una página de términos que saltaste.
- Verifica la coherencia de las puntuaciones de benchmarks de agentes de codificación de Terminal-Bench y DeepSWE contra tu propia tasa de fallo. Elige una refactorización que se parezca al trabajo de producción: múltiples archivos, pruebas y un modo de fallo real. Ejecútala varias veces y registra dónde el agente se rinde, entra en bucle o produce un parche incorrecto. Mantén tu propia tasa de éxito en el mismo tipo de refactorización, no solo un número de clasificación.
Los benchmarks son un mínimo, no un veredicto
En Terminal-Bench 2.1, Muse Spark 1.2 dentro de Muse Code logró una puntuación pass@1 del 82.9 %, por detrás de Opus 5 de Anthropic en Claude Code con 86.7 % y por delante de GPT-5.6 Terra de OpenAI en Codex con 81.8 %, y en DeepSWE 1.1 logró 59.3 %, tercero por detrás de Opus 5 de Anthropic con 65.0 % y GPT-5.6 Terra de OpenAI con 64.8 %. Tu propia tasa de fallo es el número que importa. Si el agente se rompe en la misma clase de tarea que tú entregas, la clasificación no lo salva.