Cómo medir si la IA te ahorra tiempo durante 7 días

Una respuesta instantánea no equivale a trabajo terminado. Para saber si una IA reduce tu esfuerzo, debes cronometrar hasta que el resultado sea aceptable para el uso previsto: preparar la entrada, generar o ejecutar, revisar, corregir, integrar y resolver el retrabajo que aparezca después.
Esta guía propone una autoauditoría práctica, no un experimento causal. El kit contiene 70 filas para cinco tareas, siete días y dos condiciones. Ranquia no realizó esa semana de trabajo y no presenta resultados propios. El CSV de ejemplo usa datos ficticios, no marcas, personas ni tareas reales.
Si todavía estás decidiendo si una suscripción merece siquiera una prueba, empieza por la criba de 30 minutos antes de pagar. Esa página evalúa una candidata, coste, privacidad y exportación. El protocolo de aquí comienza después: compara trabajo repetido durante una semana y decide por tipo de tarea.
Antes de cronometrar: define una salida aceptada
No midas una categoría vaga como “redactar” o “analizar datos”. Define una tarea repetible, su entrega y el criterio que debe cumplir antes de considerarla terminada. Congela también qué constituye un error crítico: una cifra inventada, una fila omitida o una promesa nueva pueden invalidar una salida aunque haya llegado rápido.
El workbook propone exactamente estas cinco tareas ficticias:
| ID | Tarea | Entrega | Condición de aceptación |
|---|---|---|---|
T01 | Clasificar 12 solicitudes ficticias | CSV con categoría y prioridad | 12/12 filas, solo etiquetas permitidas, al menos 11 categorías y 11 prioridades correctas contra el oráculo |
T02 | Extraer campos de 10 notas ficticias | Tabla de 10 filas por 5 campos | 10 filas, al menos 48/50 campos exactos, ausencias en blanco y ninguna invención |
T03 | Resumir un informe ficticio de 700–900 palabras | Resumen de 150–180 palabras | Al menos 7/8 hechos, dos límites conservados y cero hechos externos |
T04 | Redactar una respuesta operativa desde una ficha | Respuesta de 120–160 palabras | 5/5 hechos, dos exclusiones, siguiente paso y cero promesas nuevas |
T05 | Crear un esquema de seis diapositivas | Seis títulos, mensajes y evidencias | Seis diapositivas, cifras trazables, hipótesis y objetivo rotulados, y cero datos externos |
Puedes sustituir el contenido ficticio por trabajo autorizado, pero mantén el mismo nivel de dificultad dentro de cada par. Si cambias la tarea, el criterio o la calidad exigida a mitad de semana, registra una nueva versión: ya no es el mismo flujo.
No introduzcas datos personales, credenciales, secretos ni documentos de clientes solo para completar la medición. Prepara entradas autorizadas o sintéticas y revisa antes la privacidad de la herramienta de IA que vas a usar.
Usa dos relojes: tiempo activo y tiempo transcurrido
El protocolo separa dos preguntas que suelen mezclarse:
- Tiempo humano activo: minutos en que una persona prepara, ejecuta o redacta el prompt, revisa, corrige, integra y atiende retrabajo dentro de las 24 horas siguientes.
- Tiempo transcurrido: tiempo activo más la espera de la herramienta. Sirve para detectar un flujo lento, pero no convierte automáticamente cada minuto de espera en trabajo humano.

En cada fila, registra por separado:
active_prepare_min: abrir la fuente, entender la tarea y preparar el entorno.active_execute_prompt_min: ejecutar manualmente o redactar y ajustar la instrucción inicial.wait_min: espera sin trabajo humano; solo entra en el reloj transcurrido.active_review_min: comprobar la salida contra el oráculo o la rúbrica.active_correction_min: corregir o reformular hasta aceptar la salida o llegar al límite.active_integration_min: copiar, dar formato, exportar, guardar o reinsertar el resultado.displaced_rework_24h_min: limpieza o errores transferidos a otra etapa o persona durante la ventana de seguimiento.
Las fórmulas son:
human_active_total = prepare + execute/prompt + review + correction + integration + displaced_rework
wall_clock_component = human_active_total + wait
Una espera desatendida no suma tiempo humano activo. En cambio, revisar una salida, reconstruir formato o corregir un error al día siguiente sí consume trabajo y debe quedar en el registro.
Construye un baseline comparable
Cada día necesita un par de fixtures equivalentes: uno en condición MANUAL y otro en condición AI. No uses exactamente la misma entrada en ambos modos; recordar la primera resolución puede acortar artificialmente la segunda. En su lugar, prepara variantes A/B con longitud, hechos, restricciones, ausencias y dificultad semejantes.
El plan descargable enumera 14 identificadores de fixture por tarea —A y B para cada uno de los siete días— y una asignación determinista con la semilla RANQUIA-EXP-068-v1. Dentro de cada tarea, el orden MANUAL/AI y la asignación A/B quedan repartidos 3/4. No cambies el orden porque una variante parezca más cómoda.
Para reducir diferencias ajenas a la condición:
- usa la misma persona, equipo, idioma y entorno para ambos modos;
- registra herramienta, plan, cuenta, modo o modelo y versión del contexto;
- permite en el baseline manual las herramientas convencionales necesarias, pero anótalas;
- no consultes la primera salida para completar la segunda;
- conserva ambos fallos y cualquier recuperación manual;
- aplica una pausa fija entre corridas;
- puntúa idealmente con un revisor que no vea la condición ni el tiempo.
Un registro histórico solo sirve como baseline si conserva fecha, input comparable, criterio de aceptación y tiempos desglosados. Una estimación reconstruida de memoria debe quedar fuera.
Protocolo de siete días
El día 0 es para configurar; no cuenta como una ejecución. Congela tareas, criterios, errores críticos, cap de tiempo, herramienta, entorno y orden. En los días 1–7 completa un par por cada tarea: son 10 corridas diarias, 70 registros y 35 pares al cerrar la semana.

Usa este orden operativo:
- Abre
01_CONFIGy completa operador, revisor, fecha, herramienta, plan, contexto y umbrales antes de observar resultados. - Revisa en
02_TAREASla entrega, el gate de aceptación, la escala de calidad y el error crítico de cada tarea. - Sigue
03_PLAN_7Den el orden asignado; no selecciones solo los casos favorables. - Completa una fila de
04_REGISTROdurante la ejecución, no al final del día. - Haz la revisión de calidad con los outputs anonimizados cuando sea posible.
- Espera la misma ventana de 24 horas para capturar retrabajo en ambas condiciones.
- Lee
05_RESULTADOSsolo después de cerrar los datos del día.
Cada corrida tiene un límite inicial de 30 minutos. Alcanzarlo no convierte el valor en faltante: marca accepted=NO, conserva el tiempo y explica la causa. No borres un fallo ni lo reemplaces por la duración de una segunda ejecución más favorable.
Cómo completar y auditar la plantilla
La versión XLSX contiene ocho hojas: 00_LEEME, 01_CONFIG, 02_TAREAS, 03_PLAN_7D, 04_REGISTRO, 05_RESULTADOS, 06_EJEMPLO_FICTICIO y 07_DICCIONARIO. La plantilla vacía devuelve NO_CONCLUIR; no muestra una decisión favorable hasta que existan datos suficientes.

Tres reglas evitan resultados silenciosamente incorrectos:
- Vacío significa no observado;
0significa observado y nulo. No intercambies ambos estados. - Si falta un componente de tiempo, deja el total vacío, marca el par
MISSING_DATAy completamissing_reason. No imputes cero, promedio o recuerdo aproximado. - Conserva un
evidence_refrecuperable para cada salida, sin incluir información sensible. Puede ser una ruta, un hash o un identificador interno.
El CSV vacío es una alternativa interoperable, pero no ejecuta las fórmulas ni las validaciones del XLSX. El ejemplo ficticio permite revisar estructura y aritmética: no debes copiar sus tiempos como baseline ni usarlos para elegir una marca. El manifiesto publica tamaños y hashes de la plantilla, los dos CSV y las instrucciones para comprobar que esos cuatro archivos pertenecen a la misma versión; el manifiesto es el quinto descargable y no se auto-hashea.
El kit fue abierto, recalculado y reabierto con Excel 16.0. Tiene ocho hojas, no contiene macros ni enlaces externos y superó 176 de 176 comprobaciones deterministas. Esa validación cubre estructura, fórmulas y fixtures; no convierte el archivo ficticio en una prueba de productividad.
Cómo se comparan los pares
Solo calcula el porcentaje cuando el tiempo manual activo es mayor que cero y ambos registros del par son comparables. Las fórmulas por par son:
saved_active_min = manual_active − ai_active
paired_saved_pct = (manual_active − ai_active) / manual_active
Un valor negativo es información útil: en ese par, la condición con IA exigió más tiempo activo. No lo elimines. El resumen usa la mediana por tarea para que una sola ejecución extrema no gobierne toda la lectura, pero también debe mostrar los siete pares, el rango, la aceptación, la calidad, los errores críticos y los faltantes.
No mezcles las cinco tareas en un único porcentaje. Sus criterios y denominadores son distintos. Tampoco interpretes la posición de un modelo, el tiempo de CPU o la velocidad de generación como ahorro humano: el estimando termina en una salida aceptada.
Las cuatro decisiones del workbook

La decisión se toma por tarea, no por herramienta completa:
CANDIDATO_ADOPTAR
Requiere al menos seis pares medidos y aceptados, aceptación y mediana de calidad de AI no inferiores a MANUAL, cero errores críticos en AI, mediana de ahorro de al menos 20% y al menos cinco pares aceptados con ahorro positivo.
AJUSTAR
La calidad pasa y la mediana de ahorro es mayor que cero, pero falta consistencia o no se alcanza el umbral de 20%. Revisa instrucciones, integración o tipo de caso y repite sin cambiar retrospectivamente la semana cerrada.
NO_USAR
Se activa si la condición AI tiene menor aceptación o calidad, aparece un error crítico, o la mediana de ahorro es cero o negativa. Significa no usar ese flujo bajo las condiciones registradas; no es un veredicto universal sobre una marca.
NO_CONCLUIR
Faltan pares o datos, o no hay al menos seis pares donde ambas salidas fueron aceptadas. Amplía la medición; no rebajes el criterio para forzar una decisión.
Los umbrales son reglas editoriales preregistradas, no estándares científicos. Con siete observaciones y una sola persona no corresponde calcular una precisión promocional, atribuir causalidad ni extrapolar a otros equipos, tareas, planes o semanas.
Por qué los estudios no dan una cifra para tu trabajo
La evidencia publicada usa tareas y métricas diferentes. Un experimento de Noy y Zhang observó tiempo y calidad en tareas breves de escritura profesional. El estudio publicado de Brynjolfsson, Li y Raymond midió casos resueltos por hora en un despliegue de soporte. Un estudio de METR con herramientas de febrero a junio de 2025 encontró una desaceleración en 16 desarrolladores experimentados que realizaron 246 tareas en proyectos maduros conocidos. METR advirtió en febrero de 2026 que su seguimiento con herramientas más nuevas no ofrece una estimación fiable del efecto actual.
Estos hallazgos no se contradicen necesariamente: cambian la tarea, la población, la herramienta y el resultado medido. Ninguno predice cuánto tardarás tú en llegar a una salida aceptada. Úsalos como recordatorio de medir por flujo, no como porcentajes para rellenar tu hoja.
Errores que invalidan la semana
- elegir después solo las tareas donde la IA pareció rápida;
- usar entradas más fáciles en una condición;
- cambiar de modelo, plan, idioma o criterio sin registrarlo;
- detener el reloj en el primer borrador;
- bajar el requisito de calidad para aceptar una salida;
- excluir fallos, fallback manual o correcciones posteriores;
- sumar espera desatendida como si fuera trabajo activo;
- transferir la revisión a otra persona sin contar su tiempo;
- completar faltantes de memoria;
- interpretar una descarga o una semana pequeña como prueba causal.
La primera semana también puede incluir aprendizaje. Si la duración baja porque aprendiste la tarea o la interfaz, registra esa explicación; no atribuyas automáticamente el cambio a la IA.
Cuándo siete días no alcanzan
Extiende la observación si una tarea aparece menos de seis veces, varía mucho de tamaño, depende del cierre mensual, involucra a varias personas o tiene consecuencias de alto riesgo. Mantén las reglas congeladas y añade nuevos pares equivalentes; no combines familias distintas para alcanzar el mínimo.
Para comparar asistentes dentro de hojas de cálculo, puedes adaptar el enfoque de fixtures reproducibles para Excel y Google Sheets. Para un esquema de diapositivas, define “aceptada” con objetos y contenido editables y conserva ese criterio en tu registro. Estos ejemplos ayudan a diseñar criterios; sus artefactos o tiempos técnicos no son baseline de esta semana.
Método, límites y versión del kit
Este protocolo y el kit se prepararon el 14 de agosto de 2026. El programa fija 35 pares, alterna orden y fixtures, separa tiempo activo y espera, conserva faltantes y aplica las decisiones por tarea. El ejemplo incluido es completamente ficticio y sirve solo para comprobar fórmulas y estados.
La autoauditoría puede orientar una decisión local bajo el contexto registrado. No controla todos los efectos de aprendizaje, fatiga, orden, variación de dificultad o revisión. No demuestra que una herramienta causó un ahorro ni que repetirá el resultado en otra persona. Si cambia el archivo, contrasta su hash con el manifiesto y vuelve a revisar fórmulas, instrucciones y rótulos antes de usarlo.