Metodología · IA y productividad

Metodología basada en evidencia.

Nuestra forma de formar y transformar equipos es empírica: cada práctica que enseñamos se apoya en lo que los estudios demuestran — y se mide antes y después. Aquí está la evidencia en la que nos basamos, estudio a estudio, con su aplicación concreta en nuestro trabajo.

Estudiamos tu caso

Cuéntanos dónde está tu equipo y te contamos qué metodología aplicaríamos — y con qué evidencia.

No hace falta que nos creas.

Los estudios de referencia sobre IA y productividad, resumidos en llano, con sus matices y con enlace al original.

Resumimos y señalamos los límites de cada estudio. El mérito es de los autores — lee los originales.

2026

+24%
Microsoft (arXiv) · 2026 · Murphy-Hill, Butler y Savelieva
Microsoft (arXiv) · 2026

Los ingenieros que adoptaron agentes de IA de línea de comandos (Claude Code y GitHub Copilot CLI) fusionaron aproximadamente un 24% más de pull requests, con el efecto sostenido durante los cuatro meses observados.

Estudio del despliegue de agentes CLI en Microsoft a principios de 2026 sobre decenas de miles de ingenieros, con telemetría real y un contrafactual sintético construido con desarrolladores que nunca usaron las herramientas. Uno de los primeros estudios a escala sobre agentes autónomos (no autocompletado) en producción.

Matiz: Es observacional (adopción no aleatorizada, contrafactual sintético) y las PRs fusionadas son un proxy imperfecto del valor entregado, como admiten los propios autores.

Cómo lo aplicamos: Es la evidencia a escala de nuestra tesis: el salto está en pasar del autocompletado a los agentes. Formamos a los equipos exactamente en ese salto — de "usar IA" a dirigir Claude Code con specs, contexto y loops.

Leer el estudio
+26,08%
Management Science (MIT, Princeton, Microsoft) · 2026 · Cui, Demirer, Jaffe, Musolff, Peng y Salz
Management Science (MIT, Princeton, Microsoft) · 2026

Los desarrolladores con acceso aleatorio a un asistente de código de IA completaron un 26,08% más de tareas que el grupo de control.

Tres RCTs en empresas reales (Microsoft, Accenture y una Fortune 100) con 4.867 desarrolladores en total, publicados en Management Science en febrero de 2026. Los desarrolladores menos experimentados mostraron mayor adopción y mayores ganancias.

Matiz: El error estándar es amplio (10,3%), las ganancias se concentran en perfiles junior, y el experimento de Accenture es el mismo que GitHub difundió en 2024 — este paper es su versión revisada por pares y agregada.

Cómo lo aplicamos: La ganancia se concentra en quien menos experiencia tiene — si el sistema le presta criterio. Usamos este dato para diseñar el rollout: primero el sistema (specs, revisión, guardrails), después las licencias.

Leer el estudio
+14% a +50%
Stanford HAI (AI Index 2026) · 2026 · AI Index Steering Committee
Stanford HAI (AI Index 2026) · 2026

Las ganancias medidas de productividad con IA van del 14–15% en soporte al cliente al 26% en desarrollo de software y el 50% en output de marketing, y son mayores en trabajo estructurado y medible que en tareas de razonamiento profundo.

Capítulo de economía del AI Index 2026 de Stanford, la síntesis anual de referencia de la evidencia empírica. Reporta además un 88% de adopción organizacional de IA y una caída de casi el 20% desde 2024 en el empleo de desarrolladores de 22–25 años.

Matiz: Es una síntesis de estudios de terceros, no investigación primaria — el 26% de software proviene del RCT de Cui et al. — y advierte de posibles penalizaciones de aprendizaje por dependencia excesiva de la IA.

Cómo lo aplicamos: Usamos el AI Index como mapa de expectativas por dominio: dónde la ganancia es estructural y dónde todavía no. Ajustamos cada formación y transformación a ese mapa en vez de prometer el mismo múltiplo en todo.

Leer el estudio

2025

>80%
DORA / Google Cloud · 2025 · State of AI-assisted Software Development
DORA / Google Cloud · 2025

El 90% de los profesionales tecnológicos ya usa IA y más del 80% percibe que ha aumentado su productividad — pero mayor adopción se asocia a la vez con más throughput y más inestabilidad en las entregas.

Informe 2025 de DORA (casi 5.000 profesionales encuestados y más de 100 horas de investigación cualitativa). Su conclusión central: la IA es un amplificador — magnifica las fortalezas de las organizaciones que funcionan bien y las disfunciones de las que no.

Matiz: La productividad es auto-reportada (percepción, no medición directa) y el 30% de los encuestados confía poco o nada en el código generado por IA.

Cómo lo aplicamos: "La IA amplifica lo que ya eres" es la frase que más usamos con dirección: por eso no empezamos por la herramienta sino por los fundamentos que amplifica — flujo de entrega, specs, revisión. Sobre base sólida multiplica; sobre caos, multiplica el caos.

Leer el estudio
−2 h/semana
NBER (Microsoft Research / HBS) · 2025 · Dillon, Jaffe, Immorlica y Stanton
NBER (Microsoft Research / HBS) · 2025

Los trabajadores con una IA generativa integrada en sus herramientas dedicaron dos horas menos a la semana al email y redujeron el trabajo fuera de horario — pero no cambió la cantidad ni la composición de sus tareas.

Field experiment de 6 meses en 66 empresas con 7.137 trabajadores del conocimiento, asignando aleatoriamente acceso a una IA integrada en email, reuniones y escritura. Los efectos se midieron con telemetría real de uso, no con encuestas.

Matiz: Dar IA a individuos sin rediseñar procesos no cambió qué trabajo se hace: el tiempo ahorrado no se tradujo en más output detectable.

Cómo lo aplicamos: El estudio que explica por qué "repartir licencias" no transforma nada: sin rediseñar el proceso, el tiempo ahorrado se evapora. Nuestras transformaciones rediseñan el flujo de trabajo para que las horas liberadas se conviertan en entrega.

Leer el estudio
-19%
METR · 2025 · Becker, Rush, Barnes, Rein
METR · 2025

Desarrolladores open source experimentados tardaron un 19% MÁS en completar tareas reales cuando se les permitió usar herramientas de IA, pese a que ellos esperaban ir un 24% más rápido.

RCT de METR con 16 desarrolladores experimentados resolviendo 246 issues reales (~2 h cada una) en repositorios open source maduros que ellos mismos mantienen, con asignación aleatoria de permitir o prohibir IA por tarea.

Matiz: Muestra pequeña (16 desarrolladores) y contexto muy específico — expertos que conocen su codebase a fondo, con herramientas de principios de 2025 —, así que no generaliza a todos los equipos ni a herramientas posteriores.

Cómo lo aplicamos: La IA sin método frena incluso a los mejores. Es el estudio que más citamos al empezar una transformación: no instalamos herramientas, cambiamos la forma de trabajar —contexto, harness, loops—, que es donde aparece la ganancia.

Leer el estudio

2024

+8,69%
GitHub / Accenture · 2024 · GitHub + Accenture
GitHub / Accenture · 2024

En el ensayo aleatorizado con desarrolladores de Accenture, Copilot produjo un 8,69% más de pull requests por desarrollador, un 15% más de merge rate y un 84% más de builds exitosas.

Ensayo controlado aleatorizado en entorno enterprise real: desarrolladores de Accenture asignados a grupo con Copilot o control, midiendo métricas objetivas de flujo de trabajo (PRs, merges, builds) más encuestas de percepción.

Matiz: Es investigación del propio vendor (GitHub vende Copilot), varias métricas clave son auto-reportadas y el post no publica el número de participantes.

Cómo lo aplicamos: Del laboratorio al enterprise la cifra baja de +55% a un dígito: la diferencia es el sistema alrededor de la herramienta. Nuestro trabajo de transformación va justo ahí — el flujo (specs, CI, revisión) que convierte velocidad individual en entrega.

Leer el estudio
-7,2%
DORA / Google Cloud · 2024 · Accelerate State of DevOps
DORA / Google Cloud · 2024

Un aumento del 25% en adopción de IA se asocia con una reducción estimada del 7,2% en la estabilidad de la entrega de software y del 1,5% en el throughput, aunque sube la productividad individual (+2,1%) y la calidad de código y documentación.

Décimo informe anual Accelerate State of DevOps, basado en la encuesta global de DORA a profesionales técnicos (más de 39.000 acumulados en la década de investigación). Modela el cambio estimado en resultados de entrega según el grado de adopción de IA.

Matiz: Son estimaciones correlacionales de encuesta, no un experimento; DORA hipotetiza que la causa es el aumento del tamaño de los cambios (batch size) al generar más código con IA — es decir, un problema de método, no de herramienta.

Cómo lo aplicamos: Es la razón de que enseñemos desarrollo agéntico con specs y cambios pequeños: más código no es más entrega. Instrumentamos el delivery —PRs pequeñas, CI, observabilidad— para que la velocidad individual no se pague en estabilidad.

Leer el estudio

2023

+55,8%
GitHub / Microsoft Research · 2023 · Peng, Kalliamvakou, Cihon, Demirer
GitHub / Microsoft Research · 2023

El grupo con acceso a GitHub Copilot completó la tarea un 55,8% más rápido que el grupo de control.

Experimento controlado (RCT) con desarrolladores de software reclutados a los que se pidió implementar un servidor HTTP en JavaScript lo más rápido posible. Se midió el tiempo de compleción del grupo con Copilot frente al grupo sin él.

Matiz: Es una única tarea de laboratorio bien acotada, no trabajo real en un codebase de producción, y los autores trabajan en GitHub/Microsoft, el vendor de la herramienta.

Cómo lo aplicamos: La ganancia grande aparece en tareas bien delimitadas. Por eso enseñamos a trocear el trabajo en specs pequeñas y acotadas antes de dárselas a los agentes: la aceleración de laboratorio solo se traslada a producción si la tarea se le parece.

Leer el estudio
+25,1%
Harvard Business School / BCG · 2023 · Dell'Acqua et al. (Organization Science)
Harvard Business School / BCG · 2023

En 18 tareas dentro de la frontera de capacidades de la IA, los consultores con GPT-4 completaron un 12,2% más de tareas, un 25,1% más rápido y con una calidad un 32% mayor de media.

Experimento de campo prerregistrado con 758 consultores de BCG asignados aleatoriamente a sin IA, GPT-4, o GPT-4 con introducción a prompting, sobre tareas realistas de consultoría (creativas y analíticas) con baseline previo de rendimiento.

Matiz: En una tarea compleja elegida fuera de la frontera de la IA, los sujetos con IA fueron un 19% menos propensos a producir soluciones correctas que los que trabajaron sin ella.

Cómo lo aplicamos: Entrenamos exactamente esa frontera: el criterio de qué delegar a la IA y qué no. En las formaciones se practica a reconocer cuándo la tarea está dentro de sus capacidades y cuándo te va a llevar, con mucha confianza, al sitio equivocado.

Leer el estudio
+14%
NBER · 2023 · Brynjolfsson, Li, Raymond
NBER · 2023

El acceso a un asistente de IA generativa aumentó un 14% de media los casos resueltos por hora en soporte al cliente, con un +34% en agentes novatos o de baja cualificación.

Estudio del despliegue escalonado de un asistente conversacional basado en IA generativa con datos de 5.179 agentes de soporte al cliente. La productividad se midió como casos resueltos por hora.

Matiz: El efecto medio esconde una fuerte heterogeneidad: casi todo el beneficio está en los novatos y el impacto en agentes experimentados y cualificados es mínimo.

Cómo lo aplicamos: La IA rinde más cuando lleva dentro el criterio de los mejores. En las transformaciones codificamos el saber sénior del equipo —specs, contexto, guardrails— para que la herramienta eleve a todo el equipo, no solo asista a quien ya sabía.

Leer el estudio
hasta 2x
McKinsey Digital · 2023 · Karaci Deniz, Gnanasambandam, Harrysson et al.
McKinsey Digital · 2023

Con IA generativa, documentar código se completó en la mitad del tiempo, escribir código nuevo en casi la mitad, y refactorizar en casi dos tercios del tiempo — hasta el doble de rápido en tareas comunes.

Estudio de laboratorio de McKinsey con más de 40 de sus desarrolladores en EE. UU. y Asia, que durante varias semanas realizaron tareas de generación, refactorización y documentación de código, alternando entre grupo con dos herramientas de IA y grupo de control.

Matiz: En tareas de alta complejidad el ahorro cayó por debajo del 10%, y a los desarrolladores con menos de un año de experiencia algunas tareas les llevaron un 7-10% MÁS tiempo con las herramientas; además es un estudio interno de consultora, no peer-reviewed.

Cómo lo aplicamos: El retorno depende de la tarea y del nivel de partida — por eso medimos Tech Fluency y AI Fluency antes y después de formar, y priorizamos las tareas donde el retorno es real en vez de prometer el doble en todo.

Leer el estudio