El test de Sean Ellis le pregunta a los usuarios cómo se sentirían si ya no pudieran usar tu producto. Si el 40% responde "muy decepcionado", la lectura habitual es que tienes product-market fit.
El umbral viene de Ellis midiendo unas 100 startups y notando que las que crecían bien superaban el 40% y las que se estancaban no. Nunca publicó los datos de base, y los investigadores de MeasuringU no encontraron ninguna validación revisada por pares del ítem, concluyendo que "hay poca evidencia convincente para respaldar su promoción para uso práctico".
Esa es una crítica justa, y no es el problema práctico. El problema práctico es aritmético, y aplica incluso si el 40% es exactamente el número correcto.
Qué significa realmente un resultado de encuesta
Los resultados de encuesta cargan un margen de error que depende de cuánta gente respondió. Corriendo los números para un resultado medido de 40%, al 95% de confianza:
| Respuestas | El valor real está en algún lugar de | Margen |
|---|---|---|
| 10 | 17% – 69% | ±26% |
| 20 | 22% – 61% | ±20% |
| 30 | 25% – 58% | ±17% |
| 50 | 28% – 54% | ±13% |
| 100 | 31% – 50% | ±9% |
| 200 | 33% – 47% | ±7% |
| 400 | 35% – 45% | ±5% |
| 1.000 | 37% – 43% | ±3% |
Con 20 respuestas, un número normal para un producto temprano, medir 40% significa que la cifra real está en algún lugar entre 22% y 61%. Ese rango contiene tanto "ni cerca del fit" como "cómodamente pasado".
Por debajo de 100 respuestas el test ni siquiera puede separar un producto de 40% de uno de 30%. Los intervalos se superponen.
Ocho de veinte y doce de veinte son el mismo resultado
Dale la vuelta. Con 20 respuestas, estos son todos los resultados cuyo intervalo de confianza todavía contiene al 40%:
| Resultado | Se lee como | El valor real podría ser |
|---|---|---|
| 4 de 20 | 20% | 8% – 42% |
| 6 de 20 | 30% | 15% – 52% |
| 8 de 20 | 40% | 22% – 61% |
| 10 de 20 | 50% | 30% – 70% |
| 12 de 20 | 60% | 39% – 78% |
Cada fila es estadísticamente consistente con un valor real de 40%. Un founder que saca 6 de 20 y concluye que no tiene fit, y uno que saca 12 de 20 y concluye que sí, corrieron el mismo experimento y aprendieron lo mismo, que es nada.
Qué hace falta para superar la barra de verdad
Para tener confianza en que el valor real está por encima del 40%, todo el intervalo de confianza tiene que quedar por encima del 40%. Eso depende del tamaño de muestra y de qué tan por encima de la línea caigas:
| Si mides | Necesitas |
|---|---|
| 45% | 369 respuestas |
| 50% | 93 respuestas |
| 55% | 41 respuestas |
| 60% | 24 respuestas |
| 70% | 11 respuestas |
Un resultado cerca del umbral es el caro. Pasar raspando con 45% requiere 369 respuestas para defenderlo. Caer en 60% se defiende con 24.
Esta es la forma útil de la regla, y da vuelta el consejo habitual. Si tu muestra temprana cae en cualquier lugar cerca del 40%, no tienes una respuesta, y juntar unas pocas respuestas más no te la va a dar.
Qué hacer con n chico
La encuesta no es inútil por debajo de 100 respuestas. Es inútil como umbral por debajo de 100 respuestas.
Lee el texto libre, no el porcentaje. Las preguntas de seguimiento sobre qué usarías en su lugar y cuál es el beneficio principal dan señal usable con n = 15. El porcentaje no.
Trata un puntaje bajo como informativo y uno limítrofe como ruido. 3 de 20 tiene un intervalo de 5% – 36%, que sí descarta el 40%. 8 de 20 no descarta nada.
Usa comportamiento donde puedas. La retención, la recompra y las referencias se miden sobre todos los usuarios y no sobre el puñado que contesta una encuesta, así que la misma población te da una estimación mucho más ajustada. Es la misma razón por la que el Mom Test prefiere lo que la gente ya hizo por sobre lo que dice que haría.
Haz la pregunta que la encuesta está reemplazando. La encuesta de PMF es un proxy de si la gente extrañaría el producto lo suficiente como para pagarlo. La disposición a pagar y el gasto que ya existe en alternativas responden eso directamente, sin problema de tamaño de muestra, y están disponibles antes de que el producto exista. Es la diferencia entre un producto útil y un producto por el que se paga.
Método
La estadística. Intervalos de Wilson al 95% de confianza, que se comportan mejor que la aproximación normal en muestras chicas y cerca de los extremos. Cada cifra de arriba es reproducible solo a partir del tamaño de muestra y la proporción; no hay datos propietarios involucrados. La columna de "respuestas necesarias" es el n más chico en el que el límite inferior del intervalo supera 0,40, manteniendo fija la proporción medida. Exigir además que la cantidad de respondentes sea un número entero mueve la fila del 45% de 369 a 380, porque el 45% de 369 no es entero.
Qué no está argumentando esto. Nada de acá dice que el 40% sea el umbral equivocado. El benchmark puede estar bien. La afirmación es más acotada: a los tamaños de muestra que los founders realmente usan, un resultado medido no puede distinguir superar el umbral de no superarlo.
Un supuesto que vale la pena declarar. Estos intervalos asumen que las respuestas son una muestra aleatoria de tus usuarios. Las respuestas de encuesta no son aleatorias, porque los más comprometidos contestan más seguido, lo que empuja los resultados reales hacia arriba y hace que las muestras chicas sean peores, no mejores, de lo que sugiere la tabla.
Fuentes
MeasuringU — The Product-Market Fit Item Una revisión de investigación sobre el ítem de Sean Ellis. Los autores rastrean el umbral del 40% hasta la experiencia de su creador y no hasta datos publicados, reportan no haber encontrado ningún paper revisado por pares que describa investigación con el ítem, y recomiendan no darle peso indebido al umbral en decisiones de negocio. Su razonamiento incluye el mismo problema de precisión que cubrimos arriba.
Los intervalos. Intervalos de Wilson, estándar en la literatura estadística para proporciones binomiales. Cada número de este artículo se puede reproducir a partir del tamaño de muestra y la proporción con cualquier paquete estadístico, y preferimos que lo verifiques a que nos creas.
Citar este reporte
Una encuesta de product-market fit con 20 respuestas tiene un margen de error de ±20%: un 40% medido significa que el valor real está entre 22% y 61%. Confirmar un resultado de 45% requiere 369 respuestas. — Scoutr, The 40% Rule and Sample Size