El ex-intern de Alibaba que levantó $300 MDD para decidir qué tan buenos son tu Cursor o Copilot
UniPat AI vale $2.5 mil millones de dólares y Alibaba acaba de apostar fuerte en ella. Lo que hacen es simple pero crítico: decirte si los coding agents que usas realmente hacen lo que dicen.
Imagínate hacer tu internship en uno de los laboratorios de IA más importantes de China y salir con la idea que te hace multimillonario en menos de un año. Eso pasó. Li Kuan hizo su internship en Tongyi, la división de IA de Alibaba, y de ahí nació UniPat AI: una startup fundada a finales de 2025 que hoy vale $2.5 mil millones de dólares y acaba de cerrar una ronda de $300 millones liderada por Alibaba… por Alibaba. Sus propios ex-jefes.
¿Qué hace UniPat exactamente?
No construyen el próximo ChatGPT ni un coding agent que compita con Cursor. UniPat está en un negocio mucho más sutil y, la neta, más importante: decirte si los agentes de IA realmente pueden hacer lo que dicen que pueden.
La empresa desarrolla dos cosas clave:
-
Benchmarks y escenarios de evaluación: pruebas diseñadas para medir a los coding agents (los que escriben código por ti), los browser agents (los que navegan la web de forma autónoma) y los modelos multimodales que entienden imágenes y texto al mismo tiempo.
-
Datos humanos de entrenamiento: datos anotados por personas reales, exactamente lo que los laboratorios de IA necesitan y cada vez les cuesta más conseguir.
Básicamente, UniPat es el árbitro del mundo de los agentes de IA. Si un modelo dice que resuelve el 80% de los bugs reales de GitHub, son ellos quienes confirman o desmienten esa cifra.
El negocio de romper IAs
Los coding agents como Cursor, GitHub Copilot o Claude Code llevan meses compitiendo entre sí con benchmarks propios. Cada quien publica sus números y dice que es el mejor. El problema es que si Uber ya quemó todo su presupuesto de IA en 4 meses usando esas herramientas, alguien tiene que hacer la auditoría de verdad.
Ahí entra UniPat. Su producto estrella se llama Monthly-SWEBench: un benchmark que se actualiza mensualmente con 100 tareas nuevas sacadas de pull requests reales de GitHub. No son tareas inventadas en un laboratorio; son bugs y features reales que programadores humanos ya resolvieron en producción.
El proceso es ridículo de riguroso. Según la documentación del benchmark en su sitio, parten de unas 10,000 PRs en crudo cada mes y las filtran por un pipeline de seis etapas:
- Repositorios en Python, Go, C++, Java, Rust, TypeScript y JavaScript
- PRs que incluyan cambios de pruebas y más de 30 líneas modificadas
- Verificación de que el código pasa de “falla” a “pasa” con el fix correcto
- Alineación de instrucciones para que no haya requerimientos ocultos
- Rotación completa cada mes para eliminar overfitting
De 10,000 quedan 100. Solo las mejores. Significa que ningún modelo puede “memorizar” el benchmark porque cada mes son tareas completamente nuevas.
¿Quién está ganando actualmente?
Los resultados de junio 2026 del Monthly-SWEBench en la categoría de coding agents:
| Modelo | Score General | Bugs | Features |
|---|---|---|---|
| GPT-5.5-High | 76% | 80% | 72% |
| Claude-Opus-4.8-XHigh | 69% | 70% | 68% |
| GLM-5.2-Max | 65% | s/d | s/d |
Dato que no es menor: GLM-5.2-Max es un modelo chino de Zhipu AI. La competencia ya no es solo entre OpenAI y Anthropic; hay tres jugadores distintos en el podio.
Por qué Alibaba puso $300 millones aquí
Alibaba no está invirtiendo en UniPat por carita. Tiene estrategia calculada:
Primero, Alibaba compite directamente con OpenAI en el mercado de coding agents con su familia de modelos Qwen, que ya superó los 3 mil millones de descargas en agosto 2026 según Fortune, pasando a Meta y Google en adopción de modelos open source. Si Qwen quiere convencer a empresas de que su modelo es mejor que GPT-5.5, necesita benchmarks independientes que lo respalden. UniPat puede ser ese árbitro creíble, o al menos eso espera Alibaba.
Segundo, UniPat también genera datos humanos de entrenamiento, que es exactamente lo que todo laboratorio de IA necesita desesperadamente. Los datos de buena calidad se están convirtiendo en el commodity más escaso del sector.
La ronda también atrajo a otros gigantes: Tencent, HongShan (antes Sequoia China) y Jinqiu Fund, el fondo de ByteDance. Básicamente todos los grandes de China apostando al mismo caballo de infraestructura.
Esto no es casualidad. Como documentamos en el análisis del Stanford AI Index 2026, la infraestructura de evaluación se está volviendo tan crítica como los propios modelos. No sirve de nada tener el modelo más chingón si no puedes demostrar que lo es con rigor científico.
Lo que esto significa si usas Cursor o Copilot
Si eres dev en México y usas algún AI coding agent, UniPat afecta directamente tus decisiones de herramientas aunque nunca hayas oído el nombre.
La realidad es que muchos de los benchmarks que las empresas usan para vender sus productos son controlados, con tareas que ya conocen, o simplemente desactualizados. Monthly-SWEBench es diferente porque los modelos no pueden prepararse de antemano; las tareas son de PRs del mes anterior en repositorios reales.
Práctico para ti: la próxima vez que una empresa diga “nuestro agente resuelve el X% de las tareas de SWE-bench”, busca si ese número viene de un benchmark estático o de uno mensual como el de UniPat. La diferencia es enorme.
Y no te pierdas el ángulo de los browser agents: UniPat también evalúa agentes que navegan la web y ejecutan acciones cotidianas de forma autónoma. Si tu empresa está explorando automatización de procesos con IA, este es el tipo de infraestructura que va a decidir qué herramienta usar.
La pregunta que nadie está haciendo
UniPat no está sola en este espacio de datos para IA. Es parte de un boom silencioso de startups de infraestructura: las que no construyen el modelo ni la app final, sino la plomería que hace funcionar el ecosistema. Y en ese nicho, empresas como Manycore también están haciendo dinero vendiéndole datos a robots industriales.
El dato que más me llama la atención: UniPat fue fundada a finales de 2025 y en menos de un año ya vale $2.5B. Ese ritmo dice más sobre el estado del mercado de infraestructura de IA que cualquier análisis.
Pero hay una pregunta que nadie está respondiendo bien todavía: ¿puede UniPat mantener su neutralidad siendo financiada por Alibaba, Tencent y ByteDance, tres empresas cuyos modelos está evaluando? Es re piola que el benchmark sea abierto hoy, pero esa tensión va a crecer conforme los modelos chinos suban en el ranking.
Por ahora, el Monthly-SWEBench sigue siendo de los más confiables del sector. Pero vale la pena seguirlo de cerca.
¿Usas coding agents en tu trabajo y le das credibilidad a los benchmarks que publican? ¿O ya aprendiste a no creerles nada hasta verlo en producción? Cuéntanos abajo.
Fuentes
- Alibaba Backs Former Intern’s AI Testing Lab at $2.5 Billion Value - Bloomberg
- Alibaba eyes former intern’s AI infrastructure company in $300 million deal - Asia Tech Review
- UniPat Raises $300 Million Backed By Alibaba To Expand AI Testing and Benchmarking - VentureBurn
- Monthly-SWEBench Leaderboard - UniPat AI
- Alibaba AI models hit 3 billion downloads, passing Meta, Google - Fortune
Comentarios
No te pierdas ningún post
Recibe lo nuevo de Al Chile Tech directo en tu correo. Sin spam.
También te puede interesar
China le declara la guerra a NVIDIA: el Zhenwu V900 de Alibaba es el chip de IA más poderoso del país y esto cambia todo para las empresas en LATAM
T-Head presentó el Zhenwu V900 con 216GB de memoria, 3x más rendimiento que su predecesor y soporte para clusters de 500,000 chips. Con producción masiva en Q1 2027 y un modelo de 10 billones de parámetros en entrenamiento, Alibaba Cloud ya tiene data center en Querétaro.
China formó su propio bloque de IA y México no está invitado: qué significa el anuncio de BRICS en Nueva Delhi
Xi Jinping propuso una zona de IA open source para las 11 naciones BRICS con modelos LLM, infraestructura compartida y cero dependencia de OpenAI o Google. México no es miembro, Brasil sí. ¿Qué hacemos?
Claude Opus 5 existe y triplica todos los benchmarks: $5 por millón de tokens y le ganó a Fable 5 en ARC-AGI 3
Anthropic lanzó Claude Opus 5 el 24 de julio: scores tres veces más altos en ARC-AGI 3, mejor que Fable 5 en OSWorld 2.0, y al mismo precio que Opus 4.8. La guía definitiva para devs mexicanos de cuándo vale el salto.