Empieza a construir una red más resolutiva
Agenda una demo y te mostramos el impacto con los números de tu red.
Comparamos Teral AI con Claude Sonnet 4.5 en 300 interconsultas reales de tres especialidades. La ventaja del retrieval se concentra justo donde la práctica clínica lo necesita.

Teral AI vive dentro de la plataforma como un agente que cualquier médico puede consultar desde un chat. A diferencia de un LLM generalista, tiene acceso — vía búsqueda semántica sobre Vertex AI Search — a más de 6.000 casos clínicos resueltos y completamente anonimizados, publicados por médicos reales en interconsultas previas.
La hipótesis que queríamos probar era simple: en tareas médicas específicas, un agente con acceso a precedentes clínicos reales debería responder mejor que un modelo generalista de tamaño equivalente, sin ese contexto. Si la hipótesis se sostiene, valida tanto la arquitectura del producto como el valor del dataset que los médicos de Teral han construido con sus interconsultas.
Elegimos Claude Sonnet 4.5 como comparación porque es un modelo generalista de frontera con un tier comparable al Gemini sobre el que construimos Teral AI. Queríamos medir el impacto del retrieval, no de la brecha entre modelos base.
Teral AI superó a Claude en las cinco dimensiones evaluadas. La tabla siguiente muestra los scores promedio sobre los 300 casos del benchmark.
| Dimensión | Teral AI | Claude Sonnet 4.5 | Δ |
|---|---|---|---|
| Precisión diagnóstica | 4,62 | 4,15 | +11,3% |
| Calidad del tratamiento | 3,92 | 3,32 | +18,1% |
| Exámenes complementarios | 4,10 | 3,33 | +23,1% |
| Calidad general | 4,65 | 4,27 | +8,9% |
| Seguridad clínica | 4,77 | 4,50 | +6,0% |
| Score total (sobre 25) | 22,07 | 19,57 | +12,8% |
Si en lugar de promedios comparamos el resultado caso por caso, Teral AI ganó en más del doble de interconsultas que Claude.
Diseñamos el benchmark para que fuera comparable, ciego y ejecutable sobre casos reales — no sintéticos.
Seleccionamos 300 interconsultas reales publicadas por médicos en la plataforma Teral, distribuidas en partes iguales entre tres especialidades: dermatología, ortopedia y traumatología, y otorrinolaringología. Todos los casos tenían al menos un comentario sustancial (≥30 caracteres) de un especialista, es decir, contaban con una respuesta clínica de referencia generada por un médico real.
Ambos servicios recibieron exactamente el mismo prompt, con la descripción clínica del caso y una estructura de respuesta común (análisis, diagnósticos diferenciales, exámenes sugeridos, tratamiento y recomendaciones). Teral AI podía consultar su base de casos similares durante la generación; Claude respondía únicamente con su conocimiento general.
Usamos Gemini 2.5 Flash como juez automatizado. Las respuestas se le presentaron sin etiqueta de origen y en orden aleatorio por caso, para evitar sesgo posicional y de marca. El juez calificó cinco dimensiones en una escala de 1 a 5:
La ventaja de Teral AI no se reparte por igual entre las dimensiones. Crece donde el acceso a casos similares importa más — recomendación de exámenes específicos, combinaciones de tratamiento, priorización de diagnósticos — y se aplana donde ambos modelos ya parten de una línea base alta, como seguridad clínica.
Tiene sentido clínico: cuando un modelo generalista enfrenta un caso de lesiones eritematosas en miembros inferiores, tiene que razonar desde principios generales. Teral AI puede buscar casos previos con presentaciones clínicas similares que ya tienen diagnóstico confirmado y tratamiento documentado por un especialista, y usar esa evidencia real para priorizar diagnósticos, recomendar estudios específicos y proponer manejos con dosis y duraciones concretas.
La seguridad clínica, en cambio, es una línea base alta para ambos modelos: los LLMs modernos están entrenados para ser conservadores en recomendaciones médicas, y el contexto adicional aporta poco cuando ya se está cerca del techo.
La ventaja se sostiene en las tres especialidades, con diferencias entre 2,2 y 3,0 puntos sobre 25.
Dermatología, con casi cuatro veces más casos indexados que ortopedia, muestra la mayor ventaja. Pero la diferencia entre ortopedia y otorrinolaringología es casi idéntica, aunque sus volúmenes difieran. La lectura preliminar es que a más casos indexados, mayor ventaja — pero con retornos decrecientes. Pasar de cero a unos cientos de casos parece aportar la mayor parte del valor; el resto refina.
Un benchmark es tan útil como honesto. Estas son las limitaciones que queremos declarar abiertamente, y los siguientes pasos que ya tenemos identificados.
Usamos Gemini 2.5 Flash como juez porque no es ninguno de los dos servicios evaluados. Pero Teral AI está construido sobre Gemini + tools, por lo que comparte familia de modelo base con el juez. No sabemos aún qué magnitud de sesgo introduce esto. Para la próxima iteración del benchmark planeamos correr una validación humana con especialistas clínicos sobre una submuestra y reportar la correlación entre los scores humanos y automatizados.
Las tres especialidades evaluadas son las que tienen mayor volumen de casos en la plataforma, lo cual también las convierte en el mejor escenario posible para el retrieval. No sabemos aún cómo se comporta Teral AI en especialidades con pocos casos indexados, ni en áreas como medicina interna o pediatría.
Las respuestas de especialistas en interconsultas reales pueden ser breves, informales o incompletas. Son el dato que tenemos sobre cómo responde un médico en la práctica, pero no necesariamente representan el gold standard clínico ideal. El juez evaluó cualitativamente la completitud y pertinencia de cada respuesta; no hizo una comparación directa contra la respuesta del médico real.
Este primer reporte muestra diferencias de medias. En la siguiente versión incluiremos intervalos de confianza, tests estadísticos pareados y análisis de la distribución de scores, para poder distinguir diferencias reales de ruido.
Ninguna de estas limitaciones invalida el resultado principal, pero sí acotan su interpretación. Lo que el benchmark muestra es que el acceso a casos clínicos reales mejora materialmente las respuestas de un LLM en las dimensiones donde los precedentes importan. Lo que no muestra todavía es si esa ventaja se traduce en mejor toma de decisiones clínicas en la práctica. Esa es una pregunta distinta, y la responderemos con estudios diseñados para eso.
Este benchmark es la primera versión pública de un proceso de evaluación que queremos correr de forma recurrente. Los próximos pasos son:
Seguiremos publicando los resultados aquí. Si eres médico y quieres probar Teral AI, puedes hacerlo desde la app o en chat.teral.ai.
claude-sonnet-4-5-20250929. El agente Teral AI utiliza Gemini como modelo base con retrieval sobre Vertex AI Search. El dataset de evaluación, los prompts utilizados y los scripts del benchmark están disponibles para consulta del equipo clínico y de investigación.
VeriMed es el sistema con el que Teral verifica que cada radiografía y cada foto clínica sea auténtica y corresponda al caso. Así funciona, y por qué la decisión final nunca la toma la máquina.

Directores médicos y CIOs: Descubran cómo elegir e integrar exitosamente plataformas de chat médico con IA para optimizar la atención y eficiencia en su institución de salud en Colombia.

Descubra cómo los chats médicos impulsados por IA transforman la telemedicina B2B en Colombia, ofreciendo eficiencia operativa, mejora en la atención al paciente y un retorno de inversión tangible para hospitales y clínicas.
Agenda una demo y te mostramos el impacto con los números de tu red.