Tres formas de añadir un modelo de lenguaje
El modelo es el motor que hay debajo de una función de IA: el asistente que responde a partir de sus documentos, el agente que abre un ticket, el clasificador que ordena el correo entrante. El software que lo rodea (el inicio de sesión, las pantallas, el índice de búsqueda, las herramientas que puede usar el agente, las pruebas) es casi el mismo sea cual sea el modelo. Lo que cambia es cómo paga el modelo, quién lo ejecuta y qué puede cambiar de él.
| Vía | Qué es | Qué paga | Qué controla |
|---|---|---|---|
| De vanguardia | Un modelo comercial puntero, al que se llama a través de la API del proveedor. | Tokens: cada palabra que entra y sale, todos los meses. | Sus prompts, sus herramientas y sus datos. No el modelo, sus versiones ni sus fechas de retirada. |
| De código abierto | Un modelo con los pesos publicados, ejecutado en los servidores que usted elija. | Servidores con GPU, todos los meses, haya mucho trabajo o poco. | La versión del modelo, dónde se ejecuta y adónde van los datos. |
| A medida | Un modelo que hacemos para usted: ajustado, con entrenamiento adicional o entrenado desde cero. | Trabajo con los datos y tiempo de GPU de entrenamiento por adelantado, y después GPU para servirlo. | Todo, incluido lo que sabe el modelo y cómo se comporta. |
La mayoría de los proyectos deberían empezar por la primera vía y cambiar solo cuando haya un motivo. Pero los motivos son reales, y conviene conocerlos antes de desarrollar.
Modelos de vanguardia a través de una API
Un modelo de vanguardia es el modelo general más capaz que vende un proveedor. Usted envía texto (y a menudo imágenes o archivos) a una API y paga por token. No hay servidor que mantener, el proveedor mejora el modelo con el tiempo y puede tener un prototipo funcionando en días.
Lo primero que suelen preguntar los clientes es qué pasa con sus datos. La respuesta depende del proveedor y del plan, así que lea las condiciones del producto exacto que use. OpenAI indica que los datos enviados a su API no se usan para entrenar sus modelos salvo que usted lo acepte expresamente, y que los registros de vigilancia de abusos se guardan hasta 30 días [1]. Anthropic indica que, por defecto, no usa las entradas ni las salidas de sus productos comerciales, incluida su API, para entrenar sus modelos [2]. Las condiciones de la API de Gemini de Google distinguen entre planes: el contenido enviado a los servicios gratuitos puede usarse para mejorar los productos de Google, mientras que los prompts y las respuestas de los servicios de pago no [3].
Los modelos de vanguardia también leen mucho de una vez. Google indica un límite de entrada de 1.048.576 tokens para Gemini 2.5 Pro [4], suficiente para varios documentos largos en una sola petición. Una ventana de contexto grande es útil, pero no sustituye a la búsqueda: enviarlo todo cada vez es lento y se paga cada token.
- Adecuado cuando: quiere el mejor razonamiento disponible, su tráfico es moderado o irregular, y las condiciones de datos del proveedor encajan con sus datos.
- Atención a: un gasto en tokens que crece con el uso, modelos que se retiran según el calendario del proveedor y límites de frecuencia en las horas punta.
- Prevea: un conjunto de evaluación que pueda volver a ejecutar cuando el proveedor publique una versión nueva, para que una actualización sea el resultado de una prueba y no un acto de fe.
Modelos de código abierto que ejecuta usted
Los modelos de pesos abiertos se publican para que cualquiera los descargue y los ejecute. Se sirven en GPU alquiladas a un proveedor en la nube, o en un servidor con GPU que usted compra. Los datos nunca salen de servidores que usted controla, el modelo nunca cambia salvo que usted lo cambie, y el coste mensual son los servidores y no los tokens.
Abierto no significa sin condiciones. Lea la licencia del modelo y la versión exactos. La licencia de Llama 3.1 de Meta, por ejemplo, exige una licencia aparte de Meta a los licenciatarios cuyos productos tuvieran más de 700 millones de usuarios activos mensuales en la fecha de publicación, y pide mostrar «Built with Llama» [5]. Otros modelos de pesos abiertos se publican con la Apache License 2.0, que concede una licencia libre de regalías para usar, modificar y distribuir la obra [6]. Sus asesores deben leer la licencia que se aplica antes de publicar.
- Adecuado cuando: sus datos deben quedarse en un lugar que usted elige, su tráfico es lo bastante constante para mantener ocupada una GPU, o necesita un modelo que no cambie sin su permiso.
- Atención a: la factura de GPU no baja cuando nadie usa el producto, y los modelos abiertos más potentes necesitan GPU grandes.
- Prevea: a alguien que actualice, vigile y proteja la infraestructura que sirve el modelo. Es un servidor como cualquier otro, con un modelo dentro.
Un LLM a medida
Un modelo a medida es uno modificado o creado para su uso. Hay tres niveles, y la diferencia de esfuerzo entre ellos es grande.
- 01
Ajuste fino
Un modelo abierto existente se sigue entrenando con ejemplos de la tarea: sus respuestas de soporte, su formato de informe, sus etiquetas de clasificación. Aprende un estilo y una habilidad, no una biblioteca de datos. Es el nivel que necesitan la mayoría de los proyectos a medida.
- 02
Preentrenamiento continuado
Un modelo existente lee un gran volumen de textos de su ámbito antes del ajuste fino, para aprender el vocabulario y el contexto de un campo especializado. Necesita mucho más texto y tiempo de GPU.
- 03
Entrenamiento desde cero
Un modelo nuevo, construido con sus datos y datos públicos. Es, con diferencia, la vía más cara y rara vez la adecuada para una empresa. Tiene sentido cuando el propio modelo es el producto.
Sea cual sea el nivel, lo que decide la calidad son los datos y la evaluación, no la ejecución del entrenamiento. Un modelo a medida solo es tan bueno como los ejemplos de los que aprendió, y solo sabe lo bueno que es si lo prueba con preguntas que nunca ha visto. El tiempo de GPU para el entrenamiento se factura por adelantado a coste, fuera de los hitos, porque se paga antes del trabajo que lo usa.
El mismo asistente, de tres formas
Los tres ejemplos prácticos de abajo son el mismo producto: una aplicación web donde el personal hace preguntas sobre los documentos de la empresa, y un agente que puede buscar información y abrir un ticket. Solo cambia la vía del modelo. Cada uno muestra la horquilla de nuestra tarifa de hoy, el desarrollo y el coste mensual de funcionamiento, con el precio calculado cuando abre la página.
Ejemplo práctico, con precio de hoy
Con un modelo de vanguardia
Un asistente de documentos con herramientas, con un modelo de vanguardia a través de su API, con un nivel de uso medio. El coste de funcionamiento son sobre todo tokens.
- Desarrollo
- ≈ 89.000 US$ a 136.000 US$, delivered within 21 weeksCAD 126,700 to 193,700
Los precios en su moneda son estimaciones con el tipo de cambio de hoy del Banco de Canadá. Toda la facturación se emite en CAD o USD.
Funcionamiento
- Alojamiento
- ≈ 558 US$ al mesCAD 795 al mes
- Soporte
- ≈ 1000 US$ al mesCAD 1,425 al mes
- Coste de uso del modelo
- ≈ 383 US$ al mesCAD 545 al mes
Ejemplo práctico, con precio de hoy
Con un modelo de código abierto
El mismo asistente con un modelo de pesos abiertos servido en GPU alquiladas en DigitalOcean. El coste de funcionamiento es sobre todo el servidor con GPU.
- Desarrollo
- ≈ 96.100 US$ a 147.000 US$, delivered within 22 weeksCAD 136,800 to 209,100
Los precios en su moneda son estimaciones con el tipo de cambio de hoy del Banco de Canadá. Toda la facturación se emite en CAD o USD.
Funcionamiento
- Alojamiento
- ≈ 4360 US$ al mesCAD 6,210 al mes
- Soporte
- ≈ 1000 US$ al mesCAD 1,425 al mes
- Coste de uso del modelo
- ≈ 4190 US$ al mesCAD 5,960 al mes
Ejemplo práctico, con precio de hoy
Con un modelo a medida ajustado
El mismo asistente con un modelo ajustado con los propios ejemplos de la empresa y servido después en GPU alquiladas. El desarrollo incluye el trabajo con los datos, el tiempo de entrenamiento y la evaluación.
- Desarrollo
- ≈ 133.000 US$ a 202.000 US$, delivered within 33 weeksCAD 188,800 to 288,000
Los precios en su moneda son estimaciones con el tipo de cambio de hoy del Banco de Canadá. Toda la facturación se emite en CAD o USD.
Funcionamiento
- Alojamiento
- ≈ 4360 US$ al mesCAD 6,210 al mes
- Soporte
- ≈ 1000 US$ al mesCAD 1,425 al mes
- Coste de uso del modelo
- ≈ 4190 US$ al mesCAD 5,960 al mes
Compare los costes de funcionamiento además de los de desarrollo. El coste de un modelo de vanguardia se mueve con el uso, así que un mes tranquilo sale barato y uno con mucho trabajo no. Un modelo servido cuesta más o menos lo mismo cada mes. Si el coste mensual del ejemplo de vanguardia con el tráfico que espera supera con creces el coste del servidor, ese es el punto en el que la vía de código abierto empieza a compensar. Cambie el tráfico en el estimador para encontrarlo.
Lo que no cambia en ninguna vía
Elija el modelo que elija, la mayor parte del proyecto es el software que lo rodea, y esa parte no cambia. Los documentos siguen teniendo que dividirse, indexarse y mantenerse sincronizados. Las herramientas del agente siguen necesitando permisos, para que pueda consultar un pedido pero no reembolsarlo sin una persona. Las respuestas siguen necesitando mostrar sus fuentes, para que el personal pueda comprobarlas. Y el conjunto sigue necesitando una evaluación antes de cada cambio, registros que muestren qué se pidió al modelo y qué hizo, y una forma de apagarlo.
Eso es una buena noticia para la decisión. Como el trabajo que rodea al modelo es común, la vía es una elección menor de lo que parece al principio, y se puede cambiar más adelante si la aplicación habla con el modelo a través de una capa fina propia. Elija la vía que encaja hoy con sus datos y su tráfico, y conserve la opción de cambiar.
Cómo decidir
- 01
Empiece por los datos
¿Adónde pueden ir? Si sus asesores o los contratos de sus clientes dicen que no pueden salir de sus servidores o de su país, la vía de código abierto o a medida se impone sola. Si las condiciones de la API de pago de un proveedor son aceptables, siga adelante.
- 02
Prepare primero la evaluación
Anote de cincuenta a unos cientos de preguntas reales con buenas respuestas. Cada vía se mide con el mismo conjunto, así que elige con pruebas.
- 03
Haga el prototipo con un modelo de vanguardia
Es la forma más rápida de saber si la función sirve de algo. Muchos proyectos se quedan aquí, con razón.
- 04
Calcule el coste de funcionamiento con tráfico real
Estime un mes de uso real. Compare los tokens con un servidor con GPU. El punto de cruce depende de su volumen, no de la regla general de nadie.
- 05
Pruebe un modelo abierto con la misma evaluación
Si se queda lo bastante cerca, gana control y una factura fija. Si no, sabe lo que vale para usted el modelo de vanguardia.
- 06
Considere la vía a medida en último lugar
Haga un ajuste fino solo cuando el modelo abierto se quede cerca pero no llegue, y tenga los ejemplos para enseñarle. Entrene desde cero solo cuando el modelo sea el producto.
Errores que vemos
- Elegir un modelo antes de escribir la evaluación. Sin un conjunto de pruebas, todos los modelos quedan bien en una demo.
- Hacer un ajuste fino para enseñar datos. Los datos cambian; un modelo ajustado tiene que volver a entrenarse para aprenderlos. La recuperación se actualiza en cuanto lo hace el documento.
- Olvidar el coste de funcionamiento. Un desarrollo barato de hacer puede ser caro de mantener, y al revés.
- Apoyarse tanto en las funciones especiales de un proveedor que cambiar supone reescribirlo todo. Una capa fina entre su aplicación y el modelo mantiene la vía como una decisión que puede revisar.
- Tratar una licencia de pesos abiertos como si todo estuviera permitido. Cada una tiene sus propias condiciones.
Desarrollamos en las tres vías y ponemos precio a cada una por separado, así que no tenemos motivos para empujar ninguna. Cuando un modelo de vanguardia a través de su API es la respuesta buena más barata, y a menudo lo es, eso es lo que le recomendaremos.