Fine-tuning de modelos como servicio freelance: qué, cómo y cuánto cobrar
Resumen clave: Coste: 0,15 €/contrato. Fine-tuning (2 días): QLoRA sobre Llama 3.3 8B con Unsloth. 3 epochs, learning rate 2e-4, LoRA rank 16. Ahorro: 98,7% en coste de inferencia. Deployment (2 días): vLLM en una GPU A10G de AWS (0,50 €/hora). El fine-tuning amplifica los sesgos del dataset. Para más contexto, te recomendamos leer sobre modelos de IA Locales para Empresas Llama, Qwen.
El fine-tuning (ajuste fino) consiste en adaptar un modelo de lenguaje preentrenado a un dominio o tarea específica usando un dataset propio. En 2026, no es solo para grandes empresas: cualquier startup con 200-500 ejemplos puede fine-tunar Llama 3.3 o Mistral para su caso de uso, y lo hace.
El problema: la mayoría de los equipos de producto no saben preparar el dataset, elegir la técnica de fine-tuning ni evaluar el resultado. Ahí es donde entra el freelance especializado.
Cuándo tiene sentido el fine-tuning (y cuándo no)
Cuándo sí
- El modelo base no sigue el formato que necesitas (JSON estructurado, código específico, formato legal)
- Necesitas respuestas en un tono o estilo consistente que el system prompt no logra
- El dominio tiene vocabulario especializado (médico, legal, financiero) que el modelo base no domina
- Quieres reducir costes: un modelo fine-tuned de 8B parámetros puede igualar a GPT-4o en tu tarea específica a un coste 10-15x menor
Cuándo no
- No tienes al menos 200 ejemplos de calidad (pregunta-respuesta, instruction-response)
- El RAG ya resuelve tu problema (antes de fine-tunar, prueba RAG)
- Necesitas el modelo para tareas muy diversas (el fine-tuning especializa, no generaliza)
- No tienes forma de evaluar si el modelo mejoró o no
Técnicas de fine-tuning que necesitas dominar
Full fine-tuning vs parameter-efficient
El full fine-tuning actualiza todos los parámetros del modelo. Es caro (necesitas GPUs con mucha VRAM) y arriesgado (puedes perder capacidades generales del modelo).
El parameter-efficient fine-tuning (PEFT) actualiza solo una fracción de los parámetros. Las técnicas más usadas:
| Técnica | Parámetros entrenables | VRAM necesaria | Cuándo usarla | ||
|---|---|---|---|---|---|
| LoRA | 0.1-1% | 1x A100 (80GB) o 2x 4090 | Caso general, la opción por defecto | ||
| QLoRA (4-bit quantized) | 0.1-1% | 1x 4090 (24GB) | Presupuesto limitado, prototipado rápido | ||
| IA3 | <0.1% | Similar a LoRA | Menor footprint, menos flexible | ||
| Adapter layers | 1-5% | Similar a LoRA | Multi-task con adapters intercambiables |
Herramientas
- Unsloth: fine-tuning 2x más rápido que Hugging Face TRL, compatible con LoRA/QLoRA. La opción más eficiente en 2026.
- Hugging Face TRL: estándar de la industria, documentación extensa, integration con HF Hub.
- Axolotl: wrapper sobre TRL que simplifica la configuración.
- OpenAI fine-tuning API: si el cliente usa solo OpenAI y no quiere gestionar infraestructura. Limitado a modelos OpenAI.
Tarifas para fine-tuning freelance
| Servicio | Tarifa proyecto (€) | Duración | ||
|---|---|---|---|---|
| Evaluación de viabilidad (¿fine-tuning o RAG?) | 1.500 – 3.000 | 3-5 días | ||
| Preparación de dataset + fine-tuning LoRA | 3.000 – 8.000 | 1-2 semanas | ||
| Fine-tuning + evaluación + deployment | 6.000 – 15.000 | 2-4 semanas | ||
| Pipeline completo (dataset + training + serving + monitoring) | 12.000 – 30.000 | 4-8 semanas |
Costes de infraestructura (a cargo del cliente)
| Configuración | Coste por hora | Coste entrenamiento típico | ||
|---|---|---|---|---|
| 1x A100 (RunPod/Lambda) | 1,50 – 2,50 € | 15 – 60 € | ||
| 2x A100 | 3,00 – 5,00 € | 30 – 120 € | ||
| 1x H100 | 3,00 – 4,50 € | 20 – 80 € | ||
| OpenAI fine-tuning (gpt-4o-mini) | ~0,02 €/1K tokens training | Variable |
Un fine-tuning de Llama 3.3 8B con QLoRA sobre 2.000 ejemplos cuesta entre 5 y 15 € de GPU en RunPod. No es el coste principal; lo caro es el dataset y la evaluación.
Calcula tu tarifa con la calculadora.
Un proyecto real de fine-tuning freelance
Cliente: empresa española de legaltech que quiere un modelo que extraiga cláusulas de contratos de alquiler en formato JSON estructurado.
Problema: GPT-4o lo hace bien pero cuesta 0,15 € por contrato. Procesan 5.000 contratos/mes = 750 €/mes solo en inferencia. Quieren reducir costes.
Proceso:
- Dataset (3 días): recopilan 500 contratos anotados manualmente con las cláusulas extraídas. Formato: instruction (contrato) + response (JSON con cláusulas). Limpieza de datos: eliminan contratos con errores de OCR, normalizan formato.
- Baseline (1 día): evalúan GPT-4o con 100 contratos de test. Accuracy: 87%. Coste: 0,15 €/contrato.
- Fine-tuning (2 días): QLoRA sobre Llama 3.3 8B con Unsloth. 3 epochs, learning rate 2e-4, LoRA rank 16. Coste GPU: ~8 €. Duration: 45 minutos en 1x A100.
- Evaluación (2 días): el modelo fine-tuned alcanza 84% de accuracy en el test set (3 puntos menos que GPT-4o). Coste de inferencia con vLLM: 0,002 €/contrato. Ahorro: 98,7% en coste de inferencia.
- Deployment (2 días): vLLM en una GPU A10G de AWS (0,50 €/hora). Sirve ~50 contratos/minuto.
Resultado: el cliente acepta perder 3 puntos de accuracy a cambio de reducir el coste de 750 €/mes a ~10 €/mes. El proyecto se paga solo en el primer mes.
Tarifa facturada: 6.000 € (10 días de trabajo).
Errores en proyectos de fine-tuning
- No evaluar contra baseline. Si no mides el modelo base antes y después del fine-tuning, no puedes demostrar que mejoró. Y a veces empeora (catastrophic forgetting).
- Dataset de baja calidad. El fine-tuning amplifica los sesgos del dataset. Si tus ejemplos de entrenamiento tienen errores, el modelo los aprenderá. Dedica el 60% del tiempo del proyecto al dataset.
- No usar un held-out test set. Si evalúas con los mismos datos que entrenaste, los resultados no son válidos. Separa 20% para test antes de empezar.
- Sobre-entrenar (too many epochs). Más epochs no significa mejor modelo. El overfitting en fine-tuning es fácil de detectar: el loss de validación sube mientras el de entrenamiento baja. Usa early stopping.
- No considerar RAG primero. Si el problema es acceso a información, RAG es más rápido, más barato y más fácil de mantener. Fine-tuning es para estilo, formato y dominio, no para conocimiento.
Más sobre modelos de IA en la guía de LLM Engineer y la guía de RAG developer. Para más contexto, te recomendamos leer sobre notion para gestión freelance: configuración completa..
¿Te está sirviendo SeniorStack? Añádenos a tus fuentes preferidas en Google y nos verás destacados en tus resultados y respuestas de IA.