Transcripción de audio en Español gratis en tu navegador
VoxScriber Nano entiende Español (Español) y procesa localmente en tu dispositivo. Límite de 10 min en modo gratuito.
Ejecuta VoxScriber Nano (open-source) en tu navegador — IA local, hasta 10 min por archivo, precisión básica (~85%). Para uso profesional, conoce Premium.
La transcripción se ejecuta localmente en tu navegador. Puedes compartir el resultado con nosotros de forma opcional (con consentimiento) para mejorar el servicio. Límite: 10 min por archivo, precisión ~85%.
Gratis vs Premium — las diferencias
| Gratis (navegador) | Premium (nube) | |
|---|---|---|
| Límite por archivo | 10 min | 10 horas |
| Precisión | ~85% | >95% |
| Diarización (quién habla) | ❌ | ✅ |
| Marcas de tiempo por palabra | ❌ | ✅ |
| Soporte de vídeo (MP4/MOV) | ❌ | ✅ |
| Formatos de exportación | TXT, SRT, VTT | DOCX, PDF, JSON… |
| Velocidad (1h de audio) | ~2 min / 1h | ~2 min / 1h |
| Privacidad | 100% local | ☁️ + 🔒 |
IA local
La transcripción se ejecuta en tu navegador. El envío a nuestros servidores es opcional (requiere consentimiento).
Rápido y local
Procesamiento directo en el navegador, sin colas de espera.
99 idiomas
Detecta automáticamente el idioma del audio.
Sin registro
Empieza de inmediato, sin crear cuenta.
Cómo funciona
Sube o graba el audio
Arrastra un archivo MP3, WAV, M4A, OGG o usa el micrófono directamente.
La IA corre en tu dispositivo
Whisper AI se descarga una vez y queda en caché. Sin espera la próxima vez.
Copia o descarga el texto
Resultado en pantalla en segundos. Descarga en .txt o copia con un clic.
¿Qué tan bien maneja Whisper el Español?
El español está entre los tres idiomas principales de Whisper. El modelo maneja tanto las variantes peninsulares como latinoamericanas, incluyendo las diferencias de seseo y ceceo, y produce ortografía estándar con tildes correctas y la letra ñ. El habla rápida del Caribe puede requerir el modelo Mini.
De dónde suele provenir el audio en Español
Los audios de WhatsApp son muy comunes en España y América Latina. Otras fuentes frecuentes: clases universitarias, reuniones de negocios, clips de YouTube y grabaciones pastorales.
¿Qué tan precisa es la transcripción en el navegador?
La transcripción en el navegador ejecuta el modelo Whisper de OpenAI directamente en tu dispositivo usando WebAssembly. Ofrecemos tres tamaños de modelo, y la precisión depende del que elijas:
- Nano (~40MB) — El predeterminado. Alrededor del 85% de precisión en voz clara. Ideal para notas rápidas, mensajes de voz y borradores. El único modelo que funciona en iOS.
- Mini (~150MB) — Aproximadamente 90% de precisión. Un buen punto intermedio si tu dispositivo tiene 4GB+ de RAM y necesitas una salida más limpia.
- Plus (~500MB) — La opción local más precisa, acercándose al 93% en audio claro. Más lento de descargar y ejecutar; ideal en equipos de escritorio con 8GB+ de RAM.
Lo que reduce la precisión de cualquier modelo local: ruido de fondo, varias personas hablando al mismo tiempo, acentos fuertes y grabaciones de baja tasa de bits como notas de voz comprimidas. Si necesitas precisión profesional superior al 95%, marcas de tiempo a nivel de palabra o etiquetas de hablante, eso requiere modelos en la nube — consulta la comparación anterior.
Transcripción en el navegador vs en la nube: ¿cuál necesitas?
La transcripción en el navegador es la herramienta adecuada cuando la privacidad es lo más importante o el audio es corto: no se sube nada, no hay nada que eliminar después y no cuesta nada. La compensación es velocidad y precisión: tu CPU procesa aproximadamente una hora de audio en veinte minutos, y el modelo local omite las etiquetas de hablante y el tiempo a nivel de palabra.
La transcripción en la nube es la herramienta adecuada cuando estás trabajando: reuniones, entrevistas, conferencias, grabaciones legales. GPU dedicadas convierten una hora de audio en texto en aproximadamente dos minutos con más del 95% de precisión, etiquetan hasta 30 hablantes diferentes, aceptan archivos de hasta 10 horas de duración y exportan a DOCX, PDF y JSON además de los formatos de subtítulos.
Una regla práctica: si te sentirías cómodo leyendo la grabación en voz alta en una cafetería, la velocidad y precisión de la nube ganan. Si el audio es sensible — una consulta médica, una reunión confidencial, una nota de voz privada — la herramienta del navegador mantiene todo en tu máquina y aún te da una transcripción útil en minutos. Muchos de nuestros usuarios combinan ambas: notas privadas rápidas en el navegador, trabajo profesional en la nube.
Ver planes Premium →Formatos de audio compatibles
Sube MP3, WAV, M4A, OGG, OPUS, FLAC o WEBM — cualquier cosa que tu navegador pueda decodificar. Las fuentes comunes funcionan de inmediato: notas de voz de WhatsApp (OPUS), notas de voz de iPhone (M4A), archivos de grabadora de Android, grabaciones de Zoom (M4A/MP4), mensajes de voz de Telegram (OGG) y archivos de podcast (MP3). Los contenedores de video como MP4 y MOV se decodifican para su pista de audio cuando el navegador admite el códec. Si un archivo no se carga, la causa habitual es un códec inusual dentro de un contenedor común: convertirlo a MP3 primero lo soluciona en casi todos los casos.
¿Necesitas un formato diferente primero? Usa nuestros convertidores gratuitos: convertidor gratuito de audio MP3 / WAV / OGG / AAC
¿Necesitas más? Conoce el Premium
Para uso profesional — diarización, archivos largos, análisis por IA y exportación en todos los formatos.
Diarización de hablantes
Identifica automáticamente quién habla en cada segmento. Perfecto para reuniones, entrevistas y podcasts.
Archivos de hasta 10 horas
El modelo local soporta 10 min. Premium procesa archivos de hasta 10 horas.
Resumen, sentimiento y temas
La IA analiza el contenido y genera resumen ejecutivo, análisis de sentimiento y extracción de temas.
Exportación completa
Exporta en SRT, VTT, DOCX, JSON y PDF — ideal para subtítulos, documentos y automatizaciones.
Preguntas frecuentes
¿El audio se sube a algún servidor?
La transcripción se ejecuta 100% localmente en tu navegador. Luego puedes optar por compartir el audio y la transcripción con nosotros (casilla de consentimiento) para mejorar el servicio — completamente opcional.
¿Qué formatos de audio se aceptan?
MP3, WAV, M4A, OGG, FLAC, WEBM, MP4, MOV y cualquier formato que tu navegador pueda decodificar.
¿Cuánto tiempo de audio puedo transcribir?
Hasta 10 minutos por archivo en modo gratuito. Para audios más largos, el plan Premium soporta hasta 10 horas.
¿En qué idiomas funciona?
El modelo Whisper soporta 99 idiomas: español, inglés, portugués, francés, alemán, japonés, árabe y muchos más. La detección es automática.
¿Necesito instalar algo?
No. Funciona directamente en el navegador. El modelo de IA (~40MB) se descarga una vez y queda en caché.
¿Se guarda la transcripción en algún lugar?
Por defecto, no — el resultado queda solo en tu navegador. Si marcas la casilla de consentimiento, el audio y la transcripción se envían a nuestros servidores y se eliminan a los 7 días. Puedes revocar el consentimiento en cualquier momento.
¿Cuál es la diferencia con el plan Premium?
El modo gratuito usa VoxScriber Nano cuantizado en 4 bits (q4) localmente: límite de 10 min por archivo, precisión ~85%, sin diarización de hablantes y marcas de tiempo solo por segmentos (~30s). El Premium usa modelos en la nube (AssemblyAI + Whisper Large float32): precisión >95%, diarización de hasta 30 hablantes, marcas de tiempo por palabra, archivos hasta 10h, soporte MP4/MOV/MKV y exports DOCX, PDF, JSON. Velocidad: 1h de audio tarda ~20min en tu CPU local vs ~2min en el GPU dedicado del Premium.
¿Funciona en el móvil?
Sí, pero el rendimiento depende del dispositivo. En smartphones con poca RAM, la transcripción puede ser más lenta.
¿Es realmente gratuito?
Sí. El transcriptor del navegador es genuinamente gratuito, sin período de prueba, sin marca de agua y sin registro. Ganamos dinero con los planes Premium en la nube, no con la herramienta gratuita.
¿Sale mi audio de mi dispositivo?
No — la transcripción se ejecuta localmente a través de WebAssembly. La única excepción es si marcas explícitamente la casilla de consentimiento opcional para compartir una grabación con nosotros.
¿Hay un límite de tamaño de archivo?
El límite práctico es la duración (10 minutos por archivo) y la memoria de tu dispositivo, no los megabytes. Un MP3 de 10 minutos suele ser de 10-20MB y funciona bien en la mayoría de los dispositivos.
¿Cuánto tiempo toma la transcripción?
Con el modelo Nano, espera aproximadamente 1-2 veces la duración del audio en un portátil moderno — un archivo de 5 minutos toma unos 5-10 minutos. La primera ejecución agrega una descarga única del modelo de ~40MB.
¿Puedo exportar subtítulos (SRT)?
Sí — las exportaciones gratuitas incluyen .txt, .srt y .vtt con marcas de tiempo de segmento. Para precisión de marcas de tiempo a nivel de palabra y exportaciones DOCX/PDF/JSON, consulta Premium.
¿Puedo transcribir varios archivos a la vez?
Sí — puedes poner en cola hasta 5 archivos y se procesan uno tras otro en tu navegador. Premium elimina el límite de cola y procesa archivos en paralelo en la nube.
¿Por qué la primera transcripción tarda más?
En tu primera visita, el modelo de IA se descarga y compila en tu navegador. Luego se almacena en caché, por lo que cada transcripción posterior comienza de inmediato.
¿Funciona sin conexión?
Parcialmente — una vez que el modelo está en caché, la transcripción en sí no necesita conexión. Aún necesitas estar en línea para cargar la página en sí.
¿Maneja español latinoamericano y castellano?
Sí, ambos — la detección y adaptación ortográfica son automáticas.
¿Escribe correctamente las tildes?
Sí — las tildes y la letra ñ son parte de la salida nativa del modelo.
¿Puedo transcribir un audio de WhatsApp en español?
Sí — arrastre el archivo .opus exportado directamente, no necesita conversión.