Guía completa de conversión PCM a DSD: principios, parámetros y práctica

Pasar de PCM a DSD no es solo un cambio de formato — es un proceso completo de remuestreo + conformación de ruido + modulación. Esta guía explica cada paso con datos medidos y ofrece configuraciones de DpdoEngine listas para usar.


1. ¿Qué es DSD y por qué convertir?

DSD (Direct Stream Digital) es un formato de audio de 1 bit desarrollado por Sony/Philips para SACD a finales de la década de 1990. A diferencia del PCM, que representa la amplitud con muestras de varios bits, DSD usa una frecuencia de muestreo ultralta de 2,8224 MHz (DSD64) y representa la señal como una densidad de pulsos de 1 bit (PDM) — la densidad del flujo de bits codifica la amplitud de la señal.

¿Por qué convertir PCM a DSD?

  • Orientación de la cadena de reproducción: los DAC modernos usan internamente arquitectura delta-sigma — la entrada PCM se convierte al final dentro del DAC en un flujo similar a DSD de 1 bit. Convertir a DSD de antemano equivale a realizar la modulación en el origen, evitando la segunda conversión dentro del DAC.
  • Ecosistema SACD: las imágenes SACD y muchos reproductores/software solo aceptan formatos DSD (DSF/DFF).
  • Preferencia de escucha: algunos usuarios consideran que la atenuación de alta frecuencia del DSD es más suave y que la distribución del ruido conformado es más "analógica" — por supuesto, es subjetivo; los datos hablarán más adelante.

⚠️ Premisa importante: la conversión no crea información. La información de alta frecuencia que no está en el archivo PCM original no aparecerá después de la conversión. El objetivo de la conversión es la fidelidad — mapear fielmente el PCM al dominio DSD con la menor pérdida posible. Esta es también la diferencia esencial entre el "DSD puro" (grabaciones DSD nativas) y el "DSD convertido": el primero es DSD desde la etapa de grabación; el segundo es una re-expresión de material PCM.


2. Principio de conversión PCM → DSD (tres etapas)

Una conversión estándar de PCM→DSD incluye tres etapas:

2.1 Remuestreo (sobremuestreo)

La frecuencia de muestreo PCM (44,1/96/192 kHz…) es mucho menor que la tasa de salida DSD (desde 2,8224 MHz). El convertidor debe hacer primero un remuestreo de alta relación, interpolando los puntos de muestra hasta la tasa objetivo.

  • DSD64 (2,8224 MHz) = 64 × 44,1 kHz → relación de sobremuestreo OSR=64
  • DSD128 (5,6448 MHz) = ×128 → OSR=128
  • DSD256 (11,2896 MHz) = ×256 → OSR=256

Punto clave de calidad: el diseño del filtro de remuestreo determina directamente la transparencia de la conversión y la respuesta de fase. Los filtros FIR (respuesta finita al impulso) son la opción principal — cuantos más taps, más pronunciado es el filtro y mejor la atenuación de la banda de rechazo, pero mayor el coste computacional. DpdoEngine usa por defecto FIR de 4096 taps, configurable a valores más altos.

2.2 Conformación de ruido

Al reducir la señal multibit remuestreada a 1 bit, el error de cuantificación genera un ruido enorme. La conformación de ruido usa un bucle de retroalimentación para empujar el ruido de cuantificación a la banda ultrasónica (>20 kHz), donde el oído es insensible, preservando la relación señal-ruido dentro de la banda de audio.

  • Orden: 3/5/7/9/11. Cuanto mayor el orden, más fuerte la supresión del ruido in-band, pero mayores los requisitos de estabilidad del modulador y el coste computacional.
  • Estructuras: familias IIR (respuesta infinita al impulso) y FIR. El IIR es computacionalmente eficiente, con mejor rendimiento in-band al mismo orden; el FIR ofrece fase lineal y retardo de grupo constante, adecuado para masterización sensible a la fase.
  • Por defecto en DpdoEngine: IIR de 7.º orden; también disponibles MASH, CIFB, polinómica y otras estructuras.

2.3 Modulación y salida (modulación de 1 bit)

La señal conformada se genera finalmente como un flujo PDM de 1 bit, empaquetado en un contenedor DSF o DFF (opcionalmente con compresión sin pérdida DST, que reduce el tamaño entre un 30 y un 50 %).


3. Cómo elegir los parámetros: una tabla de decisión práctica

ObjetivoConfiguración recomendadaMotivo
Reproducción general (streaming/portátil)OSR 64, IIR de 9.º ordenLa mejor compatibilidad con DSD64; el ruido in-band de 9.º orden ya es muy bajo
Reproducción audiófilaOSR 128, IIR de 11.º ordenMayor tasa + la conformación in-band más fuerte; el doble de tamaño de archivo es aceptable
Masterización/archivoOSR 128–256, FIRFase lineal; errores predecibles en procesamiento multietapa
CPU modestaOSR 64, IIR de 7.º ordenBajo coste computacional; prioridad de tiempo real
Empaquetado SACD multicanalOSR 64–128, IIR de 9.º orden + DSTLa compresión DST reduce notablemente el tamaño de la imagen

Ruido in-band: la esencia de la conformación de ruido es empujar el ruido de cuantificación más lejos — cuanto mayor el orden, más baja el piso in-band, más alto el pico de ruido fuera de banda y más pronunciada la curva de conformación. La diferencia entre el 7.º orden (predeterminado) y el 11.º es audible en pasajes silenciosos y detalles de alta frecuencia; la verificación concreta según las mediciones de dsp_bench/thdn.


4. En la práctica: conversión con DpdoEngine

Conversión básica

# WAV → DSF (DSD64, IIR de 7.º orden por defecto)
	DpdoEngine -i input.wav output.dsf --oversampling 64
	
	# FLAC → DFF (DSD128, IIR de 11.º orden)
	DpdoEngine -i input.flac output.dff --oversampling 128 --order 11
	
	# Configuración completa: aceleración OpenCL + metadatos + informe PDF
	DpdoEngine -i input.flac output.dsf --oversampling 256 --order 7 \
	  --opencl --report --artist "Artist" --album "Album" --year "2026"
	

Conversión por lotes

# Lote WAV → DSF (usando convert.sh)
	cd directorio && bash convert.sh wav2dsf 128
	

Verificar la calidad tras la conversión

DpdoEngine genera un informe PDF (--report) con los parámetros de conversión y datos de medición. Verificación avanzada:

# Mide la distorsión y el piso de ruido del archivo de salida
	thdn output.dsf
	# Compara el rendimiento in-band de diferentes estructuras de conformación de ruido
	dsp_bench --input test.wav --order 9 --order 11
	

5. Preguntas frecuentes

¿DSD64/128/256, cuál elegir? Primero mira hasta qué nivel soportan tu DAC y tu cadena de reproducción. Si soportan todos, 128 es el punto de equilibrio entre percepción auditiva y tamaño; 64 tiene la compatibilidad más amplia; 256+ es para quienes buscan el límite sin presión de almacenamiento.

¿DSF o DFF? DSF es el contenedor más común (buen soporte de metadatos, amplia compatibilidad con streaming/reproductores); DFF es el estándar de la industria de la radiodifusión. Sin diferencia sustancial en el audio — por defecto, DSF.

¿Uso DST? DST es compresión sin pérdida, ahorra entre un 30 y un 50 % de tamaño, totalmente reversible. Se recomienda para almacenamiento de archivo o empaquetado de imágenes; se puede omitir si prefieres una decodificación mínima.

¿Influye que la fuente PCM sea de 44,1 o de 96/192? Sí. Cuanto mayor la frecuencia de muestreo de la fuente, menor el error de interpolación en la etapa de remuestreo. Una fuente de 44,1 kHz también da buenos resultados al convertir a DSD128, pero las fuentes por encima de 96 kHz son más holgadas en el nivel DSD256.


Escrito por Dpdo. Los datos de calidad de conversión se basan en mediciones de DpdoEngine 6.68; los detalles de parámetros están en la referencia de parámetros.