AIREITER

2026'da Demucs Stem Ayırma: Modeller, Bayraklar ve Gerçek Maliyetler

Son Güncelleme: 2026-09-25 01:44:45

Orijinal facebookresearch/demucs reposu 1 Ocak 2025'ten beri salt okunur durumda. Demucs, kendi bilgisayarınızda çalıştırabileceğiniz en güçlü ücretsiz seçeneklerden biri olmayı sürdürüyor. Bunun için v4.1.0'ı yayımlayan fork üzerinden kurulum yapmanız ve gitarla piyanoda sonuçların ilk bozulduğunu kabul etmeniz gerekiyor.

Arşivlenmiş Repo Yerine Güncel Demucs Reposuyla Başlayın

Aynı README'yi taşıyan iki GitHub reposu var, ancak yalnızca biri hâlâ düzeltme alıyor. facebookresearch/demucs arşivlenmiş ve salt okunur durumda; kendi README'si de başka bir adrese yönlendiriyor. Güncel repo ise adefossez/demucs. Projenin yazarı Alexandre Défossez burada, Meta'dan ayrılıp Kyutai'ye katılmasının ardından buranın "şu anda resmî olarak sürdürülen Demucs" olduğunu, ancak "yanıtların yavaş olmasını ve şimdilik yeni özellik beklenmemesini" söylüyor.

Bu fark yalnızca repo adresini değil, kurulum komutlarını da değiştiriyor.

v4.1.0 ile neler değişti?

11/07/2026 tarihli sürüm notlarında Demucs v4.1.0 için "modernleştirilmiş paketleme, daha hafif çıkarım bağımlılıkları, çok sayıda düzeltme ve Hugging Face üzerinde barındırılan önceden eğitilmiş modeller" ifadeleri kullanılıyor. Pratikte tablo şöyle:

ÖğeArşivlenmiş repoGüncel repo (v4.1.0)
Minimum Python sürümü3.83.10
En hızlı çalıştırmapip install -U demucsuvx demucs MY_TRACK.mp3 (kurulum gerektirmez)
Kalıcı kurulumpip install -U demucsuv tool install demucs (pip de çalışır)
ffmpegGerekliİsteğe bağlı; FLAC çıktısı ve sphn'in çözemediği formatlar için gerekli
Nicemlenmiş modellerDahilEk paket gerekir: uvx "demucs[quantized]" -n mdx_q MY_TRACK.mp3
Ağırlıkların barındırıldığı yerdl.fbaipublicfiles.comHugging Face

Bir hata bildirmeden önce bilmeniz gereken önemli bir ayrıntı var: PyTorch, 2.2 sürümünden sonra Intel Mac desteğini bıraktı. Bu nedenle Intel Mac kullanıcıları Python 3.12 ile sınırlı ve uvx --python 3.12 demucs komutunu çalıştırmaları gerekiyor.

Model Seçimi: htdemucs, htdemucs_ft, htdemucs_6s ve mdx

Modeli -n bayrağıyla seçiyorsunuz; varsayılan model her durumda en doğru tercih olmayabilir. Demucs; davul, bas, diğer ve vokal olmak üzere dört kaynaklı modellerin yanı sıra altı kaynaklı deneysel bir model ve daha eski MDX yarışma modelleri sunuyor.

ModelKaynak sayısıHızResmî uyarıNe zaman seçilmeli?
htdemucs4Temel seviye (varsayılan)Belirtilmemişİlk deneme, toplu işlemler ve hızın önemli olduğu her senaryo
htdemucs_ft4Yaklaşık 4 kat daha yavaş"Biraz daha iyi olabilir"Önem verdiğiniz bir parçanın son çıktısını alırken
htdemucs_6s6İkisinin arasındaGitar "idare eder"; piyano "pek iyi çalışmıyor", ayrıca "çok fazla sızıntı ve artefakt" varÖzellikle gitar stem'ine ihtiyacınız varsa ve kusurları göze alabiliyorsanız
hdemucs_mmi4Temel seviyev3 mimarisi, yeniden eğitilmişv4 belirli bir miks üzerinde kötü sonuç verdiğinde A/B karşılaştırması için
mdx / mdx_extra4Temel seviyemdx_extra, MUSDB test setini de içeren verilerle eğitildiEski kayıtlar veya v4 artefaktları rahatsız edici olduğunda
mdx_q / mdx_extra_q4En hızlı ve en küçük"Kalite biraz daha kötü olabilir"Depolama alanı kısıtlı makineler ve hızlı önizlemeler için

htdemucs_ft için kullanılan ifadeye dikkat edin: dört kat işlem gücü karşılığında, projenin yazarı bile kalite artışını yalnızca mümkün olarak tanımlıyor. CPU üzerinde bu bedel oldukça ağır ve kullanıcılar da bunu açıkça belirtiyor.

9.00 ve 9.20 dB SDR değerleri gerçekte neyi ölçüyor?

Her iki değer aynı README paragrafında geçiyor, ancak birbirinin yerine kullanılamaz. Hybrid Transformer Demucs, MUSDB HQ test setinde 9.00 dB SDR değerine ulaşıyor. Daha yüksek olan 9.20 dB sonucu ise seyrek dikkat çekirdekleriyle kaynak başına ince ayar gerektiriyor. Üstelik bu seyrek model, "henüz yayıma hazır olmayan özel CUDA kodu gerektirdiği için sunulmuyor."

Dolayısıyla indirip kullanabileceğiniz hiçbir model 9.20 dB sonucunu tekrarlamıyor. README'deki karşılaştırma tablosunda, dağıtılan ince ayarlı v4 modeli toplam SDR'de 9.0 seviyesinde ve 1,7 bin miksle eğitilmiş Band-Split RNN ile aynı sırada yer alıyor.

Wave-U-Net, Open-Unmix, Conv-Tasnet, Spleeter, Demucs v2, KUIELAB-MDX-Net, Hybrid Demucs v3 ve HT Demucs fine-tuned v4 modellerinin MUSDB üzerindeki toplam SDR karşılaştırmasını gösteren çubuk grafik

Aynı tabloda Spleeter, 25 bin şarkıyla eğitilmiş olmasına rağmen 5.9 dB seviyesinde kalıyor. Bu, ince ayarlı v4 modeliyle arasında yaklaşık 3 dB fark olduğu anlamına geliyor.

Çıktıyı Değiştiren Bayraklar

Çoğu Demucs çalıştırmasında üç karar vermeniz gerekir: kaç stem istediğiniz, ne kadar işlem gücü harcayacağınız ve çıktının hangi formatta yazılacağı.

  1. --two-stems=vocals karaoke modu sunar ve vocals.wav ile no_vocals.wav dosyalarını üretir. Önce tam miks ayrıştırılır, ardından çıktı mikslenir. Bu yüzden normal çalıştırmaya göre ne daha hızlıdır ne de daha az bellek kullanır.
  2. --shifts=N, rastgele kaydırılmış giriş üzerinde N tahminin ortalamasını alır. Tahmini N kat yavaşlatır. README'nin önerisi net: "GPU'nuz yoksa kullanmayın." Makalede 10 kaydırma kullanılmış, Replicate'in barındırılan varsayılanı ise 1.
  3. --overlap varsayılan olarak 0.25 değerindedir; küçük bir hız kazanımı için 0.1'e indirilebilir.
  4. --segment N bellek yetersizliği sorunlarında başvurulan ayardır. Burada kopyalanmış komutları sessizce bozan bir ayrıntı var: Hybrid Transformer modelleri en fazla 7.8 saniyelik segment uzunluğunu destekler. Bu nedenle uzun bir --segment değeri yalnızca HT dışındaki modellerde işe yarar.
  5. Çıktı bayrakları arasında --mp3 (varsayılan 320 kbps), --flac (ffmpeg gerekir), --int24 ve --float32 bulunur. Varsayılan çıktı, separated/MODEL_NAME/TRACK_NAME klasöründe 44.1 kHz int16 WAV olarak oluşturulur.
  6. --clip-mode göründüğünden daha önemlidir: Demucs, varsayılan olarak kırpılmayı önlemek için stem'leri yeniden ölçeklendirir. Bu işlem stem'ler arasındaki göreli ses seviyelerini bozabilir. clamp ise bunun yerine sert bir sınır uygular.

Aynı dokümana göre donanım beklentisi şöyle: en az 3 GB GPU belleği, varsayılan ayarlarla yaklaşık 7 GB ve 3 GB veya daha az belleğiniz varsa --segment 8 ile birlikte PYTORCH_NO_CUDA_MEMORY_CACHING=1 kullanmanız gerekiyor. CPU üzerinde "işleme süresi yaklaşık olarak parçanın süresinin 1,5 katı olmalı." Bu, kullanıcıların htdemucs_ft ile bildirdiği sonuçların yanında oldukça iyimser bir tahmin.

Demucs Nerelerde Zorlanıyor ve Kullanıcıların Uyguladığı İki Aşamalı Çözüm

Sızıntı, kullanıcı şikâyetlerinde tekrar tekrar karşımıza çıkıyor. Özellikle vokallerin lead enstrümanla aynı frekans aralığını paylaştığı durumlarda sorun belirginleşiyor. Ryan Herr (@rrherr), bir ayırma denemesinin ardından durumu şöyle özetlemiş:

demucs, vokal kanalına çok fazla saksofon sızdırdı.

Deneyimli kullanıcıların yöneldiği çözüm bir bayrak değil, ikinci bir model kullanmak. Japon prodüktör 夜凪P (@yonagip, 145 beğeni), önce UVR5 içinde MelBand Roformer ile vokali enstrümantal bölümden ayırdığını, ardından yalnızca enstrümantal kısmı davul, bas ve diğer stem'lerine ayırmak için htdemucs_ft'ye verdiğini anlatıyor:

Demucs単体だとVoが他に漏れるんだけど (Demucs tek başına kullanıldığında vokaller diğer stem'lere sızıyor)

İki kullanıcı raporu daha aynı noktaya işaret ediyor: Bir prodüktör htdemucs_ft ile daha iyi bas ayrımı elde ettiğini, ancak CPU işlem süresinin dört katına çıktığını söylüyor (@hachi_vm). Bir başka kullanıcı da gitar ayırma karşılaştırmasında htdemucs-6s'in BS-RoFormer modeline gözle görülür biçimde yenildiğini gösteriyor (@junon_12). Bunlar kıyaslama testleri değil, kullanıcı deneyimleri. Ancak resmî açıklamayla örtüşüyorlar: Défossez, altı kaynaklı modeli Aralık 2022'de duyururken "bir miktar sızıntı ve artefakt" gözlemlediğini yazmıştı.

Pratik kural: Kaynakta saksofon, lead gitar veya melodik bir piyano varsa, Demucs'un tek geçişini son ürün değil, başlangıç noktası olarak görün. İkinci geçiş için Roformer sınıfı alternatiflere UVR5 arayüzü üzerinden ulaşabilirsiniz.

Demucs'u Kurmak Yerine API Olarak Kullanmak

Python ortamı kurmadan stem elde etmek istiyorsanız, yaygın kullanılan barındırılmış seçeneklerden biri Replicate üzerindeki cjwbw/demucs. Nvidia T4 donanımında yaklaşık 1,5 milyon çalıştırmaya ulaşan modelin kendi sayfasındaki tahmin, çalıştırma başına yaklaşık $0.020 (dolar başına yaklaşık 50 çalıştırma) ve tahminlerin genellikle 90 saniye içinde tamamlandığı yönünde.

Girdi formunu, donanımı ve çalıştırma sayısını gösteren Replicate cjwbw/demucs model sayfası

Girdi şeması CLI ile aynı seçenekleri sunuyor: model_name (varsayılan htdemucs), stem, shifts (varsayılan 1), overlap (0.25), clip_mode (rescale), mp3_bitrate (320), float32 ve output_format (mp3).

Sayfanın sizin için belirtmediği bir uyarı var: En son sürümü yaklaşık üç yıl öncesine dayanıyor ve barındırılan uç nokta belirli bir anlık görüntüye sabitlenmiş durumda. Yani Temmuz 2026'da gelen v4.1.0 paketleme ve bağımlılık çalışmalarını değil, o sürümü çağırıyorsunuz. Çalışma süresi de başlıktaki tahminden daha fazla değişkenlik gösteriyor; aynı modeldeki herkese açık örneklerden birinin tamamlanması 6 dakika 18 saniye sürmüş.

4 Dakikalık Bir Parçanın Gerçek Maliyeti

İş akışını belirleyen asıl değer parça başına maliyet ve burada çoğu kullanıcının abonelikten sonra fark ettiği bir faturalandırma ayrıntısı var.

LALAL.AI, kullanımı dosya uzunluğu × seçilen stem ayırma türü sayısı olarak hesaplıyor. Dört stem'e ayrılan 4 dakikalık bir şarkı bu nedenle 4 değil, 16 dakika tüketiyor.

Starter, Lite ve Pro plan sütunlarını gösteren LALAL.AI fiyatlandırma sayfası

Aynı fiyatlandırma sayfasında listelenen tek seferlik ek paketler (25 Eylül 2026'da kontrol edildi) şöyle: 750 Fast Queue dakikası için $50, 3.000 dakika için $190 ve 5.000 dakika için $300. Bu oranlarla 4 dakikalık bir şarkının dört stem'e ayrılmasının maliyeti $0.96 ile $1.07 arasında değişiyor.

4 dakikalık dört stem'li bir parçanın maliyetini gösteren çubuk grafik: yerel Demucs, 0.02 USD ile Replicate cjwbw/demucs ve 0.96-1.07 USD arasındaki LALAL.AI ek paketleri

Bu grafiği yorumlarken bir düzeltmeyi aklınızda bulundurun: LALAL.AI değerleri öncelikli işlem ücretleri. Ücretli planlarda Relaxed Queue dakikaları sınırsız ve şirket, her iki kuyruğun da "aynı ayırma kalitesini sunduğunu" belirtiyor. Fast Queue yalnızca bekleme süresini kısaltıyor.

PlanFiyatDahil olanlarÖnemli sınırlar
LALAL.AI StarterÜcretsiz10 Relaxed Queue dakikası200 MB yükleme sınırı
LALAL.AI Lite€6.75/ay, yıllık €81 faturalandırılırSınırsız Relaxed, 90 Fast dakikasıToplu işlem, VST veya API yok; dakikalar devretmez
LALAL.AI Pro€13.50/ay, yıllık €162 faturalandırılırSınırsız Relaxed, 250 Fast dakikasıAPI erişimi, VST eklentisi ve toplu işlem yalnızca bu pakette
MoisesHerkese açık olarak yayımlanmıyorAylık yükleme sınırı olan ücretsiz katmanFiyat tablosu giriş arkasında; 27 stem türü sunduğunu belirtiyor
Replicate cjwbw/demucsÇalıştırma başına yaklaşık $0.020T4, genellikle 90 saniyenin altındaSürüm yaklaşık 3 yıl öncesine sabitlenmiş
Yerel DemucsÜcretsiz (MIT lisansı)Sınırsız, çevrimdışıGPU süreniz ve kurulum için harcadığınız emek

Lite planındaki 90 Fast Queue dakikası, Relaxed Queue'ya geçmeden önce ayda yaklaşık beş adet 4 stem'li parçayı kapsıyor. Haftada birkaç parçadan fazlasını işliyorsanız, hesap hızla dakika başına ücretlendirme aleyhine dönüyor. Demucs kurulumuna ayırdığınız bir öğleden sonranın karşılığını almaya başladığınız eşik de tam olarak burası.

Hangi İş İçin Hangi Yol?

DurumunuzEn iyi seçenekNedeni
Ara sıra stem ayırma, GPU yok, terminal kullanmak istemiyorsunuzLALAL.AI Starter, ardından Lite10 dakikalık ücretsiz kullanım, para harcamadan önce kaliteyi test etmenizi sağlar
Şarkı öğrenme, mobil odaklı pratikMoises27 stem türünün yanı sıra tempo ve akor araçları sunuyor; fiyatı giriş yaptıktan sonra kontrol edin
Yoğun kullanım, kendi GPU'nuz varhtdemucs ile uvx demucsSıfır marjinal maliyet, sınırsız çalıştırma ve dosyalar makinenizden çıkmaz
Önemli bir parçanın son çıktısıGPU üzerinde htdemucs_ft, --shifts 24 kat işlem maliyeti karşılığında kalitenin son bölümünü kazandırır
Gitar stem'i gerekiyorÖnce htdemucs_6s, ardından UVR5 içinde Roformer sınıfı bir modelle karşılaştırmaResmî dokümanlar altı kaynaklı modelde sızıntı olduğunu kabul ediyor
Yayımlanmamış veya NDA kapsamındaki materyalYalnızca yerel DemucsYükleme yok, MIT lisansı, çevrimdışı işlem
Uygulama arka ucu, operasyon bütçesi yokReplicate cjwbw/demucsÇalıştırma başına yaklaşık $0.020 ve yönetilecek GPU altyapısı yok

Demucs Stem Ayırma SSS

Vokaller için en iyi Demucs modeli hangisi?

htdemucs_ft, dağıtılan dört kaynaklı modeller arasında vokal için en güçlü seçenek ve işlem süresi htdemucs'un yaklaşık dört katı. Zor mikslerde kullanıcılar iki aşamalı bir zincirden daha iyi sonuç aldıklarını söylüyor: önce Roformer sınıfı bir vokal ayırma, ardından enstrümantal bölümü Demucs ile ayrıştırma.

Demucs gitarı ve piyanoyu ayırabilir mi?

Yalnızca htdemucs_6s ile. Resmî README, hızlı testlerde gitar kalitesini "idare eder" olarak tanımlıyor; piyano kaynağının ise "pek iyi çalışmadığını" ve "çok fazla sızıntı ve artefakt" bulunduğunu söylüyor.

Demucs çalıştırmak için NVIDIA GPU gerekir mi?

Hayır. CPU üzerinde -d cpu ile çalışır ve dokümanlar işlem süresini parça süresinin yaklaşık 1,5 katı olarak tahmin ediyor. Apple Silicon kullanıcıları -d mps kullanabilir. GPU hızlandırması için en az 3 GB VRAM, varsayılan ayarlarla ise yaklaşık 7 GB gerekir.

Ayrılan stem'ler neden yeniden birleştirildiğinde orijinal miks oluşmuyor?

Demucs, ayırma artefaktlarının neden olduğu kırpılmayı önlemek için her stem'i yeniden ölçeklendirir. Bu işlem stem'ler arasındaki göreli ses seviyelerini bozabilir. Bunun yerine sert kırpma uygulamak için --clip-mode clamp kullanın veya işlemden önce giriş miksinin sesini azaltın.

Demucs stem'leri nereye kaydediyor?

Stereo WAV dosyaları olarak separated/MODEL_NAME/TRACK_NAME/ klasörüne kaydeder. Çıktılar 44.1 kHz örnekleme hızında int16 olarak kodlanır: drums.wav, bass.wav, other.wav ve vocals.wav. MP3, FLAC, int24 veya float32 çıktısı istemeniz durumunda format değişir.

CUDA out-of-memory hatasını nasıl düzeltebilirim?

--segment değerini düşürün (3 GB kartlar için dokümante edilen taban değer 8), PYTORCH_NO_CUDA_MEMORY_CACHING=1 ayarını kullanın veya -d cpu ile CPU'ya dönün. Hybrid Transformer modellerinin segment uzunluğunu 7.8 saniyeyle sınırladığını unutmayın; bu modellerde değeri bunun üzerine çıkarmanın bir etkisi olmaz.