Orijinal facebookresearch/demucs reposu 1 Ocak 2025'ten beri salt okunur durumda. Demucs, kendi bilgisayarınızda çalıştırabileceğiniz en güçlü ücretsiz seçeneklerden biri olmayı sürdürüyor. Bunun için v4.1.0'ı yayımlayan fork üzerinden kurulum yapmanız ve gitarla piyanoda sonuçların ilk bozulduğunu kabul etmeniz gerekiyor.
Arşivlenmiş Repo Yerine Güncel Demucs Reposuyla Başlayın
Aynı README'yi taşıyan iki GitHub reposu var, ancak yalnızca biri hâlâ düzeltme alıyor. facebookresearch/demucs arşivlenmiş ve salt okunur durumda; kendi README'si de başka bir adrese yönlendiriyor. Güncel repo ise adefossez/demucs. Projenin yazarı Alexandre Défossez burada, Meta'dan ayrılıp Kyutai'ye katılmasının ardından buranın "şu anda resmî olarak sürdürülen Demucs" olduğunu, ancak "yanıtların yavaş olmasını ve şimdilik yeni özellik beklenmemesini" söylüyor.
Bu fark yalnızca repo adresini değil, kurulum komutlarını da değiştiriyor.
v4.1.0 ile neler değişti?
11/07/2026 tarihli sürüm notlarında Demucs v4.1.0 için "modernleştirilmiş paketleme, daha hafif çıkarım bağımlılıkları, çok sayıda düzeltme ve Hugging Face üzerinde barındırılan önceden eğitilmiş modeller" ifadeleri kullanılıyor. Pratikte tablo şöyle:
| Öğe | Arşivlenmiş repo | Güncel repo (v4.1.0) |
|---|---|---|
| Minimum Python sürümü | 3.8 | 3.10 |
| En hızlı çalıştırma | pip install -U demucs | uvx demucs MY_TRACK.mp3 (kurulum gerektirmez) |
| Kalıcı kurulum | pip install -U demucs | uv tool install demucs (pip de çalışır) |
| ffmpeg | Gerekli | İsteğe bağlı; FLAC çıktısı ve sphn'in çözemediği formatlar için gerekli |
| Nicemlenmiş modeller | Dahil | Ek paket gerekir: uvx "demucs[quantized]" -n mdx_q MY_TRACK.mp3 |
| Ağırlıkların barındırıldığı yer | dl.fbaipublicfiles.com | Hugging Face |
Bir hata bildirmeden önce bilmeniz gereken önemli bir ayrıntı var: PyTorch, 2.2 sürümünden sonra Intel Mac desteğini bıraktı. Bu nedenle Intel Mac kullanıcıları Python 3.12 ile sınırlı ve uvx --python 3.12 demucs komutunu çalıştırmaları gerekiyor.
Model Seçimi: htdemucs, htdemucs_ft, htdemucs_6s ve mdx
Modeli -n bayrağıyla seçiyorsunuz; varsayılan model her durumda en doğru tercih olmayabilir. Demucs; davul, bas, diğer ve vokal olmak üzere dört kaynaklı modellerin yanı sıra altı kaynaklı deneysel bir model ve daha eski MDX yarışma modelleri sunuyor.
| Model | Kaynak sayısı | Hız | Resmî uyarı | Ne zaman seçilmeli? |
|---|---|---|---|---|
htdemucs | 4 | Temel seviye (varsayılan) | Belirtilmemiş | İlk deneme, toplu işlemler ve hızın önemli olduğu her senaryo |
htdemucs_ft | 4 | Yaklaşık 4 kat daha yavaş | "Biraz daha iyi olabilir" | Önem verdiğiniz bir parçanın son çıktısını alırken |
htdemucs_6s | 6 | İkisinin arasında | Gitar "idare eder"; piyano "pek iyi çalışmıyor", ayrıca "çok fazla sızıntı ve artefakt" var | Özellikle gitar stem'ine ihtiyacınız varsa ve kusurları göze alabiliyorsanız |
hdemucs_mmi | 4 | Temel seviye | v3 mimarisi, yeniden eğitilmiş | v4 belirli bir miks üzerinde kötü sonuç verdiğinde A/B karşılaştırması için |
mdx / mdx_extra | 4 | Temel seviye | mdx_extra, MUSDB test setini de içeren verilerle eğitildi | Eski kayıtlar veya v4 artefaktları rahatsız edici olduğunda |
mdx_q / mdx_extra_q | 4 | En hızlı ve en küçük | "Kalite biraz daha kötü olabilir" | Depolama alanı kısıtlı makineler ve hızlı önizlemeler için |
htdemucs_ft için kullanılan ifadeye dikkat edin: dört kat işlem gücü karşılığında, projenin yazarı bile kalite artışını yalnızca mümkün olarak tanımlıyor. CPU üzerinde bu bedel oldukça ağır ve kullanıcılar da bunu açıkça belirtiyor.
9.00 ve 9.20 dB SDR değerleri gerçekte neyi ölçüyor?
Her iki değer aynı README paragrafında geçiyor, ancak birbirinin yerine kullanılamaz. Hybrid Transformer Demucs, MUSDB HQ test setinde 9.00 dB SDR değerine ulaşıyor. Daha yüksek olan 9.20 dB sonucu ise seyrek dikkat çekirdekleriyle kaynak başına ince ayar gerektiriyor. Üstelik bu seyrek model, "henüz yayıma hazır olmayan özel CUDA kodu gerektirdiği için sunulmuyor."
Dolayısıyla indirip kullanabileceğiniz hiçbir model 9.20 dB sonucunu tekrarlamıyor. README'deki karşılaştırma tablosunda, dağıtılan ince ayarlı v4 modeli toplam SDR'de 9.0 seviyesinde ve 1,7 bin miksle eğitilmiş Band-Split RNN ile aynı sırada yer alıyor.
Aynı tabloda Spleeter, 25 bin şarkıyla eğitilmiş olmasına rağmen 5.9 dB seviyesinde kalıyor. Bu, ince ayarlı v4 modeliyle arasında yaklaşık 3 dB fark olduğu anlamına geliyor.
Çıktıyı Değiştiren Bayraklar
Çoğu Demucs çalıştırmasında üç karar vermeniz gerekir: kaç stem istediğiniz, ne kadar işlem gücü harcayacağınız ve çıktının hangi formatta yazılacağı.
--two-stems=vocalskaraoke modu sunar vevocals.wavileno_vocals.wavdosyalarını üretir. Önce tam miks ayrıştırılır, ardından çıktı mikslenir. Bu yüzden normal çalıştırmaya göre ne daha hızlıdır ne de daha az bellek kullanır.--shifts=N, rastgele kaydırılmış giriş üzerinde N tahminin ortalamasını alır. Tahmini N kat yavaşlatır. README'nin önerisi net: "GPU'nuz yoksa kullanmayın." Makalede 10 kaydırma kullanılmış, Replicate'in barındırılan varsayılanı ise 1.--overlapvarsayılan olarak 0.25 değerindedir; küçük bir hız kazanımı için 0.1'e indirilebilir.--segment Nbellek yetersizliği sorunlarında başvurulan ayardır. Burada kopyalanmış komutları sessizce bozan bir ayrıntı var: Hybrid Transformer modelleri en fazla 7.8 saniyelik segment uzunluğunu destekler. Bu nedenle uzun bir--segmentdeğeri yalnızca HT dışındaki modellerde işe yarar.- Çıktı bayrakları arasında
--mp3(varsayılan 320 kbps),--flac(ffmpeg gerekir),--int24ve--float32bulunur. Varsayılan çıktı,separated/MODEL_NAME/TRACK_NAMEklasöründe 44.1 kHz int16 WAV olarak oluşturulur. --clip-modegöründüğünden daha önemlidir: Demucs, varsayılan olarak kırpılmayı önlemek için stem'leri yeniden ölçeklendirir. Bu işlem stem'ler arasındaki göreli ses seviyelerini bozabilir.clampise bunun yerine sert bir sınır uygular.
Aynı dokümana göre donanım beklentisi şöyle: en az 3 GB GPU belleği, varsayılan ayarlarla yaklaşık 7 GB ve 3 GB veya daha az belleğiniz varsa --segment 8 ile birlikte PYTORCH_NO_CUDA_MEMORY_CACHING=1 kullanmanız gerekiyor. CPU üzerinde "işleme süresi yaklaşık olarak parçanın süresinin 1,5 katı olmalı." Bu, kullanıcıların htdemucs_ft ile bildirdiği sonuçların yanında oldukça iyimser bir tahmin.
Demucs Nerelerde Zorlanıyor ve Kullanıcıların Uyguladığı İki Aşamalı Çözüm
Sızıntı, kullanıcı şikâyetlerinde tekrar tekrar karşımıza çıkıyor. Özellikle vokallerin lead enstrümanla aynı frekans aralığını paylaştığı durumlarda sorun belirginleşiyor. Ryan Herr (@rrherr), bir ayırma denemesinin ardından durumu şöyle özetlemiş:
demucs, vokal kanalına çok fazla saksofon sızdırdı.
Deneyimli kullanıcıların yöneldiği çözüm bir bayrak değil, ikinci bir model kullanmak. Japon prodüktör 夜凪P (@yonagip, 145 beğeni), önce UVR5 içinde MelBand Roformer ile vokali enstrümantal bölümden ayırdığını, ardından yalnızca enstrümantal kısmı davul, bas ve diğer stem'lerine ayırmak için htdemucs_ft'ye verdiğini anlatıyor:
Demucs単体だとVoが他に漏れるんだけど (Demucs tek başına kullanıldığında vokaller diğer stem'lere sızıyor)
İki kullanıcı raporu daha aynı noktaya işaret ediyor: Bir prodüktör htdemucs_ft ile daha iyi bas ayrımı elde ettiğini, ancak CPU işlem süresinin dört katına çıktığını söylüyor (@hachi_vm). Bir başka kullanıcı da gitar ayırma karşılaştırmasında htdemucs-6s'in BS-RoFormer modeline gözle görülür biçimde yenildiğini gösteriyor (@junon_12). Bunlar kıyaslama testleri değil, kullanıcı deneyimleri. Ancak resmî açıklamayla örtüşüyorlar: Défossez, altı kaynaklı modeli Aralık 2022'de duyururken "bir miktar sızıntı ve artefakt" gözlemlediğini yazmıştı.
Pratik kural: Kaynakta saksofon, lead gitar veya melodik bir piyano varsa, Demucs'un tek geçişini son ürün değil, başlangıç noktası olarak görün. İkinci geçiş için Roformer sınıfı alternatiflere UVR5 arayüzü üzerinden ulaşabilirsiniz.
Demucs'u Kurmak Yerine API Olarak Kullanmak
Python ortamı kurmadan stem elde etmek istiyorsanız, yaygın kullanılan barındırılmış seçeneklerden biri Replicate üzerindeki cjwbw/demucs. Nvidia T4 donanımında yaklaşık 1,5 milyon çalıştırmaya ulaşan modelin kendi sayfasındaki tahmin, çalıştırma başına yaklaşık $0.020 (dolar başına yaklaşık 50 çalıştırma) ve tahminlerin genellikle 90 saniye içinde tamamlandığı yönünde.
Girdi şeması CLI ile aynı seçenekleri sunuyor: model_name (varsayılan htdemucs), stem, shifts (varsayılan 1), overlap (0.25), clip_mode (rescale), mp3_bitrate (320), float32 ve output_format (mp3).
Sayfanın sizin için belirtmediği bir uyarı var: En son sürümü yaklaşık üç yıl öncesine dayanıyor ve barındırılan uç nokta belirli bir anlık görüntüye sabitlenmiş durumda. Yani Temmuz 2026'da gelen v4.1.0 paketleme ve bağımlılık çalışmalarını değil, o sürümü çağırıyorsunuz. Çalışma süresi de başlıktaki tahminden daha fazla değişkenlik gösteriyor; aynı modeldeki herkese açık örneklerden birinin tamamlanması 6 dakika 18 saniye sürmüş.
4 Dakikalık Bir Parçanın Gerçek Maliyeti
İş akışını belirleyen asıl değer parça başına maliyet ve burada çoğu kullanıcının abonelikten sonra fark ettiği bir faturalandırma ayrıntısı var.
LALAL.AI, kullanımı dosya uzunluğu × seçilen stem ayırma türü sayısı olarak hesaplıyor. Dört stem'e ayrılan 4 dakikalık bir şarkı bu nedenle 4 değil, 16 dakika tüketiyor.
Aynı fiyatlandırma sayfasında listelenen tek seferlik ek paketler (25 Eylül 2026'da kontrol edildi) şöyle: 750 Fast Queue dakikası için $50, 3.000 dakika için $190 ve 5.000 dakika için $300. Bu oranlarla 4 dakikalık bir şarkının dört stem'e ayrılmasının maliyeti $0.96 ile $1.07 arasında değişiyor.
Bu grafiği yorumlarken bir düzeltmeyi aklınızda bulundurun: LALAL.AI değerleri öncelikli işlem ücretleri. Ücretli planlarda Relaxed Queue dakikaları sınırsız ve şirket, her iki kuyruğun da "aynı ayırma kalitesini sunduğunu" belirtiyor. Fast Queue yalnızca bekleme süresini kısaltıyor.
| Plan | Fiyat | Dahil olanlar | Önemli sınırlar |
|---|---|---|---|
| LALAL.AI Starter | Ücretsiz | 10 Relaxed Queue dakikası | 200 MB yükleme sınırı |
| LALAL.AI Lite | €6.75/ay, yıllık €81 faturalandırılır | Sınırsız Relaxed, 90 Fast dakikası | Toplu işlem, VST veya API yok; dakikalar devretmez |
| LALAL.AI Pro | €13.50/ay, yıllık €162 faturalandırılır | Sınırsız Relaxed, 250 Fast dakikası | API erişimi, VST eklentisi ve toplu işlem yalnızca bu pakette |
| Moises | Herkese açık olarak yayımlanmıyor | Aylık yükleme sınırı olan ücretsiz katman | Fiyat tablosu giriş arkasında; 27 stem türü sunduğunu belirtiyor |
Replicate cjwbw/demucs | Çalıştırma başına yaklaşık $0.020 | T4, genellikle 90 saniyenin altında | Sürüm yaklaşık 3 yıl öncesine sabitlenmiş |
| Yerel Demucs | Ücretsiz (MIT lisansı) | Sınırsız, çevrimdışı | GPU süreniz ve kurulum için harcadığınız emek |
Lite planındaki 90 Fast Queue dakikası, Relaxed Queue'ya geçmeden önce ayda yaklaşık beş adet 4 stem'li parçayı kapsıyor. Haftada birkaç parçadan fazlasını işliyorsanız, hesap hızla dakika başına ücretlendirme aleyhine dönüyor. Demucs kurulumuna ayırdığınız bir öğleden sonranın karşılığını almaya başladığınız eşik de tam olarak burası.
Hangi İş İçin Hangi Yol?
| Durumunuz | En iyi seçenek | Nedeni |
|---|---|---|
| Ara sıra stem ayırma, GPU yok, terminal kullanmak istemiyorsunuz | LALAL.AI Starter, ardından Lite | 10 dakikalık ücretsiz kullanım, para harcamadan önce kaliteyi test etmenizi sağlar |
| Şarkı öğrenme, mobil odaklı pratik | Moises | 27 stem türünün yanı sıra tempo ve akor araçları sunuyor; fiyatı giriş yaptıktan sonra kontrol edin |
| Yoğun kullanım, kendi GPU'nuz var | htdemucs ile uvx demucs | Sıfır marjinal maliyet, sınırsız çalıştırma ve dosyalar makinenizden çıkmaz |
| Önemli bir parçanın son çıktısı | GPU üzerinde htdemucs_ft, --shifts 2 | 4 kat işlem maliyeti karşılığında kalitenin son bölümünü kazandırır |
| Gitar stem'i gerekiyor | Önce htdemucs_6s, ardından UVR5 içinde Roformer sınıfı bir modelle karşılaştırma | Resmî dokümanlar altı kaynaklı modelde sızıntı olduğunu kabul ediyor |
| Yayımlanmamış veya NDA kapsamındaki materyal | Yalnızca yerel Demucs | Yükleme yok, MIT lisansı, çevrimdışı işlem |
| Uygulama arka ucu, operasyon bütçesi yok | Replicate cjwbw/demucs | Çalıştırma başına yaklaşık $0.020 ve yönetilecek GPU altyapısı yok |
Demucs Stem Ayırma SSS
Vokaller için en iyi Demucs modeli hangisi?
htdemucs_ft, dağıtılan dört kaynaklı modeller arasında vokal için en güçlü seçenek ve işlem süresi htdemucs'un yaklaşık dört katı. Zor mikslerde kullanıcılar iki aşamalı bir zincirden daha iyi sonuç aldıklarını söylüyor: önce Roformer sınıfı bir vokal ayırma, ardından enstrümantal bölümü Demucs ile ayrıştırma.
Demucs gitarı ve piyanoyu ayırabilir mi?
Yalnızca htdemucs_6s ile. Resmî README, hızlı testlerde gitar kalitesini "idare eder" olarak tanımlıyor; piyano kaynağının ise "pek iyi çalışmadığını" ve "çok fazla sızıntı ve artefakt" bulunduğunu söylüyor.
Demucs çalıştırmak için NVIDIA GPU gerekir mi?
Hayır. CPU üzerinde -d cpu ile çalışır ve dokümanlar işlem süresini parça süresinin yaklaşık 1,5 katı olarak tahmin ediyor. Apple Silicon kullanıcıları -d mps kullanabilir. GPU hızlandırması için en az 3 GB VRAM, varsayılan ayarlarla ise yaklaşık 7 GB gerekir.
Ayrılan stem'ler neden yeniden birleştirildiğinde orijinal miks oluşmuyor?
Demucs, ayırma artefaktlarının neden olduğu kırpılmayı önlemek için her stem'i yeniden ölçeklendirir. Bu işlem stem'ler arasındaki göreli ses seviyelerini bozabilir. Bunun yerine sert kırpma uygulamak için --clip-mode clamp kullanın veya işlemden önce giriş miksinin sesini azaltın.
Demucs stem'leri nereye kaydediyor?
Stereo WAV dosyaları olarak separated/MODEL_NAME/TRACK_NAME/ klasörüne kaydeder. Çıktılar 44.1 kHz örnekleme hızında int16 olarak kodlanır: drums.wav, bass.wav, other.wav ve vocals.wav. MP3, FLAC, int24 veya float32 çıktısı istemeniz durumunda format değişir.
CUDA out-of-memory hatasını nasıl düzeltebilirim?
--segment değerini düşürün (3 GB kartlar için dokümante edilen taban değer 8), PYTORCH_NO_CUDA_MEMORY_CACHING=1 ayarını kullanın veya -d cpu ile CPU'ya dönün. Hybrid Transformer modellerinin segment uzunluğunu 7.8 saniyeyle sınırladığını unutmayın; bu modellerde değeri bunun üzerine çıkarmanın bir etkisi olmaz.