如何從歌曲中去除人聲:方法比較(2026)
2026年4月13日 — CATEGORY:VOCAL REMOVER
若要從歌曲中去除人聲,2026 年有四種可行方案:使用 AI 人聲分離服務(Moises、LALAL.AI、Vocal Remover Cyborg)、在本機執行免費桌面應用程式 Ultimate Vocal Remover(UVR)、在 Audacity 中套用相位反轉,或直接使用串流服務內建的卡拉OK 模式(限其目錄內已提供的歌曲)。AI 分離產生的伴奏遠比舊式相位反轉技巧乾淨得多,但大規模的 AI 運算並非免費。本指南比較每個實際可行的方案,附上定價說明、品質背景與逐步操作指引,讓你能為卡拉OK、混音、翻唱錄音、取樣或音樂學習挑選合適的方法。
重點摘要
- AI 在品質上勝出:現代神經網路分離(Demucs、MDX-Net)遠比 Audacity 的相位反轉乾淨許多。
- 免費方案確實存在:Ultimate Vocal Remover 是真正免費,但需要大量 RAM(處理整首歌約需 10 GB 或以上)且有學習曲線。Audacity 免費但使用較舊的相位反轉方法。
- 付費雲端服務:Moises、LALAL.AI 與 Vocal Remover Cyborg(€6/年 或 €30 終身授權)皆在雲端使用 AI——無需高階硬體。
- 先確認目前定價:Moises 與 LALAL.AI 常調整方案——付款前務必先查看它們自家的定價頁面。
- 來源品質很重要:從高位元率音訊(WAV 或 320 kbps MP3)開始——128 kbps 檔案的分離效果會明顯較差。
為什麼要從歌曲中去除人聲?
人們搜尋「如何從歌曲中去除人聲」的原因很多。了解你的使用情境有助於挑選合適的工具——一場臨時的卡拉OK 之夜,與準備發行翻唱版本上串流平台,需求截然不同。
- 卡拉OK:最經典的用途。從任何歌曲中去掉主唱人聲,讓你在派對、車上或社群媒體對唱時盡情獻唱。
- 翻唱錄音:音樂人與影片創作者會在既有伴奏上錄製自己的人聲。乾淨的分離可省下數小時尋找官方卡拉OK 版本的時間。
- 混音與 Mashup:DJ 與製作人需要獨立的 acapella 與伴奏鋪底來混合曲目。分離歌曲一次就能同時取得兩者——將 Vocal Remover Cyborg 搭配 Acapella Cyborg 取得純人聲分軌。
- 取樣與節拍製作:翻玩一段迴圈、切一段副歌、擷取一段吉他 riff,且不會讓原始人聲滲入你的新曲(需遵守取樣授權規範——請見下方「法律」段落)。
- 音樂學習與採譜:音樂老師、學生與採譜者會使用純伴奏版本,來聽清楚原本被主唱蓋住的和弦聲位、貝斯線與鼓點。可搭配 Bass Cyborg 或 Drum Cyborg 來獨立擷取特定聲部。
- 音樂人練習曲:吉他手可以在原始伴奏上練習 solo;歌手可以對著伴奏練和聲;貝斯手可以與真正的鼓手同步,而不是節拍器。
- 內容創作:為 Podcast、直播與影片提供背景音樂,讓對白或旁白取代原始歌詞。
- 舞蹈排練:編舞者有時想要一段更乾淨的節拍鋪底來數拍,而不希望人聲分散舞者的注意力。
人聲去除實際上如何運作
背後有三種基礎技術,而它們之間的差異正好解釋了為何品質差距如此懸殊。
1. 中央聲道消除(相位反轉)
最古老的手法。多數流行混音會將主唱人聲擺放在正中央,因此人聲會等量出現在左右兩聲道。若將其中一個聲道的相位反轉再相加,任何完全置中的訊號都會抵消。問題在於:大鼓、貝斯與小鼓通常也位於中央,於是它們會與人聲一起消失。結果聽起來單薄、空洞、明顯有瑕疵。Audacity 的 Vocal Reduction 效果採用的就是這種方法。
2. 頻譜遮罩(較舊的 AI)
早期神經網路會分析歌曲的頻譜圖,並建立遮罩來衰減符合人聲模式的頻率。比相位反轉好,但仍會產生水感、彷彿在水底的失真感,因為無法乾淨地分離重疊的頻率。
3. 現代來源分離網路
當前最先進的技術——Meta 的 Demucs v4、MDX-Net 與 HTDemucs——都以配對資料訓練,研究人員同時擁有完整混音與原始 DAW 中的獨立分軌。網路會學到人聲、鼓、貝斯與「其他」實際上作為獨立訊號聽起來是什麼樣子,而不僅僅是套用濾波器。面對新歌時,它會直接預測每個分軌。這正是 Moises、LALAL.AI、UVR 與 Vocal Remover Cyborg 都能產生乾淨結果的原因。相位反轉與現代 AI 之間的品質差距,在任何喇叭或耳機上都聽得出來。
方法 1:AI 人聲去除工具——目前最佳選擇
若想以最少的工夫獲得最佳品質,AI 雲端服務就是答案。你上傳檔案,伺服器在 GPU 上執行 Demucs 級別的模型,然後下載兩個音軌:伴奏與 acapella。有四個實力派選手。
Moises
精緻的行動與網頁應用程式,分離品質良好。定價會隨時間與地區變動——請查閱 moises.ai/pricing 以確認目前的方案。免費層有限;付費訂閱可解鎖更高品質的分離與批次/商用權利。
LALAL.AI
品質優異,網頁介面乾淨。以組合包計價(依處理分鐘數付費)。通常提供少量免費額度供你評估輸出品質。請至 lalal.ai 查看目前的組合包價格。
Vocal Remover Cyborg
Vocal Remover Cyborg 在雲端執行相同等級的神經模型。上傳接受 MP3 與 WAV 檔案,每檔上限 200 MB,最多可批次 50 個檔案。AppsCyborg 為付費服務——€6/年 或 €30 終身授權。無需安裝任何軟體,無需任何設定,本機也不需要 GPU。在此領域中,終身授權方案並不常見。註冊、付款一次,帳戶即涵蓋整套工具,包括 Acapella Cyborg、Bass Cyborg 與 Drum Cyborg,可獨立擷取各聲部分軌。
Ultimate Vocal Remover(UVR)
真正免費、開源,並幾乎收錄所有領先的分離模型——MDX-Net、Demucs v4、VR Architecture 與數十個社群釋出的檢查點。代價是:它在你的本機執行。預計需要一張具有 6 GB 或以上 VRAM 的獨立 GPU,或至少約 10 GB 系統 RAM 才能有合理速度;在中階筆電上,一首 4 分鐘的歌可能得跑 10–30 分鐘。介面對新手來說相當令人卻步——模型選擇、Ensemble 模式、後處理切換——若挑錯模型,結果甚至比不分離更糟。進階使用者相當熱愛;一般使用者則往往打退堂鼓。
方法 2:Audacity 人聲衰減(免費、相位反轉)
Audacity 完全免費、開源,並內建 Vocal Reduction and Isolation 效果。對於堅持不花錢又無法執行 UVR 的人來說,這就是答案。以下是操作流程:
- 從 audacityteam.org 下載 Audacity 並安裝。
- 開啟你的歌曲:File > Import > Audio。
- 以 Ctrl+A 選取整個音軌。
- 前往 Effect > Special > Vocal Reduction and Isolation。
- 在對話框中,將動作選為 「Remove Vocals: to Mono」。
- 除非想實驗,否則保留頻率範圍的預設值(低截止約 120 Hz,高截止約 9000 Hz)。
- 點擊 Apply。匯出前先預覽。
- 以 File > Export > Export as MP3(或選 WAV 以獲得最佳品質)匯出。
誠實評估:結果會有一種過時的感覺。位居中央的貝斯與鼓會連同人聲一起被掏空。殘響尾音與和聲會像鬼魅耳語般滲出。此法最適用於 1960 至 1980 年代的簡單、以立體聲大幅度左右分佈的錄音。面對現代具備 sidechain 貝斯與樣本堆疊鼓組的流行音樂,它破壞的比去除的還多。請將它視為最後手段。
方法 3:Ultimate Vocal Remover(UVR)——免費、本機 AI
如果你具備技術基礎、擁有足夠硬體,並希望取得 AI 品質卻不想付訂閱費,UVR 是誠實的答案。它是一款真正免費的桌面應用程式(Windows、Mac、Linux),內含與付費服務相同的模型家族。快速入門:
- 從 ultimatevocalremover.com/GitHub releases 頁面下載安裝程式。
- 安裝、啟動並下載入門模型包(MDX23C 或 Demucs HT 是不錯的預設)。
- 將歌曲拖曳至輸入欄位。
- 將處理方式選為 Demucs,模型選為 htdemucs_ft(微調版)。
- 設定輸出資料夾,並點擊 Start Processing。
須事先規劃的缺點:長歌曲的 RAM 用量可能突破 10 GB。若無 GPU,處理時間會是實際長度的數倍——一首 4 分鐘的歌可能要跑 20 分鐘。模型選擇對品質有明顯影響,而命名相當隱晦(UVR-MDX-NET-Inst_HQ_3 對 HTDemucs_6s 對 VR-5HP-Karaoke)。預期你會花一整晚在社群討論串中鑽研,才能定下偏好的處理流程。一旦定案,成果可與任何付費服務匹敵。
方法 4:串流服務上的卡拉OK 功能
Spotify 為部分歌曲加入了單曲人聲淡出;Apple Music 推出 Apple Music Sing,可在相容裝置上即時降低人聲音量;Amazon Music 也在部分曲目提供類似功能。這些值得一提,因為它們讓許多一般使用者不需另外的工具就能滿足卡拉OK 需求。
限制:你只能演唱串流服務已授權並準備好的歌曲——通常僅限主流熱門曲,並非冷門曲目。你無法匯出伴奏,也無法在 DAW 中使用,或處理你自己的本機檔案。若是真正的製作需求——翻唱錄音、混音、要帶去演出的伴奏——你仍需採用其他方法之一。
完整比較表
| 方法 | 品質 | 速度 | 批次 | 平台 | 定價 | 學習曲線 | 最適合 |
|---|---|---|---|---|---|---|---|
| Vocal Remover Cyborg | 極佳 | 快速(雲端 GPU) | 最多 50 檔 | 網頁(任何裝置) | €6/年 或 €30 終身授權 | 極低 | 常用使用者 |
| Moises | 極佳 | 快速 | 依方案而定 | 網頁 + 行動應用程式 | 訂閱制(請查閱定價) | 低 | 行動優先使用者 |
| LALAL.AI | 極佳 | 快速 | 是 | 網頁 | 組合包計價(請查看網站) | 低 | 偶爾的大型專案 |
| Ultimate Vocal Remover | 極佳 | 視硬體而定 | 是(可用腳本) | Windows/Mac/Linux 桌面 | 免費 | 高 | 擁有 GPU 的進階使用者 |
| Audacity | 普通(相位反轉) | 即時 | 手動 | Windows/Mac/Linux 桌面 | 免費 | 中等 | 零預算、一次性使用 |
| Spotify/Apple Sing | 良好(衰減) | 即時 | 否 | 僅限應用程式內 | 串流訂閱 | 無 | 一般卡拉OK |
結果比較:好與壞的人聲去除聽起來是什麼樣子
只要知道要聽什麼,評估人聲去除品質並不困難。戴上耳機,先聽完整混音,再聽伴奏,並檢查以下項目:
- 殘留的人聲耳語:糟糕的結果會留下歌詞的鬼魅殘影——尤其在齒擦音(s、t、sh 等聲響)與大聲的高音長音上。優質的 AI 模型能將這些乾淨去除。
- 渾濁的鼓組:相位反轉會把大鼓與小鼓削弱。若鼓組聽起來像失去了衝擊力,那就是相位抵消的失真,並非真正的鼓聲。
- 空洞的貝斯:同樣的抵消常會使貝斯變薄。若低頻聽起來像失去了核心,就代表你聽到的是較差的方法。
- 立體聲場崩塌:Audacity 這類去除方式可能把寬闊的立體聲混音變單聲道。AI 分離能保留原始的聲音全景。
- 水底/顫抖失真:早期 AI 模型會在諧波內容上產生這種「金屬感」聲響。現代 Demucs 級模型大多不會出現。
- 和聲滲漏:大多數工具鎖定主唱人聲。和聲、即興填唱與齊唱人聲可能仍會透出。有時你會希望保留(例如翻唱錄音),有時則不希望。
你該選哪一個?
根據你的情境提供一份快速決策指引:
- 預算緊、只有一兩首歌、不介意學習曲線:若電腦效能還行,選 Ultimate Vocal Remover(免費、本機)。電腦效能不佳的話則選 Audacity——接受較低品質。
- 常態使用、想要品質與便利、注重預算:選 Vocal Remover Cyborg,€30 終身授權。透過瀏覽器在任何裝置上皆可運作。
- 行動優先工作流:Moises 擁有優質的 iOS 與 Android 應用程式。若你主要在手機上處理,值得付訂閱費。
- 一個大型專案就結束:若素材量有上限且日後不需持續使用,LALAL.AI 的組合包計價可能划算。
- 進階使用者、批次處理、命令列流程:UVR 加上其 CLI 與一段 shell script,或使用 Vocal Remover Cyborg 的 50 檔批次來卸載到雲端。後者無需本機 GPU。
- 一般卡拉OK、歌曲已在 Spotify 上:使用 Spotify 內建的人聲淡出,或 Apple Music Sing。已付訂閱費即可免費使用。
獲得最佳人聲去除效果的技巧
即使是最佳的 AI 也會被糟糕的輸入擊敗。以下是取得更乾淨分離的實用技巧:
- 從高品質來源檔案開始:WAV 或 320 kbps MP3 能保留模型所需的頻譜細節。128 kbps 檔案的分離效果會明顯較差。註記:Vocal Remover Cyborg 接受
.mp3與.wav——若你有 FLAC 或 ALAC,請先轉成 WAV。 - 避免單聲道錄音:雖然現代 AI 並非嚴格需要立體聲,相位反轉工具在單聲道上完全失效,而 AI 模型在多一個聲道下也能得到略佳的結果。
- 相位方法請選立體聲豐富的混音:若只能用 Audacity,請挑選人聲明顯置中的曲目——例如經典搖滾、Motown 或錄音室流行樂。
- 戴耳機聆聽:筆電喇叭會掩蓋失真。耳機能立即暴露殘留人聲、鼓的相位問題與立體聲崩塌。
- 以 EQ 進行後處理:在 80 Hz 做輕微低頻棚形提升,並在 8 kHz 做溫和的高頻棚形提升,通常能還原分離後被鈍化的能量。
- 嘗試多個模型/Ensemble:在 UVR 中,跑兩個不同模型並對其輸出做 Ensemble,往往勝過單一模型。有些雲端服務以「加強」模式提供這項功能。
- 留意殘響尾音:帶有長殘響的人聲是最棘手的情況。尾音常會以一片糊聲的形式殘留在伴奏中。先做一輪去殘響處理會有幫助。
- 兩個分軌都存起來:分離過程中你等於免費得到了 acapella。留著它——你日後可能會用於 mashup 或取樣。若只需要人聲那一側,Acapella Cyborg 這類工具也能提供純人聲分軌。
法律與著作權注意事項
工具本身合法;你如何運用輸出結果才是關鍵。以下為非法律建議的簡短摘要:
- 個人用途通常可接受:製作卡拉OK 版本在家演唱、研究編曲、或對著伴奏練習樂器,在許多司法管轄區內通常屬於合理使用原則的範圍。
- 公開演出需要授權:卡拉OK 場所會透過音樂著作權集體管理團體(ASCAP、BMI、SACEM、PRS)支付概括授權費,因為對觀眾播放伴奏屬於公開演出。
- 翻唱與取樣不同:對擷取出的伴奏錄製完整的翻唱人聲並商業發行,通常需要機械授權(在美國透過 Harry Fox Agency 或 MLC)。在新曲中使用短暫切分的取樣,則需要取樣授權——是更棘手的議題。
- YouTube/社群平台:這些平台與多數主要出版商簽有概括合約。Content ID 通常會偵測你的翻唱並將收益歸於原作者,這是合法的使用方式。
- 受 DRM 保護的曲目:訂閱串流的音訊常受技術性保護;繞過該保護在你所在的司法管轄區可能違法,之後怎麼用都無法規避。
若有疑慮,就把伴奏留給自己使用,或在發行前先正式取得授權。
常見問題
2026 年從歌曲中去除人聲的最佳方式是什麼?
以 AI 為基礎的來源分離。Moises、LALAL.AI 與 Vocal Remover Cyborg 等服務在雲端執行 Demucs 與 MDX 級的神經網路,一兩分鐘內就能交付乾淨的伴奏。免費桌面應用程式 UVR 在本機使用相同類型的模型。以上任何一種在品質上皆勝過 Audacity 內建的人聲衰減。
可以免費從歌曲中去除人聲嗎?
可以——Ultimate Vocal Remover(UVR)是完全免費的桌面應用程式,可在本機執行現代 AI 模型;Audacity 也免費,但採用較舊的相位反轉方式,品質明顯較低。像 AppsCyborg 這類雲端 AI 服務為付費,因為大規模執行 GPU 推理有實際成本。
去除歌曲人聲要多少錢?
定價各有不同。Moises 與 LALAL.AI 常調整方案——請至各自網站查看目前定價。Vocal Remover Cyborg 為 €6/年,或 €30 一次付清享終身授權。UVR 與 Audacity 免費。
為何有些人聲去除工具會留下殘留耳語?
相位反轉工具無法分離重疊的頻率——只能抵消居中的訊號。較舊的 AI 模型會留下金屬感或水感的失真。現代的 Demucs v4 與 MDX-Net 在多數現代流行曲上留下的殘留幾乎聽不見。
可以從 YouTube 影片中去除人聲嗎?
可以。先擷取音訊,然後將產生的 MP3 或 WAV 餵給人聲去除工具。結果取決於來源品質——高位元率的音樂 MV 分離效果,比手機拍攝、帶著人群噪音的現場短片好得多。散布結果時務必尊重著作權。
從受著作權保護的歌曲製作卡拉OK 音軌合法嗎?
個人用途在許多司法管轄區內通常合法。若涉及公開演出、廣播或商業發行,就需要授權。卡拉OK 業者會向音樂著作權集體管理團體支付概括授權費,原因正是如此。
為了取得最佳結果,我該上傳哪種檔案格式?
以 Vocal Remover Cyborg 而言,請上傳 WAV 或 320 kbps MP3(這兩種是可接受的格式)。避免使用 128 kbps 檔案;有損壓縮會移除 AI 用來分辨人聲與樂器所需的頻譜細節。
AI 也能單獨擷取貝斯或鼓嗎?
可以。Demucs v4 與類似的四聲部模型可將一首歌一次分離為人聲、鼓、貝斯與「其他」。像 Bass Cyborg 與 Drum Cyborg 等專屬分軌工具則專注於單一聲部,並針對該目標微調模型。
準備好去除第一首歌的人聲了嗎?
若你想以最少摩擦取得乾淨的 AI 結果,Vocal Remover Cyborg 讓你每首歌從上傳到取得伴奏約需一分鐘。建立 AppsCyborg 帳戶——€6 一年,或 €30 一次付清享終身授權,涵蓋整套工具。
在做混音嗎?將 Vocal Remover Cyborg 產出的伴奏,搭配 Acapella Cyborg 產出的純人聲分軌;或以 Bass Cyborg 與 Drum Cyborg 將歌曲拆成各獨立音軌。同一個帳戶、同一個批次佇列、同一組雲端 GPU 幫你完成工作。
Wall E
AppsCyborg 創辦人
Wall E 撰寫所有與 AppsCyborg 相關的內容。身為創辦人與創作者,Wall E 對如何使用 AppsCyborg 有獨到的見解。