GitHub avatar

Fox's Blog

UTAU: How a Visual Basic 6 app democratized synthetic singing

How UTAU, a free VB6 app from 2008, let anyone create synthetic singing voices with concatenative synthesis -- and why it still matters today.

UTAU: how a Visual Basic 6 app democratized synthetic singing

I mentioned it on my main page: I love UTAU. Here's why.

Back in 2008, if you wanted to make a synthetic voice sing, you had one option: VOCALOID. Yamaha's software. Expensive, proprietary, with official voicebanks you couldn't create yourself.

Then some Japanese guy, Ameya/Ayame, dropped a thing he'd made in his corner. A piece of software coded in Visual Basic 6. Free. That let you create your own voice using... WAV files you recorded yourself.

This thing is called UTAU (歌う, "to sing" in Japanese). And for its time, it was magic.

I've always found this software fascinating. Not because it was technically clean (spoiler: actually yeah, you really had to be something else to make this thing -- it's a beautiful mess, I'm crying over this chicken), but because it did something nobody else did: it put voice synthesis in the hands of the public. Like you, me, anyone with a mic.

Let me explain why this was awesome.


First, why singing synthesis is a pain

A singing voice isn't just notes. You've got the consonant attack, the vowel sustain, the breath, the transitions between them. The "sa" in "salut" is an "s" that hisses then slides into an open "a", and it's that slide that makes it sound human or not.

These days you fix that with deep learning: train a model on hours of singing and it generates the voice (Synthesizer V, DiffSinger). But that's 2020+. In 2008, nothing.

UTAU uses the older, smarter method: concatenative synthesis.


Concatenative synthesis: copy-pasting voice bits together

The idea is dead simple: you record little chunks of voice and glue them together to form words. "hello" = sample "heh" + "low", chained together. A sound puzzle driven by a score.

It's the same principle as YouTube Poop where you cut up a character's words to make them say random stuff -- except here it's clean and automated.

And UTAU literally comes from that. Before it, there was "Jinriki Vocaloid" (人力ボーカロイド, "Manual Vocaloid"): people manually cut up vocal tracks, extracted phonemes, repitched them, and reassembled everything in an audio editor to mimic a VOCALOID voice. By hand. Imagine the work.

Ameya looked at that pain and coded the tool to automate it. Originally UTAU was just that: an assistant for Manual Vocaloid.


Why it was revolutionary: YOU create the voice

Here's the game-changer.

With VOCALOID, you bought a voice. Miku, Luka, etc. Made by pros, sold by Yamaha. No way to make one yourself. UTAU, anyone records their voice and turns it into a singing instrument.

CV mode (the simplest) is: you record the ~100 basic Japanese syllables ("a", "ka", "sa", "ta"...), configure the cut points, and there's your voicebank. A few hours of work.

Result: the ecosystem exploded. Thousands of community-created voicebanks -- fan voices, friends' voices, made-up characters. A whole universe of virtual singers, free. And the software came with Defoko (Utane Uta), a default voice generated via the AquesTalk TTS engine, so you could start even without a mic.


The oto.ini: the heart of the system

How does UTAU know where to cut and glue sounds? Through a config file per voicebank: oto.ini. For each WAV, it defines cut points (in milliseconds):

  • Offset → silence to remove at the start
  • Preutterance → the point where the consonant transitions to the vowel (the "s"→"a" boundary in "sa")
  • Overlap → how much the previous note overlaps with this one
  • Fixed region → the part that should NOT be stretched on a long note (typically the consonant)
  • Cutoff → where to cut the end

The preutterance is the smartest parameter. A syllable always has a bit of consonant before the vowel. For your note to land on the beat, the vowel needs to hit exactly, not the consonant. So UTAU shifts the sample backward: the "a" of "sa" lands on the beat, the "s" spills just before. Like a drummer who anticipates their hit so the sound lands on time -- except it's in a .ini.

Visually, on a "ka" sample, the oto.ini zones break down like this:

mermaid diagram

The boundary between consonant and vowel is the preutterance. The vowel is the zone you stretch for long notes; the consonant stays intact, otherwise your "k" would last two seconds and sound horrible.

# oto.ini (simplified)
# file=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

Five values per sound across all your samples, and UTAU assembles any word cleanly.


CV, VCV, CVVC: the realism race

The base mode, CV (Consonant-Vowel), is one sound per syllable. Simple but a bit robotic: syllable joints are crude.

In 2010 the community invented VCV (Vowel-Consonant-Vowel). Instead of recording "ka" alone, you record "a ka" -- with the tail of the previous vowel. The transition becomes natural because it's in the recording, not calculated afterward.

The spicy detail: VOCALOID didn't get VCV until VOCALOID3 in 2011. The VB6 freeware coded by one guy on his own beat Yamaha by a year on realistic transitions. A fan community faster than the multinational.

Then came CVVC, ARPAsing (English), VCCV... each method pushing realism further, all invented and documented by the community.


The full pipeline: how a word becomes sound

When you place a note and type lyrics, here's what happens behind the scenes:

mermaid diagram

The resampler is the centerpiece: it takes your "ka" sample recorded at a given pitch and stretches/repitches it to match the target note -- only stretching the stretchable zone while keeping the consonant intact (hence oto.ini).

And it's modular. UTAU came with a basic resampler, but the community made others (moresampler, TIPS...), each with its own sound signature. You swapped synthesis engines like a plugin. In 2008. On a freeware.


The mess under the hood (and why it's endearing)

Gotta be honest about the technical state of this thing:

  • Coded in Visual Basic 6. A language already dead in 2008. You need the VB6 runtime to run it.
  • Windows only originally (the Mac port, UTAU-Synth, came in 2011).
  • Shift-JIS encoding required. If your files aren't encoded in Japanese Shift-JIS, UTAU understands nothing. Even today you often need to set your PC to Japanese locale or use AppLocale to launch it.
  • Austere interface, documentation was almost 100% in Japanese back then.

And yet. Yet this thing created a worldwide movement. Tens of thousands of voicebanks. Songs listened to millions of times.

The best example: Kasane Teto. A character created in 2008 and dropped as an April Fools' prank, pretending to be a VOCALOID. It was a joke. Except people loved the character, a real UTAU voicebank was made for her, and Teto became one of the most famous virtual singers in the world. In 2023 she even got an official Synthesizer V voice. A character born from an April Fools' joke on free software.


Why it still matters

UTAU is the perfect example of a "poor" tech that wins through openness.

VOCALOID was technically superior, better funded, more pro. But closed. UTAU was janky, ugly, in VB6 -- but it let everyone participate. Create voices, create resamplers, create plugins, create recording methods. The community did the rest.

And the concept fully survives today. OpenUtau, a modern open-source successor, takes the idea and dusts it off (cross-platform, UTF-8, support for both modern resamplers AND AI). Concatenative synthesis still holds its own next to deep learning models, because it has something they don't: you understand exactly what's happening, and you control every millisecond.

That's what I've always loved about UTAU. You see exactly what's going on. It's not an AI spitting out some magical thing you don't understand: you've got your WAVs, your cut points, and you're the one who decides everything. When it sounds bad, you know why and you can fix it. I love that kind of control.


3 things to remember:

  1. Concatenative synthesis = voice puzzle -- UTAU glues little WAV samples together to form words. The oto.ini defines where to cut and glue each sound. You control everything, down to the millisecond, no black box.

  2. Openness beats technology -- VOCALOID was better but closed. UTAU was janky but let everyone create their own voices. The community blew up the ecosystem, and even beat Yamaha to VCV.

  3. A good idea outlives its code -- VB6, Shift-JIS, Windows only... and yet the concept still runs through OpenUtau. A great technology can be coded like absolute garbage.

Honestly, just for Kasane Teto born from an April Fools' joke, this software deserves respect xD

UTAU : comment un logiciel en Visual Basic 6 a démocratisé la voix synthétique

Comment UTAU, un logiciel gratuit en VB6 de 2008, a permis à tout le monde de créer des voix chantées par synthèse concaténative -- et pourquoi ça compte encore aujourd'hui.

UTAU : comment un logiciel en Visual Basic 6 a démocratisé la voix synthétique

J'en avais touché un mot sur ma page principale : j'aime UTAU. Voici pourquoi.

En 2008, si tu voulais faire chanter une voix synthétique, t'avais une option : VOCALOID. Le logiciel de Yamaha. Cher, propriétaire, avec des voix officielles que tu pouvais pas créer toi-même.

Et puis y'a un mec japonais, Ameya/Ayame, qui a sorti un truc dans son coin. Un logiciel codé en Visual Basic 6. Gratuit. Qui te laissait créer ta propre voix avec... des fichiers WAV que t'enregistrais toi-même.

Ce truc s'appelle UTAU (歌う, "chanter" en japonais). Et pour son époque, c'était de la magie.

J'ai toujours trouvé ce logiciel fascinant. Pas parce qu'il était propre techniquement (spoiler : en fait si, fallait vraiment y penser à créer ce truc d'encu... c'est un beau bordel, je pleure sur ce poulet), mais parce qu'il a fait un truc que personne d'autre faisait : il a donné la synthèse vocale au grand public. Genre toi, moi, n'importe qui avec un micro.

Laisse-moi t'expliquer pourquoi c'était génial.


D'abord, pourquoi la synthèse de chant c'est galère

Une voix chantée, c'est pas des notes. T'as la consonne qui attaque, la voyelle qui tient, le souffle, les transitions entre les deux. Le "sa" de "salut" c'est un "s" qui siffle qui glisse vers un "a" ouvert, et c'est ce glissement qui sonne humain ou pas.

Aujourd'hui on règle ça au deep learning : t'entraînes un modèle sur des heures de chant et il génère la voix (Synthesizer V, DiffSinger). Mais ça c'est 2020+. En 2008, que dalle.

UTAU utilise la méthode d'avant, plus vieille et plus maligne : la synthèse concaténative.


La synthèse concaténative : du copier-coller de bouts de voix

L'idée est bête comme chou : t'enregistres des petits bouts de voix et tu les colles ensemble pour former des mots. "salut" = échantillon "sa" + "lu" + "to", enchaînés. Un puzzle sonore piloté par une partition.

C'est le principe des YouTube Poop où on recoupe les mots d'un perso pour lui faire dire n'importe quoi -- sauf qu'ici c'est carré et automatisé.

Et UTAU vient littéralement de là. Avant lui existait le "Jinriki Vocaloid" (人力ボーカロイド, "Vocaloid manuel") : des gens découpaient à la main des pistes vocales, extrayaient les phonèmes, repitchaient, et réassemblaient le tout dans un éditeur audio pour imiter une voix VOCALOID. À la main. Tu imagines le taf.

Ameya a regardé cette galère et a codé l'outil pour l'automatiser. À la base UTAU était juste ça : un assistant pour Vocaloid manuel.


Pourquoi c'était révolutionnaire : TU crées la voix

Voilà le truc qui change tout.

VOCALOID, tu achetais une voix. Miku, Luka, etc. Créées par des pros, vendues par Yamaha. Pas moyen d'en faire une toi-même. UTAU, n'importe qui enregistre sa voix et en fait un instrument chantant.

Le mode CV (le plus simple) c'est : t'enregistres les ~100 syllabes de base du japonais ("a", "ka", "sa", "ta"...), tu configures les points de découpe, et voilà ta voicebank. Quelques heures de boulot.

Résultat : l'écosystème a explosé. Des milliers de voicebanks créées par la communauté -- voix de fans, de potes, de persos inventés. Un univers entier de chanteurs virtuels, gratuit. Et le logiciel venait avec Defoko (Utane Uta), une voix par défaut générée via le moteur TTS AquesTalk, donc tu pouvais commencer même sans micro.


Le oto.ini : le cœur du système

Comment UTAU sait où couper et coller les sons ? Via un fichier de config par voicebank : le oto.ini. Pour chaque WAV, il définit les points de découpe (en millisecondes) :

  • Offset → silence à virer au début
  • Preutterance → le point où la consonne passe à la voyelle (la frontière "s"→"a" dans "sa")
  • Overlap → combien la note précédente déborde sur celle-ci
  • Fixed region → la partie qui doit PAS être étirée sur une note longue (typiquement la consonne)
  • Cutoff → où couper la fin

La preutterance est le param le plus malin. Une syllabe a toujours un bout de consonne avant la voyelle. Pour que ta note tombe sur le temps, c'est la voyelle qui doit tomber pile, pas la consonne. Donc UTAU décale l'échantillon en arrière : le "a" de "sa" atterrit sur le temps, le "s" déborde juste avant. Comme un batteur qui anticipe sa frappe pour que le son tombe juste -- sauf que là c'est dans un .ini.

Visuellement, sur un échantillon "ka", les zones du oto.ini se découpent comme ça :

mermaid diagram

La frontière entre la consonne et la voyelle, c'est la preutterance. La voyelle est la zone qu'on étire pour les notes longues ; la consonne reste intacte, sinon ton "k" durerait deux secondes et sonnerait horrible.

# oto.ini (simplifié)
# fichier=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

Cinq valeurs par son, sur tous tes échantillons, et UTAU assemble n'importe quel mot proprement.


CV, VCV, CVVC : la course au réalisme

Le mode de base, CV (Consonne-Voyelle), c'est un son par syllabe. Simple mais un peu robotique : les jointures entre syllabes sont brutes.

En 2010 la communauté invente le VCV (Voyelle-Consonne-Voyelle). Au lieu d'enregistrer "ka" seul, tu enregistres "a ka" -- avec la queue de la voyelle précédente. La transition devient naturelle parce qu'elle est dans l'enregistrement, pas calculée après coup.

Le détail qui pique : VOCALOID a pas eu le VCV avant VOCALOID3, en 2011. Le freeware en VB6 codé par un type tout seul a devancé Yamaha d'un an sur le réalisme des transitions. Une communauté de fans plus rapide que la multinationale.

Ensuite sont venus le CVVC, l'ARPAsing (anglais), le VCCV... chaque méthode poussant le réalisme plus loin, toutes inventées et documentées par la communauté.


Le pipeline complet : comment un mot devient du son

Quand tu places une note et que tu tape une parole, voilà ce qui se passe en coulisses :

mermaid diagram

Le resampler est la pièce maîtresse : il prend ton échantillon "ka" enregistré à une hauteur donnée et le réétire/repitche pour matcher la note voulue -- en n'étirant que la zone étirable et en gardant la consonne intacte (d'où le oto.ini).

Et il est modulaire. UTAU venait avec un resampler de base, mais la communauté en a pondu d'autres (moresampler, TIPS...), chacun avec son grain sonore. Tu changeais de moteur de synthèse comme un plugin. En 2008. Sur un freeware.


Le bordel sous le capot (et pourquoi c'est attachant)

Faut être honnête sur l'état technique du bouzin :

  • Codé en Visual Basic 6. Un langage déjà mort en 2008. Faut le runtime VB6 pour le faire tourner.
  • Windows only à la base (le portage Mac, UTAU-Synth, est venu en 2011).
  • Encodage Shift-JIS obligatoire. Si tes fichiers sont pas encodés en Shift-JIS japonais, UTAU comprend rien. Encore aujourd'hui faut souvent mettre son PC en locale japonaise ou utiliser AppLocale pour le lancer.
  • Interface austère, documentation quasi 100% en japonais à l'époque.

Et pourtant. Pourtant ce truc a créé un mouvement mondial. Des dizaines de milliers de voicebanks. Des chansons écoutées des millions de fois.

Le meilleur exemple : Kasane Teto. Un personnage créé en 2008 et balancé comme un canular du 1er avril, en se faisant passer pour une VOCALOID. C'était une blague. Sauf que les gens ont adoré le personnage, une vraie voicebank UTAU a été créée derrière, et Teto est devenue une des chanteuses virtuelles les plus célèbres au monde. En 2023 elle a même eu droit à une voix Synthesizer V officielle. Un personnage né d'un poisson d'avril sur un logiciel gratuit.


Pourquoi ça compte encore

UTAU c'est l'exemple parfait d'une techno "pauvre" qui gagne par l'ouverture.

VOCALOID était techniquement supérieur, mieux financé, plus pro. Mais fermé. UTAU était bricolé, moche, en VB6 -- mais il laissait tout le monde participer. Créer des voix, créer des resamplers, créer des plugins, créer des méthodes d'enregistrement. La communauté a fait le reste.

Et le concept survit complètement aujourd'hui. OpenUtau, un successeur open-source moderne, reprend l'idée et la dépoussière (multi-plateforme, UTF-8, support des resamplers modernes ET de l'IA). La synthèse concaténative tient encore debout à côté des modèles deep learning, parce qu'elle a un truc qu'ils ont pas : tu comprends exactement ce qui se passe, et tu contrôles chaque milliseconde.

C'est ça qui m'a toujours plu dans UTAU. Tu vois exactement ce qui se passe. C'est pas une IA qui te crache un truc magique que tu comprends pas : t'as tes WAV, tes points de découpe, et c'est toi qui décides de tout. Quand ça sonne mal, tu sais pourquoi et tu peux corriger. J'aime ce genre de contrôle.


Les 3 trucs à retenir :

  1. Synthèse concaténative = puzzle de voix -- UTAU colle des petits échantillons WAV ensemble pour former des mots. Le oto.ini définit où couper et coller chaque son. Tu contrôles tout, à la milliseconde, sans boîte noire.

  2. L'ouverture bat la technique -- VOCALOID était meilleur mais fermé. UTAU était bricolé mais laissait tout le monde créer ses voix. La communauté a fait exploser l'écosystème, et a même devancé Yamaha sur le VCV.

  3. Une bonne idée survit à son code -- VB6, Shift-JIS, Windows only... et pourtant le concept tourne encore via OpenUtau. Une techno géniale peut être codée avec les pieds.

Honnêtement, rien que pour Kasane Teto née d'un poisson d'avril, ce logiciel mérite le respect xD

UTAU:一个VB6软件如何让人人都能玩合成音声

UTAU,一个2008年用VB6写的免费软件,如何通过拼接合成让人人都能创建合成歌声----以及它为什么今天仍然重要。

UTAU:一个VB6软件如何让人人都能玩合成音声

我在主页提过一嘴:我喜欢UTAU。这会儿来展开说说。

2008年,你想让合成声音唱歌,只有一个选择:VOCALOID。Yamaha家的。贵,闭源,官方声库你没法自己造。

然后有个日本老哥,Ameya/Ayame,自己捣鼓了个东西出来。用 Visual Basic 6 写的。免费。让你拿自己录的 WAV 文件就能做自己的声库。

这玩意儿叫 UTAU(歌う,日语"唱歌"的意思)。在那个年代,这就是魔法。

我一直觉得这软件特屌。不是因为技术多优雅(剧透:其实一点都不优雅,你能想象这玩意的屎山代码吗……我对着这只鸡哭),而是因为它做到了一件没人做到的事:把语音合成交给了大众。就是你,我,随便谁有个麦克风就行。

让我给你讲讲为什么这玩意儿那么牛逼。


先说为啥唱歌合成这么难

人声唱歌不是单纯音符。有辅音起头,元音保持,气息,还有两者之间的过渡。"sa"这个音,是嘶嘶的"s"滑向张开的"a",这个滑动过程才是听起来像人的关键。

现在用深度学习搞定:训一个模型在几小时的歌声上,它就能生成声音(Synthesizer V、DiffSinger)。但那都是2020年以后的事了。2008年?想都别想。

UTAU用的是一种更老、更聪明的方法:拼接合成。


拼接合成:把声音碎片拼起来

思路简单到爆:录一堆声音小片段,然后像拼图一样拼起来组成单词。"salut" = 拼上"sa" + "lu" + "to" 三段样本。一个由乐谱操控的声音拼图。

就跟YouTube Poop里剪角色台词让他乱说话的原理一样----只不过这里是规整的、自动化的。

UTAU的来历其实就是这个。之前有 "人力VOCALOID"(人力ボーカロイド):人们手动剪音频轨,提取音素,调音高,再在音频编辑器里重新组装,模仿VOCALOID的声音。全手动。你想想这工作量。

Ameya看不下去了,写了工具来自动化这过程。UTAU最初也就是个辅助人力VOCALOID的工具。


为啥这革命性:你来创造声音

这才是关键。

VOCALOID,你买的是别人的声音。Miku、Luka什么的。专业团队做、Yamaha卖。自己造不了。UTAU呢,谁都能录自己的声音,做成会唱歌的乐器。

最简单的CV模式就是:录日语的基本音节("a"、"ka"、"sa"、"ta"……大概100个),设好切割点,搞定你的声库。几个小时的事。

结果:生态爆炸。社区做了成千上万个声库----粉丝的声音、朋友的声音、原创角色的声音。一整个虚拟歌手宇宙,免费。而且软件自带 Defoko(Utane Uta),一个通过AquesTalk TTS引擎生成的默认音源,没麦克风也能直接开搞。


oto.ini:系统的核心

UTAU怎么知道在哪切、在哪拼?靠每个声库的配置文件:oto.ini。每个WAV文件定义切割点(毫秒级):

  • Offset → 去掉开头静音
  • Preutterance → 辅音过渡到元音的点("sa"里"s"→"a"的分界)
  • Overlap → 前一个音符在多长时间内与当前重叠
  • Fixed region → 长音时不能拉伸的部分(通常就是辅音)
  • Cutoff → 末尾切掉的地方

Preutterance 是最聪明的参数。每个音节在元音前总有一段辅音。要让音符卡对拍子,应该是元音落在拍子上,不是辅音。所以UTAU把样本往前推:"sa"的"a"落在拍上,"s"在前面溢出。就像鼓手提前挥棒让声音正好落在点上----只不过这里写在 .ini 里。

视觉上,以"ka"样本为例,oto.ini 的区域是这样的:

mermaid diagram

辅音和元音之间的分界就是preutterance。元音部分用来拉伸(长音时延长);辅音保持原样,不然你的"k"拖两秒会难听得要命。

# oto.ini (simplifié)
# fichier=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

每个音设五个值,所有样本配好,UTAU就能把任何单词拼得漂漂亮亮。


CV、VCV、CVVC:追求更真实

基础模式 CV(辅音-元音)一个音节一个音。简单但有点机械感:音节之间的拼接生硬。

2010年社区发明了 VCV(元音-辅音-元音)。不录单独的"ka",而是录"a ka"----带上前面元音的尾巴。过渡自然而然,因为过渡就在录音里,不是事后算出来的。

细思极恐:VOCALOID到VOCALOID3(2011年)才有VCV。 一个老哥用VB6写的免费软件在过渡自然度上领先了Yamaha一年。粉丝社区跑到了跨国公司前面。

后来还有 CVVC、ARPAsing(英语)、VCCV……每种方法都推动合成更真实一步,全由社区发明和记录。


完整流程:一个词如何变成声音

你放个音符输段歌词,幕后是这样的:

mermaid diagram

Resampler 是核心:它把你录的"ka"样本(原始音高)重新拉伸/调音以匹配想要的音符----只拉伸可拉伸的区域,辅音保持原样(这就是 oto.ini 的用处)。

而且它是模块化的。UTAU自带一个基础resampler,但社区搞出了一堆别的(moresampler、TIPS……),每个音色不同。你像换插件一样换合成引擎。2008年。一个免费软件。


引擎盖下的屎山(以及为什么反而可爱)

得说实话,这软件的技术状况:

  • 用Visual Basic 6写的。 2008年这语言就已经死了。需要VB6运行时才能跑。
  • 最初只有Windows版(Mac移植版UTAU-Synth 2011年才出)。
  • 必须Shift-JIS编码。 如果文件不是日文Shift-JIS编码,UTAU什么都读不懂。到现在还经常要切系统区域到日文或者用AppLocale才能启动。
  • 界面简陋,文档当时几乎全是日文。

然而。然而这玩意儿搞出了一个全球性运动。几万个声库。数百万播放量的歌。

最好的例子:Kasane Teto。2008年作为愚人节玩笑被推出来,假装是VOCALOID。就是个梗。结果大家爱上了这个角色,之后做了真正的UTAU声库,Teto成了全世界最有名的虚拟歌手之一。2023年她甚至出了官方Synthesizer V声库。一个诞生于免费软件愚人节玩笑的角色。


为什么现在还有意义

UTAU是"简陋"技术靠开放性取胜的完美例子。

VOCALOID技术更好,资金更足,更专业。但封闭。UTAU是个粗制滥造的破烂VB6玩意儿----但它允许所有人参与。创造声音、创造resampler、创造插件、创造录音方法。社区承担了剩下的一切。

这个理念到今天还活得很好。OpenUtau,一个现代开源接棒者,继承了UTAU的理念并做了现代化改造(跨平台、UTF-8、支持现代resampler和AI)。拼接合成在深度学习的时代依然站得住脚,因为它有一个深度学习没有的东西:你完全知道背后发生了什么,你能控制每一毫秒。

这就是我一直喜欢UTAU的原因。你清楚看到一切。不是AI给你吐个你不懂的魔法结果:你有你的WAV,你的切割点,你决定一切。听上去不对,你知道为什么并能修正。我喜欢这种掌控感。


记住3点:

  1. 拼接合成 = 声音拼图 ---- UTAU把WAV小片段拼在一起组成单词。oto.ini 定义每个音的切和拼的位置。你控制一切,精确到毫秒,没有黑盒。
  2. 开放性打败技术 ---- VOCALOID更好但封闭。UTAU很糙但让所有人能创造自己的声音。社区引爆了生态,甚至比Yamaha还先做出了VCV。
  3. 好想法比烂代码活得久 ---- VB6、Shift-JIS、Windows only……但理念通过OpenUtau依然在跑。一个牛逼的技术可以用稀烂的代码写出来。

说真的,就冲Kasane Teto诞生于一个愚人节玩笑,这软件就值得尊敬 xD

UTAU:Visual Basic 6で作られたソフトがどうやって合成音声を民主化したか

2008年にVB6で書かれたフリーソフトUTAUが、どうやって誰でも合成歌声を作れるようにしたか----そして今でもなぜ重要なのか。

UTAU : Visual Basic 6で作られたソフトがどうやって合成音声を民主化したか

メインページでもちょっと触れたんだけどさ:UTAUが好きなんだよね。その理由を話すよ。

2008年、もし合成音声に歌わせたかったら、選択肢は一つしかなかった:VOCALOID。Yamahaのソフト。高価で、プロプライエタリで、自分では作れない公式ボイスしかなかった。

そこに現れた日本人、Ameya/Ayameが趣味で作ったツール。Visual Basic 6で書かれたソフト。無料。自分で録音したWAVファイルでオリジナルの声を作れたんだ。

そのツールの名はUTAU(歌う)。当時としては、まさに魔法だった。

ずっとこのソフトに魅了されてきた。技術的に綺麗だからじゃない(いや実際、こんなものをVB6で作ろうって考えたやつの頭は...めちゃくちゃだよ、泣けるわ)。でもそれ以上に、他に誰もやってなかったことをやったから:音声合成を一般に開放したんだ。そう、君も、私も、マイクを持ってる人なら誰でも。

なんでそれがすごかったか、説明するよ。


まず、なぜ歌唱合成が難しいのか

歌う声って、ただの音符じゃないんだ。子音の立ち上がり、母音の持続、息遣い、その間の遷移。例えば「さ」の「s」は息が漏れて「a」に滑っていく、その滑らかさが人間らしく聞こえるかどうかを決める。

今ならディープラーニングで解決する:何時間もの歌唱データでモデルを学習させて声を生成する(Synthesizer V、DiffSinger)。でもそれは2020年代以降の話。2008年にはそんなものはなかった。

UTAUはもっと古くて賢い方法を使ってる:連結合成だ。


連結合成:声の断片をコピペする

アイデアは超シンプル:声の小片を録音して、それをつなげて単語にする。「さとう」=「さ」+「と」+「う」のサンプルを連結する。楽譜で制御される音声パズル。

YouTube Poopでキャラの言葉を切り貼りして好き勝手言わせるのと同じ原理――ただこっちはちゃんと体系化されてて自動化されてる。

そしてUTAUはまさにそこから生まれた。その前には人力ボーカロイドがあった:人が手動で音声トラックを切り分け、音素を抽出し、ピッチを変え、オーディオエディタで再構築してVOCALOIDっぽい声を作ってた。手作業で。想像してみてよ、その労力を。

Ameyaはその面倒くささを見て、自動化するツールを作った。元々UTAUはただの人力ボーカロイド支援ツールだったんだ。


なぜ革命的だったか:君が声を作れる

ここが一番のポイント。

VOCALOIDでは声を買ってた。ミクとかルカとか。プロが作ってYamahaが売ってた。自分で作るなんてできなかった。UTAUなら、誰でも自分の声を録音して歌う楽器にできる。

一番シンプルなCVモードなら:日本語の基本音節〜100個(「あ」「か」「さ」「た」…)を録音して、カットポイントを設定すれば、はい完成、自分のvoicebank。数時間の作業で。

結果:エコシステムが爆発的に広がった。コミュニティによって何千ものvoicebankが作られた――ファンの声、友達の声、創作キャラの声。無料の仮想歌手の宇宙が広がった。しかもソフトにはDefoko(Utane Uta)っていうデフォルト音声が付属してて、AquesTalk TTSエンジンで生成されてたから、マイクがなくてもすぐ始められた。


oto.ini:システムの心臓部

UTAUはどうやって音の切り貼り位置を知るのか? voicebankごとの設定ファイル、**oto.ini**がその答えだ。WAVごとにカットポイント(ミリ秒単位)が定義されてる:

  • Offset → 最初の無音部分を除去
  • Preutterance → 子音から母音に変わるポイント(「か」の「k」→「a」の境界)
  • Overlap → 前のノートがどれだけ次のノートに被さるか
  • Fixed region → 長い音符でも伸ばしてはいけない部分(典型的には子音)
  • Cutoff → 終わりのカット位置

Preutteranceが一番賢いパラメータ。音節には常に母音の前に子音の一部が入る。音符を正確なタイミングで鳴らすには、母音が拍に合わないといけない。だからUTAUはサンプルを前にずらす:「か」の「a」が拍に乗り、「k」はその直前にはみ出す。ドラマーがスティックを振り下ろすタイミングを計算して正確な拍に音を合わせるのと同じ――ただそれが.iniファイルの中で行われてる。

視覚的に「か」のサンプルで見ると、oto.iniの各ゾーンはこんな感じ:

mermaid diagram

子音と母音の境界がpreutterance。母音は長い音符で伸ばす領域。子音はそのまま――「k」が2秒も続いたら気持ち悪いからね。

# oto.ini (簡略化)
# ファイル=エイリアス,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

音ごとに5つの値、全サンプルに設定すれば、UTAUがどんな単語でもちゃんと組み立ててくれる。


CV、VCV、CVVC:リアリズムへの道

基本モードのCV(子音-母音)は、音節ごとに一つの音。シンプルだけどちょっとロボットっぽい:音節同士の継ぎ目が粗い。

2010年、コミュニティがVCV(母音-子音-母音)を発明した。「か」だけ録音するんじゃなくて「あか」って録音する――前の母音の余韻も含めて。遷移が自然になるのは、それが録音内に含まれていて、後から計算されたものじゃないから。

ここがすごい:VOCALOIDはVOCALOID3が出る2011年までVCVに対応してなかった。 一人のやつがVB6で書いたフリーウェアが、トランジションのリアリズムでYamahaを1年も先越したんだ。多国籍企業より速かったファンコミュニティ。

その後もCVVC、ARPAsing(英語)、VCCV…と次々に方式が生まれ、どんどんリアルになっていった。全部コミュニティが発明して文書化した。


完全な処理パイプライン:単語がどうやって音声になるか

ノートを置いて歌詞を打ち込んだ時、裏側ではこうなってる:

mermaid diagram

Resamplerが要だ:録音された「か」のサンプルを、目的のノートに合わせて引き伸ばし/ピッチ変更する――伸ばせる領域だけ伸ばして、子音はそのままにする(ここでoto.iniが活きる)。

しかもモジュール式。UTAUには基本のresamplerが付属してたけど、コミュニティが独自のもの(moresampler、TIPS…)を次々に作って、それぞれ違う音質だった。合成エンジンをプラグインみたいに差し替えられたんだ。2008年に。フリーウェアで。


ボロボロな内部構造(でもそれが愛おしい)

正直に言おう、このソフトの技術的状態は:

  • Visual Basic 6で書かれてる。 2008年時点ですでに死んでた言語。動かすのにVB6ランタイムが必要。
  • 元々Windows only(Mac移植のUTAU-Synthは2011年)。
  • Shift-JISエンコーディング必須。 ファイルがShift-JISじゃないとUTAUは読めない。今でもよくPCのロケールを日本にするかAppLocaleを使わないと起動しない。
  • 地味なインターフェース、当時はドキュメントがほぼ全部日本語。

それでも。それでもこのソフトは世界的なムーブメントを生んだ。何万ものvoicebank。何百万回も聴かれた曲。

最高の例:重音テト。2008年にエイプリルフールのネタとして作られたキャラで、VOCALOIDの偽物として発表された。冗談だった。ところがみんながキャラを気に入って、ちゃんとしたUTAU voicebankが作られ、テトは世界で一番有名な仮想歌手の一人になった。2023年には公式のSynthesizer V音声まで出た。フリーウェアのエイプリルフールネタから生まれたキャラが。


なんで今でも重要なのか

UTAUは「貧弱」なテクノロジーがオープンさで勝つ完璧な例だ。

VOCALOIDは技術的に優れてて、資金もあって、プロフェッショナルだった。でも閉じてた。UTAUは即席で、ダサくて、VB6だった――でも誰でも参加できた。声を作れた。resamplerを作れた。プラグインを作れた。録音方法を開発できた。コミュニティが残りをやった。

そしてそのコンセプトは今でも完全に生きてる。OpenUtauっていうモダンなオープンソースの後継がアイデアを引き継いで、現代風に刷新してる(クロスプラットフォーム、UTF-8、モダンなresamplerとAIの両対応)。連結合成はディープラーニングモデルの隣でもまだ戦えてる。なぜなら、AIにはないものがあるから:何が起きてるか正確に理解できて、ミリ秒単位でコントロールできる。

それがUTAUのいつも好きなところ。何が起きてるか全部見える。わけわかんないAIが魔法みたいに出力するんじゃなくて:自分のWAVがあって、カットポイントがあって、全部自分で決める。音が変だったら理由がわかるし、直せる。そういうコントロールが好きなんだ。


覚えておくべき3つのこと:

  1. 連結合成 = 声のパズル -- UTAUは小さなWAVサンプルを貼り合わせて単語を作る。oto.iniが各音のカット&ペースト位置を定義する。全部ミリ秒単位でコントロールできて、ブラックボックスなし。
  2. オープンさが技術に勝つ -- VOCALOIDは優れてたけど閉じてた。UTAUは即席だったけど誰でも自分の声を作れた。コミュニティがエコシステムを爆発的に広げ、VCVではYamahaを先取りした。
  3. いいアイデアはコードの質を超えて生き残る -- VB6、Shift-JIS、Windows only…それでもコンセプトはOpenUtauで今も動いてる。素晴らしい技術は、クソコードでも作れるんだよ。

正直、エイプリルフールから生まれた重音テトがいるだけで、このソフトは尊敬に値するんだよね xD

UTAU: Visual Basic 6으로 만든 프로그램이 어떻게 합성음을 대중화했는가

2008년 VB6으로 만들어진 무료 프로그램 UTAU가 어떻게 ⁉이나 합성 노래 목소리를 만들 수 있게 했는지 -- 그리고 오늘날에도 여전히 중요한 이유.

UTAU : Visual Basic 6으로 만든 프로그램이 어떻게 합성음을 대중화했는가

내 메인 페이지에서 한마디 했었는데: 나는 UTAU를 좋아해. 이유를 설명해줄게.

2008년에 합성 목소리로 노래를 시키고 싶었다면 선택지는 하나였어: VOCALOID. 야마하의 소프트웨어. 비싸고, 폐쇄적이고, 직접 만들 수 없는 공식 음성들만 있었지.

그런데 일본인 아메야/아야메라는 사람이 자기 혼자서 뭔가를 만들어냈어. Visual Basic 6으로 코딩된 프로그램. 공짜. 직접 녹음한 WAV 파일로... 자신만의 목소리를 만들 수 있게 해주는 프로그램.

이 프로그램 이름은 UTAU(일본어로 '노래하다'). 그리고 그 시대 기준으로는, 마법이나 다름없었어.

난 항상 이 프로그램이 매력적이라고 생각했어. 기술적으로 깔끔해서가 아니라(스포일러: 사실 아니야, 이걸 만들었다니 진짜 대단한 놈이야... 개판 그 자체야, 이 닭새끼야 ㅠㅠ), 다른 누구도 하지 않은 일을 했기 때문이야: 음성 합성을 일반 대중에게 넘겨줬어. 너, 나, 마이크 하나만 있는 사람이라면 누구나.

왜 대단했는지 설명해줄게.


먼저, 왜 노래 합성이 어려운가

노래하는 목소리는 그냥 음표가 아니야. 자음이 터지고, 모음이 유지되고, 숨소리, 그 사이의 전환들이 있지. 'salut'의 'sa'는 치찰음 's'가 열린 'a'로 미끄러지는 거고, 이 미끄러짐이 인간적으로 들리느냐 마느냐를 결정해.

요즘은 딥러닝으로 해결하지: 수시간의 노래 데이터로 모델을 학습시키면 목소리를 생성해줘(Synthesizer V, DiffSinger). 하지만 그건 2020년 이후의 이야기. 2008년에는, 그런 거 없었어.

UTAU는 예전 방식, 더 오래되고 더 영리한 방법을 사용해: 연쇄 합성(concaténative synthesis).


연쇄 합성: 목소리 조각들을 복붙하기

아이디어는 겁나 단순해: 작은 목소리 조각들을 녹음해서 붙이면 단어가 되는 거야. 'salut' = 'sa' 샘플 + 'lu' + 'to'를 연결. 악보로 조종하는 소리 퍼즐.

유튜브 풉(YouTube Poop)에서 캐릭터 말을 잘라서 이상한 소리를 하게 만드는 원리랑 같아 -- 여기서는 체계적이고 자동화되어 있다는 차이만 있지.

그리고 UTAU는 말 그대로 여기서 나왔어. 그 전에는 **'진리키 보카로이드'(Jinriki Vocaloid, 人力ボーカロイド)**가 있었지: 사람들이 수작업으로 음성 트랙을 잘라내고, 음소를 추출하고, 피치를 바꾸고, 오디오 에디터에서 다시 조립해서 VOCALOID 목소리를 흉내냈어. 수작업으로. 얼마나 노가다인지 상상이 가?

아메야는 이 노가다를 보고 자동화하는 도구를 만들었어. 기본적으로 UTAU는 그냥 그거였어: 수동 보카로이드를 위한 도우미.


왜 혁명적이었는가: 네가 목소리를 만든다

이게 모든 걸 바꾸는 포인트야.

VOCALOID는 목소리를 샀어. 미쿠, 루카 등등. 프로들이 만들고 야마하가 팔았지. 직접 만들 방법은 없었어. UTAU는 누구나 자기 목소리를 녹음해서 노래하는 악기로 만들 수 있어.

CV 모드(가장 쉬운 방식)는 이래: 일본어 기본 음절 ~100개("a", "ka", "sa", "ta"...)를 녹음하고, 잘라낼 지점을 설정하면, 네 voicebank 완성. 몇 시간 작업이면 돼.

결과: 생태계가 폭발했어. 커뮤니티가 수천 개의 voicebank를 만들었지 -- 팬들의 목소리, 친구들 목소리, 가상 캐릭터 목소리. 완전한 가상 가수 우주가 공짜로. 게다가 프로그램에는 Defoko(Utane Uta)라는 기본 음성이 AquesTalk TTS 엔진으로 생성되어 포함되어 있어서, 마이크 없이도 시작할 수 있었어.


oto.ini: 시스템의 핵심

UTAU는 어떻게 소리를 어디서 자르고 붙일지 알까? voicebank마다 있는 설정 파일, oto.ini 덕분이야. 각 WAV 파일마다 다음 기준으로 잘라낼 지점(밀리초)을 정의해:

  • Offset → 시작 부분의 묵음 제거
  • Preutterance → 자음에서 모음으로 전환되는 지점("sa"에서 "s"→"a" 경계)
  • Overlap → 앞 음표가 현재 음표에 얼마나 겹칠지
  • Fixed region → 긴 음표에서 늘리면 안 되는 부분(보통 자음)
  • Cutoff → 끝을 자를 위치

Preutterance가 가장 영리한 파라미터야. 음절은 항상 모음 앞에 자음 조각이 있어. 음표를 박자에 맞추려면 자음이 아니라 모음이 정확히 떨어져야 해. 그래서 UTAU는 샘플을 뒤로 밀어: 'sa'의 'a'가 박자에 맞춰 떨어지고, 's'는 그 직전에 살짝 나와. 드러머가 소리가 정확히 맞도록 스트로크를 예측하는 것처럼 -- 근데 이건 .ini 파일에서 한다는 차이만 있지.

시각적으로 "ka" 샘플에서 oto.ini 영역은 이렇게 나뉘어:

mermaid diagram

자음과 모음 사이의 경계가 preutterance야. 모음은 긴 음표에서 늘리는 영역이고; 자음은 그대로 유지되지, 안 그러면 'k'가 2초 동안 지속되는 끔찍한 소리가 나겠지.

# oto.ini (simplifié)
# fichier=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

모든 샘플에 대해 소리당 다섯 개의 값만 있으면, UTAU가 어떤 단어든 깔끔하게 조립해.


CV, VCV, CVVC: 사실감을 향한 경쟁

기본 모드인 CV(자음-모음)는 음절당 하나의 소리야. 간단하지만 약간 로봇틱해: 음절 사이의 연결이 투박하지.

2010년에 커뮤니티가 VCV(모음-자음-모음)를 발명해. 'ka'만 녹음하는 대신 'a ka'를 녹음하는 거야 -- 앞 모음의 꼬리까지 포함해서. 전환이 자연스러워지는 이유는 그게 녹음 안에 담겨 있기 때문이지, 나중에 계산하는 게 아니야.

더 빡치는 점: VOCALOID는 2011년 VOCALOID3가 나오기 전까지 VCV가 없었어. 혼자서 VB6으로 짠 프리웨어가 전환음의 사실감에서 야마하를 1년이나 앞질렀다고. 팬 커뮤니티가 다국적 기업보다 더 빨랐던 거지.

그 다음엔 CVVC, ARPAsing(영어), VCCV가 나왔어... 각 방식은 사실감을 더 끌어올렸고, 모두 커뮤니티가 발명하고 문서화했지.


전체 파이프라인: 단어가 어떻게 소리가 되는가

음표를 찍고 가사를 입력하면, 뒤에서 이런 일이 일어나:

mermaid diagram

Resampler가 핵심이야: 특정 높이로 녹음된 'ka' 샘플을 가져와서 원하는 음표에 맞게 늘이고 피치를 조정하지 -- 늘릴 수 있는 영역만 늘리고 자음은 그대로 유지하면서(oto.ini가 필요한 이유).

게다가 모듈식이야. UTAU는 기본 resampler를 포함하고 있었지만, 커뮤니티가 다른 것들(moresampler, TIPS...)을 만들어냈어, 각자 자신만의 음색을 가지고. 합성 엔진을 플러그인처럼 갈아끼울 수 있었어. 2008년에. 프리웨어에서.


후드 속은 개판 (그런데도 왜 사랑스러운지)

이 물건의 기술적 상태에 대해 솔직해지자:

  • Visual Basic 6으로 코딩됨. 2008년에도 이미 죽은 언어였어. 실행하려면 VB6 런타임이 필요해.
  • 기본적으로 Windows 전용(Mac 포팅인 UTAU-Synth는 2011년에 나옴).
  • Shift-JIS 인코딩 강제. 파일이 일본어 Shift-JIS로 인코딩되어 있지 않으면 UTAU가 이해를 못 해. 지금도 종종 PC 로케일을 일본어로 바꾸거나 AppLocale을 써서 실행해야 해.
  • 투박한 인터페이스, 당시 문서는 거의 100% 일본어.

그런데도. 그래도 이 물건은 전 세계적인 운동을 만들어냈어. 수만 개의 voicebank. 수백만 번 재생된 노래들.

최고의 예시: 카사네 테토(Kasane Teto). 2008년에 만우절 장난으로 만들어진 캐릭터로, VOCALOID인 척했어. 그냥 농담이었어. 그런데 사람들이 캐릭터를 엄청 좋아했고, 진짜 UTAU voicebank가 만들어졌으며, 테토는 가장 유명한 가상 가수 중 하나가 되었어. 2023년에는 공식 Synthesizer V 음성까지 받았지. 공짜 프로그램 위에서 만우절에서 태어난 캐릭터.


아직도 의미가 있는 이유

UTAU는 '가난한' 기술이 개방성으로 승리한 완벽한 예시야.

VOCALOID는 기술적으로 우월했고, 자금도 더 많았고, 더 프로였다. 하지만 폐쇄적이었어. UTAU는 땜빵투성이에, 못생겼고, VB6였지만 -- 모두가 참여할 수 있게 했어. 목소리를 만들고, resampler를 만들고, 플러그인을 만들고, 녹음 방식을 만들고. 나머지는 커뮤니티가 해냈어.

그리고 이 개념은 오늘날에도 완전히 살아있어. OpenUtau, 현대적인 오픈소스 후계자가 그 아이디어를 이어받아 새롭게 단장했어(멀티플랫폼, UTF-8, 최신 resampler 및 AI 지원). 연쇄 합성은 딥러닝 모델 옆에서도 여전히 건재해, 왜냐하면 딥러닝에 없는 게 있거든: 무슨 일이 일어나는지 정확히 이해할 수 있고, 모든 밀리초를 제어할 수 있어.

이게 내가 UTAU에서 항상 좋아했던 점이야. 무슨 일이 일어나는지 정확히 볼 수 있어. 이해할 수 없는 마법 같은 걸 AI가 뱉어내는 게 아니야: 네 WAV 파일, 네 잘라낼 지점, 그리고 모든 걸 네가 결정해. 소리가 안 좋으면 이유를 알고 고칠 수 있어. 나는 이런 통제권을 좋아해.


기억할 3가지:

  1. 연쇄 합성 = 목소리 퍼즐 -- UTAU는 작은 WAV 샘플들을 붙여서 단어를 만들어. oto.ini가 각 소리를 어디서 자르고 붙일지 정의해. 블랙박스 없이 모든 걸 밀리초 단위로 제어할 수 있어.

  2. 개방성이 기술을 이긴다 -- VOCALOID는 더 좋았지만 폐쇄적이었어. UTAU는 땜빵이었지만 모두가 자신의 목소리를 만들 수 있게 했지. 커뮤니티가 생태계를 폭발시켰고, VCV에서 야마하를 앞지르기도 했어.

  3. 좋은 아이디어는 코드보다 오래간다 -- VB6, Shift-JIS, Windows 전용... 그래도 개념은 OpenUtau를 통해 여전히 돌아가고 있어. 대단한 기술은 발로 코딩될 수도 있어.

솔직히, 만우절에서 태어난 카사네 테토 하나만으로도 이 프로그램은 존경받을 자격이 있어 xD

UTAU: Visual Basic 6 ile yazılmış bir yazılım sentetik sesi nasıl demokratikleştirdi

2008'de VB6 ile yazılmış ücretsiz bir yazılım olan UTAU, birleştirmeli sentez kullanarak herkesin sentetik şarkı sesi oluşturmasını nasıl sağladı -- ve bugün hala neden önemli.

UTAU : Visual Basic 6 ile yazılmış bir yazılım sentetik sesi nasıl demokratikleştirdi

Ana sayfamda biraz bahsetmiştim : UTAU'yu severim. İşte nedeni.

2008'de sentetik bir sesi şarkı söyletmek istiyosan tek seçeneğin vardı : VOCALOID. Yamaha'nın yazılımı. Pahalı, kapalı, kendi başına oluşturamayacağın resmi seslerle dolu.

Sonra Japon bir eleman, Ameya/Ayame, kendi köşesinde bi' şey çıkardı. Visual Basic 6 ile kodlanmış bir yazılım. Bedava. Kendi sesini yaratmanı sağlıyordu... kendi kaydettiğin WAV dosyalarıyla.

Bu şeyin adı UTAU (歌う, Japonca "şarkı söylemek"). Ve zamanına göre resmen büyüydü.

Bu yazılımı hep büyüleyici bulmuşumdur. Teknik olarak temiz olduğu için değil (spoiler : aslında bu şeyi yaratmayı düşünmek bile ayrı bi' olay... tam bir karmaşa, bu tavuğa ağlıyorum), başka kimsenin yapmadığı bi' şey yaptığı için : ses sentezini herkese açtı. Yani sen, ben, mikrofonu olan herhangi biri.

Neden harika olduğunu anlatayım.


Öncelikle, şarkı söyleme sentezi neden zordur

Şarkı söyleyen bir ses, notalardan ibaret değildir. İçinde ünsüzün saldırısı, ünlünün tutunması, nefes, ikisi arasındaki geçişler var. "Merhaba"daki "me" bir "m" sesinin "e" açıklığına kaymasıdır ve bu kayma sesi insani yapan ya da yapmayan şeydir.

Bugün bunu deep learning ile çözüyoruz : saatlerce şarkı üzerinde bir model eğitiyorsun ve sesi üretiyor (Synthesizer V, DiffSinger). Ama bu 2020+ işi. 2008'de, yoktu.

UTAU daha eski ve daha kurnaz bir yöntem kullanır : birleştirmeli sentez (concatenative synthesis).


Birleştirmeli sentez : ses parçalarını kopyala-yapıştır

Fikir çok basit : küçük ses parçaları kaydediyorsun ve bunları birleştirip kelimeler oluşturuyorsun. "merhaba" = "me" örneği + "rha" + "ba", art arda dizilmiş. Bir notasyonla yönetilen ses yapbozu.

Bu, YouTube Poop'lardaki karakterin sözlerini kesip biçip saçma şeyler söyletme mantığıyla aynı -- sadece burada iş düzenli ve otomatik.

Ve UTAU tam da buradan geliyor. Öncesinde "Jinriki Vocaloid" (人力ボーカロイド, "Elle Vocaloid") vardı : insanlar elle ses parçalarını kesiyor, fonemleri çıkarıyor, perdeyi değiştiriyor ve bir ses düzenleyicide hepsini tekrar birleştirip VOCALOID sesini taklit ediyordu. Elle. Düşün işin zorluğunu.

Ameya bu çileyi gördü ve otomatize edecek aracı kodladı. Aslında UTAU başta sadece buydu : elle Vocaloid için bir yardımcı.


Neden devrimseldi : SESİ SEN yaratıyorsun

İşte her şeyi değiştiren şey.

VOCALOID'de bir ses satın alıyordun. Miku, Luka, falan. Profesyonellerce yapılmış, Yamaha tarafından satılmış. Kendin yapman mümkün değildi. UTAU'da herkes kendi sesini kaydedip onu şarkı söyleyen bir enstrümana dönüştürebilir.

CV modu (en basiti) şu : Japoncadaki ~100 temel heceyi kaydediyorsun ("a", "ka", "sa", "ta"...), kesme noktalarını ayarlıyorsun ve işte voicebank'ın. Birkaç saatlik iş.

Sonuç : ekosistem patladı. Topluluk tarafından yaratılmış binlerce voicebank -- hayran sesleri, arkadaş sesleri, uydurma karakterler. Kocaman bir sanal şarkıcı evreni, bedava. Ve yazılım Defoko (Utane Uta) ile geliyordu, AquesTalk TTS motoruyla üretilen varsayılan bir ses, yani mikrofonsuz bile başlayabilirdin.


oto.ini : sistemin kalbi

UTAU sesleri nerede keseceğini ve yapıştıracağını nasıl biliyor? Voicebank başına bir yapılandırma dosyasıyla : oto.ini. Her WAV için kesme noktalarını (milisaniye cinsinden) tanımlar :

  • Offset → baştaki sessizliği atmak için
  • Preutterance → ünsüzün ünlüye geçtiği nokta ("ka"daki "k"→"a" sınırı)
  • Overlap → önceki notanın buna ne kadar taştığı
  • Fixed region → uzun notalarda UZATILMAMASI gereken kısım (genelde ünsüz)
  • Cutoff → sonun nerede kesileceği

Preutterance en akıllı parametre. Bir hecenin ünlüden önce her zaman bir parça ünsüzü vardır. Notanın zamanında çalması için, tam vuracak olan ünlü olmalı, ünsüz değil. Bu yüzden UTAU örneği geriye kaydırır : "ka"daki "a" tam zamanında düşer, "k" hemen öncesine taşar. Bir davulcunun vuruşunu öne çekmesi gibi -- sadece bu bir .ini dosyasında.

Görsel olarak, bir "ka" örneğinde oto.ini bölgeleri şöyle kesilir :

mermaid diagram

Ünsüz ve ünlü arasındaki sınır, preutterance'dır. Ünlü, uzun notalar için uzatılan bölgedir ; ünsüz bozulmadan kalır, yoksa "k" iki saniye sürer ve berbat duyulur.

# oto.ini (basitleştirilmiş)
# dosya=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

Her ses için beş değer, tüm örneklerinde, ve UTAU herhangi bir kelimeyi düzgünce birleştirir.


CV, VCV, CVVC : gerçekçilik yarışı

Temel mod, CV (Consonne-Voyelle / Ünsüz-Ünlü), hece başına bir sestir. Basit ama biraz robotik : hece birleşim yerleri kaba.

2010'da topluluk VCV'yi (Voyelle-Consonne-Voyelle / Ünlü-Ünsüz-Ünlü) icat etti. Sadece "ka" kaydetmek yerine "a ka" kaydediyorsun -- önceki ünlünün kuyruğuyla birlikte. Geçiş doğal olur çünkü kaydın içinde, sonradan hesaplanmaz.

Can alıcı detay : VOCALOID, VCV'yi VOCALOID3'e kadar, yani 2011'e kadar alamadı. Bir adamın tek başına kodladığı VB6 freeware, geçiş gerçekçiliğinde Yamaha'yı bir yıl tokatladı. Bir hayran topluluğu, çok uluslu şirketten hızlıydı.

Sonra CVVC, ARPAsing (İngilizce), VCCV geldi... her yöntem gerçekçiliği daha da ileri taşıdı, hepsi topluluk tarafından icat edildi ve belgelendi.


Tam pipeline : bir kelime nasıl sese dönüşür

Bir nota koyup söz yazdığında, perde arkasında şunlar olur :

mermaid diagram

Resampler ana parçadır : kaydettiğin "ka" örneğini alır, istenen notaya uyacak şekilde yeniden uzatır/perdeler -- sadece uzatılabilir bölgeyi uzatır ve ünsüzü bozulmadan tutar (işte bu yüzden oto.ini var).

Ve modülerdir. UTAU varsayılan bir resampler ile geliyordu ama topluluk başkalarını da üretti (moresampler, TIPS...), her birinin kendi ses dokusu var. Sentez motorunu plugin gibi değiştiriyordun. 2008'de. Bir freeware'de.


Kaputun altındaki karmaşa (ve neden sevimli)

Şu işin teknik durumu hakkında dürüst olalım :

  • Visual Basic 6 ile kodlanmış. 2008'de zaten ölü bir dil. Çalıştırmak için VB6 runtime gerekli.
  • Başta sadece Windows (Mac portu UTAU-Synth 2011'de geldi).
  • Shift-JIS kodlaması zorunlu. Dosyaların Japonca Shift-JIS ile kodlanmamışsa UTAU bi' şey anlamaz. Hâlâ bugün bile bilgisayarını Japon locale'ine alman ya da AppLocale kullanman gerekebilir.
  • Sade arayüz, zamanında neredeyse %100 Japonca dökümantasyon.

Ve yine de. Yine de bu şey küresel bir hareket yarattı. On binlerce voicebank. Milyonlarca kez dinlenmiş şarkılar.

En iyi örnek : Kasane Teto. 2008'de yaratılmış ve 1 Nisan şakası olarak piyasaya sürülmüş, VOCALOID'miş gibi davranan bir karakter. Bir şakaydı. Ama insanlar karakteri çok sevdi, arkasından gerçek bir UTAU voicebank'ı yapıldı ve Teto dünyanın en ünlü sanal şarkıcılarından biri oldu. 2023'te resmi bir Synthesizer V sesi bile aldı. Bedava bir yazılımdaki 1 Nisan şakasından doğan bir karakter.


Neden hâlâ önemli

UTAU, açıklıkla kazanan "fakir" bir teknolojinin mükemmel örneği.

VOCALOID teknik olarak üstündü, daha iyi finanse edilmişti, daha profesyöneldi. Ama kapalıydı. UTAU hödüktü, çirkindi, VB6'ydı -- ama herkesin katılmasına izin veriyordu. Ses yaratmak, resampler yaratmak, plugin yaratmak, kayıt yöntemleri yaratmak. Gerisini topluluk yaptı.

Ve konsept bugün tamamen yaşıyor. OpenUtau, modern bir açık kaynak halef, aynı fikri alıp tozunu alıyor (çapraz platform, UTF-8, modern resampler VE yapay zeka desteği). Birleştirmeli sentez, deep learning modellerinin yanında hâlâ ayakta, çünkü onlarda olmayan bir şeye sahip : tam olarak ne olduğunu anlıyorsun ve her milisaniyeyi kontrol ediyorsun.

UTAU'da beni hep çeken şey bu. Tam olarak ne olduğunu görüyorsun. Sana anlamadığın sihirli bir şey tüküren bir yapay zeka değil : WAV'ların var, kesme noktaların var ve her şeye sen karar veriyorsun. Kötü duyulduğunda nedenini biliyorsun ve düzeltebiliyorsun. Bu tür bir kontrolü severim.


3 Hatırlanması Gereken Şey :

  1. Birleştirmeli sentez = ses yapbozu -- UTAU küçük WAV örneklerini birleştirip kelimeler oluşturur. oto.ini her sesin nerede kesilip yapıştırılacağını tanımlar. Her şeyi milisaniyesine kadar kontrol edersin, kara kutu yok.

  2. Açıklık tekniği yener -- VOCALOID daha iyiydi ama kapalıydı. UTAU hödüktü ama herkesin kendi sesini yaratmasına izin veriyordu. Topluluk ekosistemi patlattı ve hatta VCV'de Yamaha'yı geçti.

  3. İyi bir fikir kodundan daha uzun yaşar -- VB6, Shift-JIS, sadece Windows... ve yine de konsept OpenUtau'da dönmeye devam ediyor. Harika bir teknoloji ayaklarla kodlanmış olabilir.

Dürüst olmak gerekirse, sırf 1 Nisan şakasından doğan Kasane Teto için bile bu yazılım saygıyı hak ediyor xD

UTAU: come un software in Visual Basic 6 ha democratizzato la voce sintetica

Come UTAU, un software gratuito in VB6 del 2008, ha permesso a chiunque di creare voci sintetiche cantate con sintesi concatenativa -- e perché è ancora importante oggi.

UTAU : come un software in Visual Basic 6 ha democratizzato la voce sintetica

Ne avevo accennato nella mia pagina principale: adoro UTAU. Ecco perché.

Nel 2008, se volevi far cantare una voce sintetica, avevi una opzione: VOCALOID. Il software di Yamaha. Costoso, proprietario, con voci ufficiali che non potevi crearti da solo.

E poi c'è un tizio giapponese, Ameya/Ayame, che ha tirato fuori un coso nel suo cantuccio. Un software codificato in Visual Basic 6. Gratuito. Che ti lasciava creare la tua voce con... file WAV che registravi da solo.

Questo coso si chiama UTAU (歌う, "cantare" in giapponese). E per l'epoca, era magia.

L'ho sempre trovato affascinante questo software. Non perché fosse pulito tecnicamente (spoiler: in realtà sì, dovevi proprio pensarci a creare questo coso... è un bel bordello, piango su questo pollo), ma perché ha fatto una cosa che nessun altro faceva: ha dato la sintesi vocale al grande pubblico. Tipo te, io, chiunque con un microfono.

Lascia che ti spieghi perché era fichissimo.


Prima di tutto, perché la sintesi del canto è una rottura

Una voce cantata non sono note. Hai la consonante che attacca, la vocale che tiene, il respiro, le transizioni tra l'una e l'altra. Il "sa" di "salve" è una "s" che sibila e scivola verso una "a" aperta, ed è questo scivolamento che suona umano o no.

Oggi sistemi tutto col deep learning: addestri un modello su ore di canto e genera la voce (Synthesizer V, DiffSinger). Ma quello è 2020+. Nel 2008, niente di niente.

UTAU usa il metodo di prima, più vecchio e più furbo: la sintesi concatenativa.


La sintesi concatenativa: copia-incolla di pezzetti di voce

L'idea è semplice come una patata: registri piccoli pezzi di voce e li incolli insieme per formare parole. "salve" = campione "sa" + "l" + "ve", concatenati. Un puzzle sonoro guidato da uno spartito.

È il principio delle YouTube Poop dove tagli le parole di un personaggio per fargli dire qualsiasi cosa -- solo che qui è ordinato e automatizzato.

E UTAU viene letteralmente da lì. Prima di lui esisteva il "Jinriki Vocaloid" (人力ボーカロイド, "Vocaloid manuale"): la gente tagliava a mano tracce vocali, estraeva i fonemi, ripitchava, e riassemblava tutto in un editor audio per imitare una voce VOCALOID. A mano. Immagina la fatica.

Ameya ha visto 'sta rottura e ha codificato lo strumento per automatizzarla. All'inizio UTAU era solo questo: un assistente per Vocaloid manuale.


Perché era rivoluzionario: TU crei la voce

Ecco il punto che cambia tutto.

VOCALOID: compravi una voce. Miku, Luka, ecc. Create da professionisti, vendute da Yamaha. Nessun modo di crearne una da te. UTAU, chiunque registra la sua voce e ne fa uno strumento cantante.

La modalità CV (la più semplice) è: registri le ~100 sillabe di base del giapponese ("a", "ka", "sa", "ta"...), configuri i punti di taglio, e voilà la tua voicebank. Qualche ora di lavoro.

Risultato: l'ecosistema è esploso. Migliaia di voicebank create dalla comunità -- voci di fan, di amici, di personaggi inventati. Un intero universo di cantanti virtuali, gratuito. E il software includeva Defoko (Utane Uta), una voce predefinita generata tramite il motore TTS AquesTalk, quindi potevi iniziare anche senza microfono.


Il oto.ini: il cuore del sistema

Come fa UTAU a sapere dove tagliare e incollare i suoni? Tramite un file di configurazione per voicebank: il oto.ini. Per ogni WAV, definisce i punti di taglio (in millisecondi):

  • Offset → silenzio da rimuovere all'inizio
  • Preutterance → il punto in cui la consonante passa alla vocale (il confine "s"→"a" in "sa")
  • Overlap → quanto la nota precedente deborda su quella successiva
  • Fixed region → la parte che NON deve essere allungata su una nota lunga (tipicamente la consonante)
  • Cutoff → dove tagliare la fine

La preutterance è il parametro più furbo. Una sillaba ha sempre un pezzetto di consonante prima della vocale. Per far sì che la nota cada a tempo, è la vocale che deve cadere precisa, non la consonante. Quindi UTAU sposta indietro il campione: la "a" di "sa" atterra sul tempo, la "s" deborda appena prima. Come un batterista che anticipa il colpo per far sì che il suono cada a tempo -- solo che qui è in un .ini.

Visivamente, su un campione "ka", le zone del oto.ini si tagliano così:

mermaid diagram

Il confine tra consonante e vocale è la preutterance. La vocale è la zona che si allunga per le note lunghe; la consonante resta intatta, altrimenti la tua "k" durerebbe due secondi e suonerebbe orribile.

# oto.ini (semplificato)
# file=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

Cinque valori per suono, su tutti i tuoi campioni, e UTAU assembla qualsiasi parola in modo pulito.


CV, VCV, CVVC: la corsa al realismo

La modalità base, CV (Consonante-Vocale), è un suono per sillaba. Semplice ma un po' robotico: le giunture tra le sillabe sono brute.

Nel 2010 la comunità inventa il VCV (Vocale-Consonante-Vocale). Invece di registrare "ka" da solo, registri "a ka" -- con la coda della vocale precedente. La transizione diventa naturale perché è dentro la registrazione, non calcolata dopo.

Il dettaglio che scotta: VOCALOID non ha avuto il VCV prima di VOCALOID3, nel 2011. Il freeware in VB6 codificato da un tizio da solo ha superato Yamaha di un anno sul realismo delle transizioni. Una comunità di fan più veloce della multinazionale.

Poi sono arrivati il CVVC, l'ARPAsing (inglese), il VCCV... ogni metodo spingendo il realismo più avanti, tutti inventati e documentati dalla comunità.


Il pipeline completo: come una parola diventa suono

Quando metti una nota e scrivi un testo, ecco cosa succede dietro le quinte:

mermaid diagram

Il resampler è il pezzo forte: prende il tuo campione "ka" registrato a una certa altezza e lo riallunga/ripitcha per matchare la nota voluta -- allungando solo la zona allungabile e tenendo intatta la consonante (da qui il oto.ini).

Ed è modulare. UTAU includeva un resampler di base, ma la comunità ne ha sfornati altri (moresampler, TIPS...), ognuno con la sua grana sonora. Cambiavi motore di sintesi come un plugin. Nel 2008. Su un freeware.


Il bordello sotto il cofano (e perché è comunque figo)

Bisogna essere onesti sullo stato tecnico del coso:

  • Codificato in Visual Basic 6. Un linguaggio già morto nel 2008. Serve il runtime VB6 per farlo funzionare.
  • Windows only all'inizio (il porting Mac, UTAU-Synth, è arrivato nel 2011).
  • Codifica Shift-JIS obbligatoria. Se i tuoi file non sono codificati in Shift-JIS giapponese, UTAU non capisce niente. Ancora oggi devi spesso mettere il PC in locale giapponese o usare AppLocale per avviarlo.
  • Interfaccia austera, documentazione quasi 100% in giapponese all'epoca.

Eppure. Eppure questo coso ha creato un movimento mondiale. Decine di migliaia di voicebank. Canzoni ascoltate milioni di volte.

Il miglior esempio: Kasane Teto. Un personaggio creato nel 2008 e lanciato come un pesce d'aprile, spacciandosi per una VOCALOID. Era uno scherzo. Solo che la gente ha adorato il personaggio, una vera voicebank UTAU è stata creata dopo, e Teto è diventata una delle cantanti virtuali più famose al mondo. Nel 2023 ha addirittura avuto una voce Synthesizer V ufficiale. Un personaggio nato da un pesce d'aprile su un software gratuito.


Perché conta ancora

UTAU è l'esempio perfetto di una tecnologia "povera" che vince grazie all'apertura.

VOCALOID era tecnicamente superiore, meglio finanziato, più professionale. Ma chiuso. UTAU era raffazzonato, brutto, in VB6 -- ma lasciava partecipare tutti. Creare voci, creare resampler, creare plugin, creare metodi di registrazione. La comunità ha fatto il resto.

E il concetto sopravvive completamente oggi. OpenUtau, un successore open-source moderno, riprende l'idea e la spolvera (multi-piattaforma, UTF-8, supporto dei resampler moderni E dell'IA). La sintesi concatenativa tiene ancora botta accanto ai modelli deep learning, perché ha una cosa che loro non hanno: capisci esattamente cosa succede, e controlli ogni millisecondo.

È questo che mi è sempre piaciuto di UTAU. Vedi esattamente cosa succede. Non è un'IA che ti sputa fuori un coso magico che non capisci: hai i tuoi WAV, i tuoi punti di taglio, e sei tu che decidi tutto. Quando suona male, sai perché e puoi correggere. Adoro questo tipo di controllo.


Le 3 cose da ricordare:

  1. Sintesi concatenativa = puzzle di voci -- UTAU incolla piccoli campioni WAV insieme per formare parole. Il oto.ini definisce dove tagliare e incollare ogni suono. Controlli tutto, al millisecondo, senza scatola nera.

  2. L'apertura batte la tecnica -- VOCALOID era migliore ma chiuso. UTAU era raffazzonato ma lasciava tutti creare le proprie voci. La comunità ha fatto esplodere l'ecosistema, e ha persino superato Yamaha sul VCV.

  3. Una buona idea sopravvive al suo codice -- VB6, Shift-JIS, Windows only... eppure il concetto gira ancora tramite OpenUtau. Una tecnologia geniale può essere codificata coi piedi.

Onestamente, solo per Kasane Teto nata da un pesce d'aprile, questo software merita rispetto xD

UTAU: wie ein Visual-Basic-6-Programm die synthetische Stimme demokratisiert hat

Wie UTAU, eine kostenlose VB6-Software von 2008, es jedem ermöglichte, synthetische Singstimmen zu erstellen -- und warum es heute noch relevant ist.

UTAU : wie ein Visual-Basic-6-Programm die synthetische Stimme demokratisiert hat

Ich hab's auf meiner Hauptseite schon kurz angesprochen: ich liebe UTAU. Hier ist der Grund.

2008 hattest du, wenn du eine synthetische Stimme zum Singen bringen wolltest, genau eine Option: VOCALOID. Das Yamaha-Programm. Teuer, proprietär, mit offiziellen Stimmen, die du nicht selbst erstellen konntest.

Und dann kam irgendein japanischer Typ, Ameya/Ayame, der in seiner Freizeit ein Ding rausgehauen hat. Ein Programm, codiert in Visual Basic 6. Kostenlos. Mit dem du deine eigene Stimme erstellen konntest – mit... WAV-Dateien, die du selbst aufgenommen hast.

Das Ding heißt UTAU (歌う, "singen" auf Japanisch). Und für seine Zeit war das reine Magie.

Ich fand dieses Programm schon immer faszinierend. Nicht weil es technisch sauber war (Spoiler: also eigentlich doch, man musste schon echt drauf kommen, das Ding zu bauen... es ist ein einziges Chaos, ich heul mich weg), sondern weil es was gemacht hat, was sonst niemand gemacht hat: es hat Sprachsynthese an die breite Masse gebracht. Also echt, du, ich, jeder mit nem Mikrofon.

Lass mich dir erklären, warum das genial war.


Warum Gesangssynthese erstmal richtig ätzend ist

Eine gesungene Stimme ist nicht einfach nur Noten. Du hast den Konsonanten am Anfang, den Vokal der gehalten wird, den Atem, die Übergänge zwischen den beiden. Das "sa" von "sagen" ist ein zischendes "s", das in ein offenes "a" übergeht – und genau dieser Übergang macht den menschlichen Klang aus.

Heute regelt man das mit Deep Learning: du trainierst ein Modell auf Stunden von Gesang und es generiert die Stimme (Synthesizer V, DiffSinger). Aber das ist 2020+. 2008? Fehlanzeige.

UTAU nutzt die ältere, klügere Methode von früher: konkatenative Synthese.


Konkatenative Synthese: Copy-Paste von Stimm-Schnipseln

Die Idee ist simpel wie nix: du nimmst kleine Stimm-Schnipsel auf und klebst sie zusammen, um Wörter zu formen. "sagen" = Sample "sa" + "gen", aneinandergereiht. Ein Sound-Puzzle, gesteuert von einer Partitur.

Das ist das gleiche Prinzip wie bei YouTube Poops, wo man die Wörter einer Figur neu zusammenschneidet, damit sie irgendwelchen Blödsinn erzählt – nur dass es hier sauber und automatisiert ist.

Und UTAU kommt genau da her. Davor gab es den "Jinriki Vocaloid" (人力ボーカロイド, "manuel Vocaloid"): Leute haben händisch Sprachspuren geschnitten, Phoneme extrahiert, neu eingepitcht und in einem Audio-Editor wieder zusammengesetzt, um eine VOCALOID-Stimme zu imitieren. Von Hand. Was für ein Aufwand.

Ameya hat diesen Frust gesehen und das Tool zur Automatisierung programmiert. Ursprünglich war UTAU nur das: ein Assistent für manuellen Vocaloid.


Warum das revolutionär war: DU erschaffst die Stimme

Hier ist der Game-Changer.

Bei VOCALOID hast du eine Stimme gekauft. Miku, Luka, etc. Von Profis erstellt, von Yamaha verkauft. Kein Weg, selbst eine zu machen. UTAU? Jeder kann seine Stimme aufnehmen und daraus ein singendes Instrument machen.

Der CV-Modus (der einfachste) funktioniert so: du nimmst die ~100 Grundsilben des Japanischen auf ("a", "ka", "sa", "ta"...), konfigurierst die Schnittpunkte, und fertig ist deine Voicebank. Ein paar Stunden Arbeit.

Ergebnis: Das Ökosystem ist explodiert. Tausende von Voicebanks, erstellt von der Community – Stimmen von Fans, Freunden, erfundenen Charakteren. Ein ganzes Universum virtueller Sänger, kostenlos. Und das Programm kam mit Defoko (Utane Uta), einer Standardstimme, die über die AquesTalk-TTS-Engine generiert wurde, also konntest du sofort loslegen, nicht mal ein Mikro nötig.


Die oto.ini: das Herz des Systems

Woher weiß UTAU, wo es die Sounds schneiden und kleben muss? Über eine Konfigurationsdatei pro Voicebank: die oto.ini. Für jede WAV-Datei definiert sie die Schnittpunkte (in Millisekunden):

  • Offset → Stille am Anfang, die weg muss
  • Preutterance → der Punkt, an dem der Konsonant in den Vokal übergeht (die Grenze "s"→"a" in "sa")
  • Overlap → wie sehr die vorherige Note in diese überlappt
  • Fixed Region → der Teil, der NICHT gedehnt werden darf (typischerweise der Konsonant)
  • Cutoff → wo das Ende abgeschnitten wird

Die Preutterance ist der cleverste Parameter. Eine Silbe hat immer ein Stück Konsonant vor dem Vokal. Damit deine Note genau auf den Takt fällt, muss der Vokal exakt treffen, nicht der Konsonant. Also verschiebt UTAU das Sample nach hinten: das "a" von "ka" landet auf dem Takt, das "k" läuft kurz davor. Wie ein Schlagzeuger, der seinen Schlag vorzieht, damit der Sound genau trifft – nur dass das in einer .ini passiert.

Visuell sehen die Zonen der oto.ini bei einem "ka"-Sample so aus:

mermaid diagram

Die Grenze zwischen Konsonant und Vokal ist die Preutterance. Der Vokal ist die Zone, die bei langen Noten gedehnt wird; der Konsonant bleibt intakt, sonst würde dein "k" zwei Sekunden dauern und furchtbar klingen.

# oto.ini (vereinfacht)
# datei=alias,offset,konsonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

Fünf Werte pro Sound, für alle deine Samples, und UTAU setzt jedes Wort sauber zusammen.


CV, VCV, CVVC: der Wettlauf um Realismus

Der Basismodus, CV (Konsonant-Vokal), ist ein Sound pro Silbe. Einfach, aber etwas roboterhaft: die Übergänge zwischen Silben sind roh.

2010 hat die Community dann VCV (Vokal-Konsonant-Vokal) erfunden. Statt "ka" allein nimmst du "a ka" auf – mit dem Ende des vorherigen Vokals. Der Übergang wird natürlich, weil er im Recording steckt, nicht nachträglich berechnet.

Das fiese Detail: VOCALOID hatte VCV erst mit VOCALOID3, 2011. Der Freeware-Tool in VB6, von einem einzelnen Typen programmiert, hat Yamaha um ein Jahr überholt – bei realistischen Übergängen. Eine Fan-Community war schneller als der Multinationale.

Danach kamen CVVC, ARPAsing (Englisch), VCCV... jede Methode hat den Realismus weiter getrieben, alle von der Community erfunden und dokumentiert.


Die komplette Pipeline: wie ein Wort zu Sound wird

Wenn du eine Note setzt und einen Text eingibst, passiert hinter den Kulissen das hier:

mermaid diagram

Der Resampler ist das Herzstück: er nimmt dein "ka"-Sample, das in einer bestimmten Tonhöhe aufgenommen wurde, und streckt/pitcht es neu, damit es der gewünschten Note entspricht – und zwar nur im dehnbaren Bereich, während der Konsonant intakt bleibt (daher die oto.ini).

Und er ist modular. UTAU kam mit einem Basis-Resampler, aber die Community hat andere gebaut (moresampler, TIPS...), jeder mit eigener Klangfarbe. Du hast die Synthese-Engine ausgetauscht wie ein Plugin. 2008. In einem Freeware.


Das Chaos unter der Haube (und warum es liebenswert ist)

Seien wir ehrlich zum technischen Zustand des Dings:

  • In Visual Basic 6 programmiert. Eine Sprache, die 2008 schon tot war. Du brauchst die VB6-Runtime zum Laufen.
  • Ursprünglich Windows only (der Mac-Port, UTAU-Synth, kam 2011).
  • Shift-JIS-Kodierung obligatorisch. Wenn deine Dateien nicht in japanischem Shift-JIS kodiert sind, checkt UTAU gar nix. Bis heute musst du oft deinen PC auf japanische Locale stellen oder AppLocale benutzen, um es zu starten.
  • Schlichtes Interface, Doku damals quasi 100% auf Japanisch.

Und trotzdem. Trotzdem hat dieses Ding eine weltweite Bewegung ausgelöst. Zehntausende Voicebanks. Songs mit Millionen Aufrufen.

Das beste Beispiel: Kasane Teto. Ein Charakter, 2008 als Aprilscherz erschaffen, der sich als VOCALOID ausgegeben hat. Ein Witz. Aber die Leute haben den Charakter geliebt, eine echte UTAU-Voicebank wurde draus gemacht, und Teto wurde eine der berühmtesten virtuellen Sängerinnen der Welt. 2023 hat sie sogar eine offizielle Synthesizer-V-Stimme bekommen. Ein Charakter, geboren aus einem Aprilscherz auf einer kostenlosen Software.


Warum es heute noch zählt

UTAU ist das perfekte Beispiel dafür, wie eine "arme" Technologie durch Offenheit gewinnt.

VOCALOID war technisch überlegen, besser finanziert, professioneller. Aber geschlossen. UTAU war zusammengebaut, hässlich, in VB6 – aber es ließ alle mitmachen. Stimmen erstellen, Resampler bauen, Plugins schreiben, Aufnahmemethoden entwickeln. Die Community hat den Rest erledigt.

Und das Konzept lebt heute absolut weiter. OpenUtau, ein moderner Open-Source-Nachfolger, nimmt die Idee auf und entstaubt sie (plattformunabhängig, UTF-8, Support für moderne Resampler UND KI). Die konkatenative Synthese hält sich immer noch neben den Deep-Learning-Modellen, weil sie was hat, was die nicht haben: du verstehst genau, was passiert, und kontrollierst jede Millisekunde.

Das ist es, was mir an UTAU immer gefallen hat. Du siehst genau, was passiert. Es ist keine KI, die dir irgendein magisches Zeug ausspuckt, das du nicht checkst: du hast deine WAVs, deine Schnittpunkte, und du entscheidest über alles. Wenn es scheiße klingt, weißt du warum und kannst es fixen. Ich liebe diese Art von Kontrolle.


Die 3 Dinge, die du dir merken solltest:

  1. Konkatenative Synthese = Stimm-Puzzle – UTAU klebt kleine WAV-Samples zusammen, um Wörter zu formen. Die oto.ini definiert, wo jeder Sound geschnitten und geklebt wird. Du kontrollierst alles auf die Millisekunde, ohne Blackbox.

  2. Offenheit schlägt Technik – VOCALOID war besser aber geschlossen. UTAU war zusammengebastelt, aber ließ jeden seine Stimmen erstellen. Die Community hat das Ökosystem explodieren lassen und Yamaha sogar beim VCV überholt.

  3. Eine gute Idee überlebt ihren Code – VB6, Shift-JIS, Windows only... und trotzdem läuft das Konzept heute noch via OpenUtau. Eine geniale Technologie kann mit Scheiße programmiert sein.

Ehrlich, allein für Kasane Teto, geboren aus einem Aprilscherz, hat dieses Programm Respekt verdient xD

UTAU: как программа на Visual Basic 6 демократизировала синтетический голос

Как UTAU, бесплатная программа на VB6 2008 года, позволила любому создавать синтетические певческие голоса с помощью конкатенативного синтеза -- и почему это всё ещё важно сегодня.

UTAU : как программа на Visual Basic 6 демократизировала синтетический голос

Я уже упоминал об этом на своей главной странице : я люблю UTAU. Вот почему.

В 2008 году, если ты хотел заставить синтетический голос петь, у тебя был один вариант : VOCALOID. Программа от Yamaha. Дорогая, проприетарная, с официальными голосами, которые ты не мог создать сам.

А потом появился один японский чувак, Ameya/Ayame, который выпустил свою штуковину. Программа, написанная на Visual Basic 6. Бесплатная. Которая позволяла тебе создать свой собственный голос с помощью... WAV-файлов, которые ты сам записывал.

Эта штука называется UTAU (歌う, "петь" по-японски). И для своего времени это была магия.

Меня всегда эта программа завораживала. Не потому что она была технически чистой (спойлер : вообще-то нет, надо было реально врубиться, чтобы создать эту херню... это полный трэш, я плачу над этим цыплёнком), а потому что она сделала то, чего никто другой не делал : она дала синтез речи широкой публике. Типа тебе, мне, любому с микрофоном.

Дай объясню, почему это было круто.


Для начала, почему синтез пения -- это боль

Певческий голос -- это не ноты. Тут есть атака согласной, протяжная гласная, дыхание, переходы между ними. "Са" в "салют" -- это шипящая "с", которая перетекает в открытую "а", и именно этот переход звучит по-человечески или нет.

Сегодня это решают через deep learning : ты обучаешь модель на часах пения, и она генерирует голос (Synthesizer V, DiffSinger). Но это 2020+. В 2008 -- нифига.

UTAU использует более старый и более хитрый метод : конкатенативный синтез.


Конкатенативный синтез : копи-паст кусочков голоса

Идея проще пареной репы : ты записываешь маленькие кусочки голоса и склеиваешь их вместе, чтобы образовать слова. "салют" = сэмпл "са" + "лю" + "т", соединённые вместе. Звуковой пазл под управлением партитуры.

Это принцип YouTube Poop, где перерезают слова персонажа, чтобы заставить его говорить что попало -- только здесь всё чётко и автоматизировано.

И UTAU буквально отсюда и пошёл. До него существовал "Jinriki Vocaloid" (人力ボーカロイド, "ручной Vocaloid") : люди вручную нарезали вокальные дорожки, извлекали фонемы, меняли высоту тона и собирали всё обратно в аудиоредакторе, чтобы имитировать голос VOCALOID. Вручную. Представляешь объём работы.

Ameya посмотрел на эту жесть и написал инструмент для автоматизации. Изначально UTAU был просто этим : помощником для ручного Vocaloid.


Почему это было революционно : ТЫ создаёшь голос

Вот что всё меняет.

VOCALOID -- ты покупал голос. Мику, Луку и т.д. Созданные профиками, проданные Yamaha. Никак не сделать свой самому. UTAU -- любой может записать свой голос и сделать из него поющий инструмент.

Режим CV (самый простой) : ты записываешь ~100 базовых слогов японского ("а", "ка", "са", "та"...), настраиваешь точки обрезки, и вуаля -- твоя voicebank. Несколько часов работы.

Результат : экосистема взорвалась. Тысячи voicebank'ов, созданных сообществом -- голоса фанатов, друзей, выдуманных персонажей. Целая вселенная виртуальных певцов, бесплатно. И программа шла с Defoko (Utane Uta), голосом по умолчанию, сгенерированным через TTS-движок AquesTalk, так что ты мог начать даже без микрофона.


oto.ini : сердце системы

Откуда UTAU знает, где резать и склеивать звуки? Через конфигурационный файл для каждой voicebank : oto.ini. Для каждого WAV он определяет точки обрезки (в миллисекундах) :

  • Offset → тишина, которую надо выкинуть в начале
  • Preutterance → точка, где согласная переходит в гласную (граница "с"→"а" в "са")
  • Overlap → насколько предыдущая нота перекрывает эту
  • Fixed region → часть, которую НЕЛЬЗЯ растягивать на длинной ноте (обычно согласная)
  • Cutoff → где обрезать конец

Preutterance -- самый хитрый параметр. В слоге всегда есть кусок согласной перед гласной. Чтобы нота попала в такт, гласная должна попасть точно, а не согласная. Поэтому UTAU сдвигает сэмпл назад : "а" из "са" попадает в такт, а "с" чуть набегает перед ней. Как барабанщик, который предвосхищает удар, чтобы звук пришёлся точно -- только вот это в .ini.

Визуально, на сэмпле "ка", зоны из oto.ini выглядят так :

mermaid diagram

Граница между согласной и гласной -- это preutterance. Гласная -- зона, которую растягивают для длинных нот ; согласная остаётся нетронутой, иначе твоя "к" длилась бы две секунды и звучала ужасно.

# oto.ini (упрощённо)
# файл=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

Пять значений на звук, для всех твоих сэмплов -- и UTAU собирает любое слово нормально.


CV, VCV, CVVC : гонка за реализмом

Базовый режим, CV (Согласная-Гласная) -- это один звук на слог. Просто, но слегка роботизированно : стыки между слогами грубые.

В 2010 сообщество изобретает VCV (Гласная-Согласная-Гласная). Вместо того чтобы записывать "ка" отдельно, ты записываешь "а ка" -- с хвостом предыдущей гласной. Переход становится естественным, потому что он внутри записи, а не вычисляется постфактум.

Пикантная деталь : у VOCALOID не было VCV до VOCALOID3, в 2011 году. Бесплатная программа на VB6, написанная чуваком в одиночку, обогнала Yamaha на год в реалистичности переходов. Фан-сообщество быстрее транснациональной корпорации.

Потом появились CVVC, ARPAsing (английский), VCCV... каждый метод продвигал реализм всё дальше, и все они были изобретены и задокументированы сообществом.


Полный пайплайн : как слово становится звуком

Когда ты ставишь ноту и вбиваешь текст, вот что происходит под капотом :

mermaid diagram

Resampler -- ключевой компонент : он берёт твой сэмпл "ка", записанный на определённой высоте, и перерастягивает/меняет его высоту, чтобы соответствовать нужной ноте -- растягивая только растяжимую зону и оставляя согласную нетронутой (для этого и нужен oto.ini).

И он модульный. UTAU шёл с базовым ресемплером, но сообщество наклепало других (moresampler, TIPS...), каждый со своим звучанием. Ты менял движок синтеза как плагин. В 2008. На бесплатной проге.


Трэш под капотом (и почему это мило)

Нужно быть честным о техническом состоянии этой штуки :

  • Написано на Visual Basic 6. Язык, который уже был мёртв в 2008. Нужен VB6-рантайм, чтобы это работало.
  • Изначально только под Windows (порт на Mac, UTAU-Synth, появился в 2011).
  • Обязательная кодировка Shift-JIS. Если твои файлы не в японской Shift-JIS, UTAU ничего не понимает. До сих пор часто приходится ставить системную локаль на японскую или использовать AppLocale для запуска.
  • Суровый интерфейс, документация почти 100% на японском в то время.

И всё же. И всё же эта штука создала мировое движение. Десятки тысяч voicebank'ов. Песни, собравшие миллионы прослушиваний.

Лучший пример : Kasane Teto. Персонаж, созданный в 2008 и выпущенный как первоапрельский розыгрыш, выдаваемый за VOCALOID. Это была шутка. Но люди обожали персонажа, настоящая voicebank UTAU была создана позже, и Тето стала одной из самых известных виртуальных певиц в мире. В 2023 она даже получила официальный голос Synthesizer V. Персонаж, рождённый из первоапрельской шутки на бесплатной программе.


Почему это всё ещё важно

UTAU -- идеальный пример "бедной" технологии, которая побеждает благодаря открытости.

VOCALOID был технически превосходящим, лучше финансируемым, более профессиональным. Но закрытым. UTAU был собран на коленке, уродливый, на VB6 -- но он позволял всем участвовать. Создавать голоса, создавать ресемплеры, создавать плагины, создавать методы записи. Сообщество сделало остальное.

И эта концепция полностью жива сегодня. OpenUtau, современный open-source преемник, переосмысливает идею и смахивает с неё пыль (кроссплатформенность, UTF-8, поддержка современных ресемплеров И ИИ). Конкатенативный синтез всё ещё держится рядом с deep learning моделями, потому что у него есть то, чего нет у них : ты понимаешь, что именно происходит, и контролируешь каждую миллисекунду.

Вот что мне всегда нравилось в UTAU. Ты видишь, что именно происходит. Это не ИИ, который выдаёт тебе магическую херню, которую ты не понимаешь : у тебя есть твои WAV, твои точки обрезки, и ты сам решаешь всё. Когда звучит херово, ты знаешь почему и можешь исправить. Я люблю такой контроль.


3 штуки, которые надо запомнить :

  1. Конкатенативный синтез = пазл из голоса -- UTAU склеивает маленькие WAV-сэмплы вместе, чтобы образовать слова. oto.ini определяет, где резать и склеивать каждый звук. Ты контролируешь всё, с точностью до миллисекунды, без чёрного ящика.

  2. Открытость бьёт технику -- VOCALOID был лучше, но закрыт. UTAU был собран на коленке, но позволял всем создавать свои голоса. Сообщество взорвало экосистему и даже обогнало Yamaha в VCV.

  3. Хорошая идея переживает свой код -- VB6, Shift-JIS, только Windows... и всё же концепция живёт через OpenUtau. Гениальная технология может быть написана через жопу.

Честно, уже только за Kasane Teto, рождённую из первоапрельской шутки, эта программа заслуживает уважения xD

UTAU: cómo un software en Visual Basic 6 democratizó la voz sintética

Cómo UTAU, un software gratuito en VB6 de 2008, permitió a cualquiera crear voces sintéticas para cantar mediante síntesis concatenativa -- y por qué sigue siendo importante hoy.

UTAU : cómo un software en Visual Basic 6 democratizó la voz sintética

Ya lo mencioné en mi página principal : me encanta UTAU. Aquí te cuento por qué.

En 2008, si querías hacer cantar una voz sintética, tenías una opción : VOCALOID. El software de Yamaha. Caro, privativo, con voces oficiales que no podías crear tú mismo.

Y entonces llega un tipo japonés, Ameya/Ayame, que sacó un proyecto en su rincón. Un software programado en Visual Basic 6. Gratuito. Que te dejaba crear tu propia voz con... archivos WAV que grababas tú mismo.

Ese proyecto se llama UTAU (歌う, "cantar" en japonés). Y para su época, era magia.

Siempre me pareció fascinante este software. No porque fuera técnicamente limpio (spoiler : en realidad sí, había que tener cabeza para crear esto... es un caos bonito, lloro por este pollo), sino porque hizo algo que nadie más hacía : le dio la síntesis de voz al público general. O sea tú, yo, cualquiera con un micro.

Déjame explicarte por qué era tan genial.


Primero, por qué la síntesis de canto es un rollo

Una voz cantada no son solo notas. Tienes la consonante que ataca, la vocal que se mantiene, el aire, las transiciones entre ambas. La "sa" de "saludo" es una "s" que silba y se desliza hacia una "a" abierta, y es ese deslizamiento lo que suena humano o no.

Hoy en día se arregla con deep learning : entrenas un modelo con horas de canto y genera la voz (Synthesizer V, DiffSinger). Pero eso es 2020+. En 2008, ni de coña.

UTAU usa el método de antes, más viejo y más ingenioso : la síntesis concatenativa.


La síntesis concatenativa : copiar y pegar trocitos de voz

La idea es tonta de simple : grabas pequeños fragmentos de voz y los pegas juntos para formar palabras. "hola" = muestra "ho" + "la", encadenadas. Un puzle sonoro guiado por una partitura.

Es el mismo principio que los YouTube Poop donde recortan palabras de un personaje para hacerle decir cualquier cosa -- solo que aquí es ordenado y automatizado.

Y UTAU viene literalmente de ahí. Antes existía el "Jinriki Vocaloid" (人力ボーカロイド, "Vocaloid manual") : gente que recortaba a mano pistas de voz, extraía los fonemas, reajustaba el tono, y reensamblaba todo en un editor de audio para imitar una voz VOCALOID. A mano. Te imaginas la currada.

Ameya vio este drama y programó la herramienta para automatizarlo. Al principio UTAU era solo eso : un asistente para Vocaloid manual.


Por qué fue revolucionario : TÚ creas la voz

Aquí está lo que cambió todo.

VOCALOID, comprabas una voz. Miku, Luka, etc. Creadas por profesionales, vendidas por Yamaha. Ni modo de hacer una tú mismo. UTAU, cualquiera graba su voz y la convierte en un instrumento cantante.

El modo CV (el más simple) es : grabas las ~100 sílabas básicas del japonés ("a", "ka", "sa", "ta"...), configuras los puntos de corte, y ya tienes tu voicebank. Un par de horas de trabajo.

Resultado : el ecosistema explotó. Miles de voicebanks creadas por la comunidad -- voces de fans, de amigos, de personajes inventados. Un universo entero de cantantes virtuales, gratuito. Y el software venía con Defoko (Utane Uta), una voz por defecto generada mediante el motor TTS AquesTalk, así que podías empezar incluso sin micro.


El oto.ini : el corazón del sistema

¿Cómo sabe UTAU dónde cortar y pegar los sonidos? Mediante un archivo de configuración por voicebank : el oto.ini. Para cada WAV, define los puntos de corte (en milisegundos) :

  • Offset → silencio a quitar al inicio
  • Preutterance → el punto donde la consonante pasa a la vocal (la frontera "s"→"a" en "sa")
  • Overlap → cuánto la nota anterior se solapa con esta
  • Fixed region → la parte que NO debe estirarse en una nota larga (típicamente la consonante)
  • Cutoff → dónde cortar el final

La preutterance es el parámetro más ingenioso. Una sílaba siempre tiene un trozo de consonante antes de la vocal. Para que tu nota caiga en el tiempo, es la vocal la que debe caer justo, no la consonante. Así que UTAU desplaza la muestra hacia atrás : la "a" de "sa" aterriza en el tiempo, la "s" sobresale justo antes. Como un baterista que anticipa su golpe para que el sonido caiga justo -- solo que aquí está en un .ini.

Visualmente, en una muestra "ka", las zonas del oto.ini se dividen así :

mermaid diagram

La frontera entre la consonante y la vocal es la preutterance. La vocal es la zona que se estira para las notas largas ; la consonante se queda intacta, si no tu "k" duraría dos segundos y sonaría horrible.

# oto.ini (simplificado)
# archivo=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

Cinco valores por sonido, en todas tus muestras, y UTAU monta cualquier palabra correctamente.


CV, VCV, CVVC : la carrera hacia el realismo

El modo básico, CV (Consonante-Vocal), es un sonido por sílaba. Simple pero un poco robótico : las uniones entre sílabas son bruscas.

En 2010 la comunidad inventa el VCV (Vocal-Consonante-Vocal). En lugar de grabar "ka" solo, grabas "a ka" -- con la cola de la vocal anterior. La transición se vuelve natural porque está dentro de la grabación, no calculada después.

El detalle que duele : VOCALOID no tuvo VCV hasta VOCALOID3, en 2011. El freeware en VB6 programado por un tipo solo se adelantó a Yamaha por un año en el realismo de las transiciones. Una comunidad de fans más rápida que la multinacional.

Después llegaron el CVVC, el ARPAsing (inglés), el VCCV... cada método llevando el realismo más lejos, todos inventados y documentados por la comunidad.


El pipeline completo : cómo una palabra se convierte en sonido

Cuando pones una nota y escribes una letra, esto es lo que pasa entre bastidores :

mermaid diagram

El resampler es la pieza clave : toma tu muestra "ka" grabada a una altura dada y la reestira/reajusta para que coincida con la nota deseada -- estirando solo la zona estirable y manteniendo la consonante intacta (de ahí el oto.ini).

Y es modular. UTAU venía con un resampler básico, pero la comunidad creó otros (moresampler, TIPS...), cada uno con su grano sonoro. Cambiabas de motor de síntesis como un plugin. En 2008. En un freeware.


El caos bajo el capó (y por qué es entrañable)

Hay que ser honesto sobre el estado técnico del invento :

  • Programado en Visual Basic 6. Un lenguaje ya muerto en 2008. Necesitas el runtime VB6 para que funcione.
  • Windows only originalmente (el port a Mac, UTAU-Synth, llegó en 2011).
  • Codificación Shift-JIS obligatoria. Si tus archivos no están codificados en Shift-JIS japonés, UTAU no entiende nada. Todavía hoy hay que poner a menudo el PC en locale japonés o usar AppLocale para ejecutarlo.
  • Interfaz austera, documentación casi 100% en japonés en su época.

Y sin embargo. Sin embargo esto creó un movimiento mundial. Decenas de miles de voicebanks. Canciones escuchadas millones de veces.

El mejor ejemplo : Kasane Teto. Un personaje creado en 2008 y lanzado como una broma del 1 de abril, haciéndose pasar por una VOCALOID. Era una broma. Pero la gente amó al personaje, se creó una voicebank UTAU real detrás, y Teto se convirtió en una de las cantantes virtuales más famosas del mundo. En 2023 incluso recibió una voz Synthesizer V oficial. Un personaje nacido de una broma de abril en un software gratuito.


Por qué sigue importando

UTAU es el ejemplo perfecto de una tecnología "pobre" que gana por ser abierta.

VOCALOID era técnicamente superior, mejor financiado, más profesional. Pero cerrado. UTAU era chapucero, feo, en VB6 -- pero dejaba que todo el mundo participara. Crear voces, crear resamplers, crear plugins, crear métodos de grabación. La comunidad hizo el resto.

Y el concepto sobrevive completamente hoy. OpenUtau, un sucesor open-source moderno, retoma la idea y la desempolva (multi-plataforma, UTF-8, soporte de resamplers modernos Y de IA). La síntesis concatenativa sigue en pie al lado de los modelos de deep learning, porque tiene algo que ellos no tienen : entiendes exactamente lo que pasa, y controlas cada milisegundo.

Eso es lo que siempre me gustó de UTAU. Ves exactamente lo que pasa. No es una IA que te escupe algo mágico que no entiendes : tienes tus WAV, tus puntos de corte, y eres tú quien decide todo. Cuando suena mal, sabes por qué y puedes corregirlo. Me encanta ese tipo de control.


Las 3 cosas para recordar :

  1. Síntesis concatenativa = puzle de voz -- UTAU pega pequeños fragmentos WAV para formar palabras. El oto.ini define dónde cortar y pegar cada sonido. Controlas todo, al milisegundo, sin caja negra.

  2. La apertura vence a la técnica -- VOCALOID era mejor pero cerrado. UTAU era chapucero pero dejaba a todo el mundo crear sus voces. La comunidad hizo explotar el ecosistema, e incluso se adelantó a Yamaha en el VCV.

  3. Una buena idea sobrevive a su código -- VB6, Shift-JIS, Windows only... y sin embargo el concepto sigue funcionando mediante OpenUtau. Una tecnología genial puede estar programada con los pies.

Sinceramente, solo por Kasane Teto nacida de una broma de abril, este software merece respeto xD

UTAU : como um software em Visual Basic 6 democratizou a voz sintética

Como o UTAU, um software gratuito em VB6 de 2008, permitiu que qualquer um criasse vozes cantadas por síntese concatenativa -- e por que isso ainda importa hoje.

UTAU : como um software em Visual Basic 6 democratizou a voz sintética

Eu já mencionei isso na minha página principal: eu amo UTAU. Aqui está o porquê.

Em 2008, se você queria fazer uma voz sintética cantar, tinha uma opção: VOCALOID. O software da Yamaha. Caro, proprietário, com vozes oficiais que você não podia criar sozinho.

E então um cara japonês, Ameya/Ayame, lançou uma coisa do nada. Um software codificado em Visual Basic 6. Gratuito. Que deixava você criar sua própria voz com... arquivos WAV que você mesmo gravava.

Essa coisa se chama UTAU (歌う, "cantar" em japonês). E para sua época, era mágica.

Eu sempre achei esse software fascinante. Não porque era tecnicamente limpo (spoiler: na verdade, tinha que pensar muito pra criar essa bagunça... é uma bela zona), mas porque ele fez uma coisa que ninguém mais fazia: ele deu a síntese vocal para o grande público. Tipo você, eu, qualquer um com um microfone.

Deixe-me explicar por que isso era genial.


Primeiro, por que a síntese de canto é complicada

Uma voz cantada não são notas. Tem a consoante que ataca, a vogal que sustenta, a respiração, as transições entre as duas. O "sa" de "salut" é um "s" que sibila e desliza para um "a" aberto, e é esse deslize que soa humano ou não.

Hoje resolvemos isso com deep learning: você treina um modelo em horas de canto e ele gera a voz (Synthesizer V, DiffSinger). Mas isso é 2020+. Em 2008, nada.

UTAU usa o método anterior, mais antigo e mais esperto: a síntese concatenativa.


Síntese concatenativa: copiar-colar de pedaços de voz

A ideia é simples: você grava pequenos pedaços de voz e os cola para formar palavras. "salut" = amostra "sa" + "lu" + "to", encadeados. Um quebra-cabeça sonoro guiado por uma partitura.

É o princípio dos YouTube Poop onde recortam as palavras de um personagem para fazê-lo dizer qualquer coisa -- só que aqui é organizado e automatizado.

E UTAU vem literalmente daí. Antes dele existia o "Jinriki Vocaloid" (人力ボーカロイド, "Vocaloid manual"): pessoas cortavam manualmente faixas vocais, extraíam os fonemas, repitchavam, e remontavam tudo em um editor de áudio para imitar uma voz VOCALOID. Manualmente. Imagina o trabalho.

Ameya viu essa dificuldade e codificou a ferramenta para automatizar. No início, UTAU era só isso: um assistente para Vocaloid manual.


Por que era revolucionário: VOCÊ cria a voz

Eis o que muda tudo.

VOCALOID, você comprava uma voz. Miku, Luka, etc. Criadas por profissionais, vendidas pela Yamaha. Sem chance de fazer uma você mesmo. UTAU, qualquer um grava sua própria voz e a transforma em um instrumento cantante.

O modo CV (o mais simples) é: você grava as ~100 sílabas básicas do japonês ("a", "ka", "sa", "ta"...), configura os pontos de corte, e pronto, sua voicebank. Algumas horas de trabalho.

Resultado: o ecossistema explodiu. Milhares de voicebanks criadas pela comunidade -- vozes de fãs, de amigos, de personagens inventados. Um universo inteiro de cantores virtuais, gratuito. E o software vinha com Defoko (Utane Uta), uma voz padrão gerada pelo motor TTS AquesTalk, então você podia começar mesmo sem microfone.


O oto.ini: o coração do sistema

Como o UTAU sabe onde cortar e colar os sons? Através de um arquivo de configuração por voicebank: o oto.ini. Para cada WAV, ele define os pontos de corte (em milissegundos):

  • Offset → silêncio para remover no início
  • Preutterance → o ponto onde a consoante passa para a vogal (a fronteira "s"→"a" em "sa")
  • Overlap → quanto a nota anterior se sobrepõe a esta
  • Fixed region → a parte que NÃO deve ser esticada em uma nota longa (tipicamente a consoante)
  • Cutoff → onde cortar o final

A preutterance é o parâmetro mais esperto. Uma sílaba sempre tem um pedaço de consoante antes da vogal. Para que sua nota caia no tempo, é a vogal que deve cair exata, não a consoante. Então o UTAU desloca a amostra para trás: o "a" de "sa" cai no tempo, o "s" transborda um pouco antes. Como um baterista que antecipa a batida para que o som caia no lugar certo -- só que aqui está em um .ini.

Visualmente, em uma amostra "ka", as zonas do oto.ini se dividem assim:

mermaid diagram

A fronteira entre a consoante e a vogal é a preutterance. A vogal é a zona que se estica para notas longas; a consoante permanece intacta, senão seu "k" duraria dois segundos e soaria horrível.

# oto.ini (simplifié)
# fichier=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

Cinco valores por som, em todas as suas amostras, e o UTAU monta qualquer palavra corretamente.


CV, VCV, CVVC: a corrida pelo realismo

O modo básico, CV (Consoante-Vogal), é um som por sílaba. Simples mas um pouco robótico: as junções entre sílabas são brutas.

Em 2010 a comunidade inventa o VCV (Vogal-Consoante-Vogal). Em vez de gravar "ka" sozinho, você grava "a ka" -- com o final da vogal anterior. A transição se torna natural porque está dentro da gravação, não calculada depois.

O detalhe que dói: VOCALOID não teve VCV antes do VOCALOID3, em 2011. O freeware em VB6 codificado por um cara sozinho superou a Yamaha em um ano no realismo das transições. Uma comunidade de fãs mais rápida que a multinacional.

Depois vieram o CVVC, o ARPAsing (inglês), o VCCV... cada método empurrando o realismo mais longe, todos inventados e documentados pela comunidade.


O pipeline completo: como uma palavra se torna som

Quando você coloca uma nota e digita uma letra, eis o que acontece nos bastidores:

mermaid diagram

O resampler é a peça central: ele pega sua amostra "ka" gravada em uma determinada altura e a redimensiona/repitcha para corresponder à nota desejada -- esticando apenas a zona esticável e mantendo a consoante intacta (daí o oto.ini).

E ele é modular. UTAU vinha com um resampler básico, mas a comunidade criou outros (moresampler, TIPS...), cada um com seu timbre sonoro. Você trocava o motor de síntese como um plugin. Em 2008. Em um freeware.


A bagunça por baixo do capô (e por que é cativante)

É preciso ser honesto sobre o estado técnico da coisa:

  • Codificado em Visual Basic 6. Uma linguagem já morta em 2008. Precisa do runtime VB6 para rodar.
  • Windows only originalmente (a versão Mac, UTAU-Synth, veio em 2011).
  • Codificação Shift-JIS obrigatória. Se seus arquivos não estiverem codificados em Shift-JIS japonês, UTAU não entende nada. Ainda hoje é preciso frequentemente colocar o PC em localidade japonesa ou usar AppLocale para executá-lo.
  • Interface austera, documentação quase 100% em japonês na época.

E no entanto. No entanto, essa coisa criou um movimento mundial. Dezenas de milhares de voicebanks. Músicas ouvidas milhões de vezes.

O melhor exemplo: Kasane Teto. Um personagem criado em 2008 e lançado como uma pegadinha de 1º de abril, se passando por uma VOCALOID. Era uma piada. Só que as pessoas amaram o personagem, uma verdadeira voicebank UTAU foi criada depois, e Teto se tornou uma das cantoras virtuais mais famosas do mundo. Em 2023 ela ganhou até uma voz Synthesizer V oficial. Um personagem nascido de uma piada de 1º de abril em um software gratuito.


Por que ainda importa

UTAU é o exemplo perfeito de uma tecnologia "pobre" que vence pela abertura.

VOCALOID era tecnicamente superior, melhor financiado, mais profissional. Mas fechado. UTAU era improvisado, feio, em VB6 -- mas deixava todo mundo participar. Criar vozes, criar resamplers, criar plugins, criar métodos de gravação. A comunidade fez o resto.

E o conceito sobrevive completamente hoje. OpenUtau, um sucessor open-source moderno, retoma a ideia e a moderniza (multi-plataforma, UTF-8, suporte a resamplers modernos E IA). A síntese concatenativa ainda se mantém ao lado dos modelos de deep learning, porque tem uma coisa que eles não têm: você entende exatamente o que está acontecendo e controla cada milissegundo.

É isso que sempre gostei no UTAU. Você vê exatamente o que está acontecendo. Não é uma IA que cospe algo mágico que você não entende: você tem seus WAVs, seus pontos de corte, e é você quem decide tudo. Quando soa mal, você sabe por quê e pode corrigir. Eu gosto desse tipo de controle.


As 3 coisas para lembrar:

  1. Síntese concatenativa = quebra-cabeça de voz -- UTAU cola pequenas amostras WAV para formar palavras. O oto.ini define onde cortar e colar cada som. Você controla tudo, ao milissegundo, sem caixa-preta.

  2. A abertura vence a técnica -- VOCALOID era melhor mas fechado. UTAU era improvisado mas deixava todo mundo criar suas vozes. A comunidade fez o ecossistema explodir, e até superou a Yamaha no VCV.

  3. Uma boa ideia sobrevive ao seu código -- VB6, Shift-JIS, Windows only... e no entanto o conceito ainda roda via OpenUtau. Uma tecnologia genial pode ser codificada com os pés.

Honestamente, só por Kasane Teto ter nascido de uma piada de 1º de abril, esse software merece respeito xD

UTAU : bagaimana sebuah perangkat lunak Visual Basic 6 mendemokratisasi suara sintetis

Bagaimana UTAU, perangkat lunak gratis berbasis VB6 dari tahun 2008, memungkinkan siapa saja membuat suara nyanyian melalui sintesis konkatenatif -- dan mengapa hal itu masih berarti hingga hari ini.

UTAU : bagaimana sebuah perangkat lunak Visual Basic 6 mendemokratisasi suara sintetis

Aku sudah sempat menyinggungnya di halaman utamaku: aku suka UTAU. Inilah alasannya.

Pada tahun 2008, jika kamu ingin membuat suara sintetis bernyanyi, cuma ada satu opsi: VOCALOID. Perangkat lunak dari Yamaha. Mahal, proprietary, dengan suara resmi yang tidak bisa kamu buat sendiri.

Lalu ada seorang pria Jepang, Ameya/Ayame, yang merilis sesuatu buatannya sendiri. Sebuah perangkat lunak yang dikode dalam Visual Basic 6. Gratis. Yang memungkinkanmu membuat suaramu sendiri dengan... file WAV yang kamu rekam sendiri.

Benda itu bernama UTAU (歌う, "bernyanyi" dalam bahasa Jepang). Dan untuk zamannya, itu adalah sihir.

Aku selalu merasa perangkat lunak ini mempesona. Bukan karena ia bersih secara teknis (spoiler: sebenarnya ya, butuh pemikiran sungguhan untuk membuat benda ini--pokoknya berantakan, aku menangisi ayam ini), tapi karena ia melakukan sesuatu yang tidak dilakukan orang lain: ia memberikan sintesis suara kepada masyarakat umum. Kayak kamu, aku, siapa pun yang punya mikrofon.

Biarkan aku jelaskan kenapa ini keren.


Pertama, kenapa sintesis nyanyian itu sulit

Suara bernyanyi itu bukan sekadar not. Ada konsonan yang menyerang, vokal yang bertahan, napas, transisi di antaranya. "Sa" dari "salam" itu adalah "s" yang mendesis lalu meluncur ke "a" yang terbuka, dan pergeseran itulah yang membuatnya terdengar manusiawi atau tidak.

Sekarang kita menyelesaikannya dengan deep learning: kamu melatih model pada jam-jam nyanyian dan ia menghasilkan suara (Synthesizer V, DiffSinger). Tapi itu 2020+. Di tahun 2008, nggak ada.

UTAU menggunakan metode lama, lebih tua dan lebih cerdik: sintesis konkatenatif.


Sintesis konkatenatif: copy-paste potongan suara

Idenya sederhana banget: kamu merekam potongan-potongan kecil suara lalu menempelkannya bersama untuk membentuk kata. "salam" = sampel "sa" + "lam", dirangkai. Sebuah puzzle suara yang dijalankan oleh partitur.

Ini prinsip yang sama dengan YouTube Poop di mana orang memotong ulang kata-kata karakter untuk membuatnya mengatakan apa saja -- cuma di sini lebih rapi dan otomatis.

Dan UTAU benar-benar berasal dari situ. Sebelumnya ada "Jinriki Vocaloid" (人力ボーカロイド, "Vocaloid manual"): orang-orang memotong secara manual trek vokal, mengekstrak fonem, mengubah pitch, dan merakit ulang semuanya di editor audio untuk meniru suara VOCALOID. Manual. Bayangkan repotnya.

Ameya melihat kerepotan ini dan mengkode alat untuk mengotomatiskannya. Awalnya UTAU hanyalah itu: sebuah asisten untuk Vocaloid manual.


Kenapa ini revolusioner: KAMU yang menciptakan suara

Ini dia hal yang mengubah segalanya.

VOCALOID, kamu membeli suara. Miku, Luka, dll. Dibuat oleh profesional, dijual oleh Yamaha. Nggak ada cara untuk membuatnya sendiri. UTAU, siapa pun bisa merekam suaranya dan menjadikannya instrumen bernyanyi.

Mode CV (paling sederhana) adalah: kamu merekam ~100 suku kata dasar bahasa Jepang ("a", "ka", "sa", "ta"...), mengatur titik potong, dan jadilah voicebank-mu. Beberapa jam kerja.

Hasilnya: ekosistemnya meledak. Ribuan voicebank diciptakan oleh komunitas -- suara fans, teman, karakter buatan. Seluruh alam semesta penyanyi virtual, gratis. Dan perangkat lunaknya sudah disertai Defoko (Utane Uta), suara default yang dihasilkan melalui mesin TTS AquesTalk, jadi kamu bisa mulai bahkan tanpa mikrofon.


oto.ini: jantung sistem

Bagaimana UTAU tahu di mana memotong dan menempel suara? Melalui file konfigurasi per voicebank: oto.ini. Untuk setiap WAV, ia menentukan titik potong (dalam milidetik):

  • Offset → hening yang harus dibuang di awal
  • Preutterance → titik di mana konsonan beralih ke vokal (batas "s"→"a" dalam "sa")
  • Overlap → seberapa banyak not sebelumnya tumpang tindih dengan yang ini
  • Fixed region → bagian yang TIDAK boleh diregangkan pada not panjang (biasanya konsonan)
  • Cutoff → di mana memotong bagian akhir

Preutterance adalah parameter paling cerdas. Satu suku kata selalu memiliki sebagian konsonan sebelum vokal. Agar not jatuh tepat pada ketukan, vokal yang harus jatuh tepat, bukan konsonan. Jadi UTAU menggeser sampel ke belakang: "a" dari "sa" mendarat tepat di ketukan, "s" meluber sedikit sebelumnya. Seperti drummer yang mengantisipasi pukulannya agar suara jatuh tepat -- cuma di sini ada di dalam .ini.

Secara visual, pada sampel "ka", area oto.ini terpotong seperti ini:

mermaid diagram

Batas antara konsonan dan vokal adalah preutterance. Vokal adalah zona yang diregangkan untuk not panjang; konsonan tetap utuh, jika tidak "k"-mu akan berdurasi dua detik dan terdengar mengerikan.

# oto.ini (disederhanakan)
# file=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

Lima nilai per suara, pada semua sampelmu, dan UTAU merakit kata apa pun dengan rapi.


CV, VCV, CVVC: perlombaan menuju realisme

Mode dasar, CV (Konsonan-Vokal), adalah satu suara per suku kata. Sederhana tapi agak robotik: sambungan antarsuku kata kasar.

Pada 2010 komunitas menemukan VCV (Vokal-Konsonan-Vokal). Alih-alih merekam "ka" saja, kamu merekam "a ka" -- dengan ekor vokal sebelumnya. Transisinya menjadi alami karena ada dalam rekaman, bukan dihitung setelahnya.

Detail yang menarik: VOCALOID tidak memiliki VCV sebelum VOCALOID3, pada 2011. Freeware dalam VB6 yang dikode oleh satu orang sendirian mendahului Yamaha satu tahun dalam hal realisme transisi. Komunitas fans lebih cepat daripada perusahaan multinasional.

Setelah itu muncullah CVVC, ARPAsing (Inggris), VCCV... setiap metode mendorong realisme lebih jauh, semuanya ditemukan dan didokumentasikan oleh komunitas.


Pipeline lengkap: bagaimana kata menjadi suara

Saat kamu menempatkan not dan mengetik lirik, inilah yang terjadi di belakang layar:

mermaid diagram

Resampler adalah komponen utamanya: ia mengambil sampel "ka"-mu yang direkam pada pitch tertentu dan meregangkan/mengubah pitch-nya agar sesuai dengan not yang diinginkan -- hanya meregangkan zona yang bisa diregang dan menjaga konsonan tetap utuh (dari situlah oto.ini berasal).

Dan ia bersifat modular. UTAU hadir dengan resampler bawaan, tetapi komunitas menciptakan yang lain (moresampler, TIPS...), masing-masing dengan karakter suaranya sendiri. Kamu bisa mengganti mesin sintesis seperti plugin. Di tahun 2008. Pada freeware.


Kekacauan di balik kap mesin (dan kenapa ini menggemaskan)

Harus jujur soal kondisi teknis benda ini:

  • Dikode dalam Visual Basic 6. Bahasa yang sudah mati di tahun 2008. Perlu runtime VB6 untuk menjalankannya.
  • Awalnya Windows only (porting Mac, UTAU-Synth, baru hadir di 2011).
  • Encoding Shift-JIS wajib. Jika file-mu tidak di-encode dalam Shift-JIS Jepang, UTAU tidak mengerti apa pun. Bahkan sampai sekarang sering harus mengatur PC ke locale Jepang atau menggunakan AppLocale untuk menjalankannya.
  • Antarmuka ala kadarnya, dokumentasi hampir 100% bahasa Jepang pada masanya.

Dan tetap saja. Tetap saja benda ini menciptakan gerakan global. Puluhan ribu voicebank. Lagu yang didengarkan jutaan kali.

Contoh terbaik: Kasane Teto. Karakter yang diciptakan pada 2008 dan diluncurkan sebagai lelucon 1 April, berpura-pura menjadi VOCALOID. Itu cuma bercanda. Tapi orang-orang menyukai karakter tersebut, voicebank UTAU asli dibuat setelahnya, dan Teto menjadi salah satu penyanyi virtual paling terkenal di dunia. Pada 2023 ia bahkan mendapatkan suara Synthesizer V resmi. Karakter yang lahir dari lelucon April Mop pada perangkat lunak gratis.


Kenapa ini masih berarti

UTAU adalah contoh sempurna dari teknologi "miskin" yang menang karena keterbukaan.

VOCALOID secara teknis lebih unggul, lebih didanai, lebih pro. Tapi tertutup. UTAU dibuat seadanya, jelek, dalam VB6 -- tapi ia membiarkan semua orang berpartisipasi. Membuat suara, membuat resampler, membuat plugin, membuat metode perekaman. Komunitas melakukan sisanya.

Dan konsepnya masih bertahan sepenuhnya hingga hari ini. OpenUtau, penerus open-source modern, mengambil ide tersebut dan membersihkannya (multi-platform, UTF-8, dukungan resampler modern DAN AI). Sintesis konkatenatif masih bertahan di samping model deep learning, karena ia memiliki sesuatu yang tidak dimiliki model-model itu: kamu mengerti persis apa yang terjadi, dan kamu mengontrol setiap milidetik.

Itulah yang selalu aku suka dari UTAU. Kamu melihat persis apa yang terjadi. Ini bukan AI yang memuntahkan sesuatu yang ajaib yang tidak kamu pahami: kamu punya WAV-mu, titik potongmu, dan kaulah yang memutuskan segalanya. Ketika suaranya jelek, kamu tahu kenapa dan kamu bisa memperbaikinya. Aku suka kendali semacam itu.


3 Hal yang perlu diingat:

  1. Sintesis konkatenatif = puzzle suara -- UTAU menempelkan sampel WAV kecil bersama untuk membentuk kata. oto.ini menentukan di mana memotong dan menempel setiap suara. Kamu mengontrol semuanya, hingga milidetik, tanpa kotak hitam.

  2. Keterbukaan mengalahkan teknik -- VOCALOID lebih baik tapi tertutup. UTAU dibuat seadanya tapi membiarkan semua orang membuat suaranya sendiri. Komunitas meledakkan ekosistem, dan bahkan mendahului Yamaha dalam VCV.

  3. Ide bagus bertahan lebih lama dari kodenya -- VB6, Shift-JIS, Windows only... dan tetap saja konsepnya masih berjalan melalui OpenUtau. Teknologi hebat bisa dikode dengan cara yang amburadul.

Sejujurnya, hanya untuk Kasane Teto yang lahir dari lelucon April Mop, perangkat lunak ini layak dihormati xD

UTAU : कैसे Visual Basic 6 के एक सॉफ़्टवेयर ने सिंथेटिक आवाज़ को लोकतांत्रिक बनाया

कैसे UTAU, 2008 का एक मुफ़्त VB6 सॉफ़्टवेयर, ने हर किसी को कॉन्केटेनेटिव सिंथेसिस से गायी हुई आवाज़ें बनाने दिया -- और यह आज भी क्यों मायने रखता है।

UTAU : कैसे Visual Basic 6 के एक सॉफ़्टवेयर ने सिंथेटिक आवाज़ को लोकतांत्रिक बनाया

इसका जिक्र मैंने अपने मुख्य पेज पर किया था : मुझे UTAU पसंद है। चलिए बताता हूँ क्यों।

2008 में, अगर तुम किसी सिंथेटिक आवाज़ को गवाना चाहते थे, तो एक ही विकल्प था : VOCALOID। Yamaha का सॉफ़्टवेयर। महँगा, बंद, सरकारी आवाज़ों के साथ जो तुम खुद नहीं बना सकते थे।

और फिर एक जापानी लड़का, Ameya/Ayame, ने अपने कोने में कुछ बनाकर छोड़ दिया। Visual Basic 6 में कोड किया गया एक सॉफ़्टवेयर। मुफ़्त। जो तुम्हें अपनी खुद की आवाज़ बनाने देता था... उन WAV फ़ाइलों से जो तुम खुद रिकॉर्ड करते थे।

इस चीज़ का नाम है UTAU (歌う, जापानी में "गाना")। और अपने ज़माने के लिए, यह जादू था।

मुझे हमेशा यह सॉफ़्टवेयर आकर्षक लगा। इसलिए नहीं कि यह तकनीकी रूप से साफ-सुथरा था (स्पॉयलर : असल में सोचना पड़ता था कि यह चीज़ कैसे बनाई... यह एक गड़बड़ है, मैं इस मुर्गे पर रोता हूँ), बल्कि इसलिए कि इसने वो किया जो कोई और नहीं कर रहा था : इसने वॉइस सिंथेसिस को आम जनता को दे दिया। मतलब तुम, मैं, कोई भी जिसके पास माइक हो।

मुझे समझाने दो कि यह शानदार क्यों था।


पहले, गायन संश्लेषण मुश्किल क्यों है

गायी हुई आवाज़ सिर्फ नोट नहीं है। इसमें व्यंजन जो हमला करता है, स्वर जो टिकता है, साँस, दोनों के बीच के संक्रमण होते हैं। "सलाम" का "स" एक फुसफुसाता "स" है जो खुले "आ" की ओर खिसकता है, और यह खिसकाव ही है जो इंसानी या नहीं लगता है।

आज यह डीप लर्निंग से हल हो जाता है : तुम गायन के घंटों पर एक मॉडल train करते हो और वह आवाज़ जनरेट करता है (Synthesizer V, DiffSinger)। लेकिन यह 2020+ की बात है। 2008 में कुछ नहीं था।

UTAU पुराने, ज़्यादा चालाक तरीके का उपयोग करता है : कॉन्केटेनेटिव सिंथेसिस।


कॉन्केटेनेटिव सिंथेसिस : आवाज़ के टुकड़ों की कॉपी-पेस्ट

यह विचार बेहद सरल है : तुम आवाज़ के छोटे-छोटे टुकड़े रिकॉर्ड करते हो और उन्हें शब्द बनाने के लिए जोड़ते हो। "सलाम" = नमूना "स" + "ला" + "म", जोड़े गए। एक शीट म्यूज़िक द्वारा संचालित ध्वनि पहेली।

यह YouTube Poop के सिद्धांत जैसा है जहाँ किसी किरदार के शब्दों को काट-काटकर उससे कुछ भी बुलवाया जाता है -- सिवाय इसके कि यहाँ यह व्यवस्थित और स्वचालित है।

और UTAU सचमुच यहीं से आया है। इससे पहले "Jinriki Vocaloid" (人力ボーカロイド, "मैनुअल Vocaloid") मौजूद था : लोग हाथ से वोकल ट्रैक काटते थे, फोनीम निकालते थे, उन्हें रीपिच करते थे, और VOCALOID आवाज़ की नकल करने के लिए सब कुछ ऑडियो एडिटर में फिर से जोड़ते थे। हाथ से। सोचो कितना काम।

Ameya ने इस परेशानी को देखा और इसे स्वचालित करने का टूल कोड किया। मूल रूप से UTAU सिर्फ यही था : मैनुअल Vocaloid के लिए एक सहायक।


यह क्रांतिकारी क्यों था : तुम आवाज़ बनाते हो

यह वो चीज़ है जो सब कुछ बदल देती है।

VOCALOID में, तुम एक आवाज़ खरीदते थे। Miku, Luka, वगैरह। प्रोफ़ेशनल्स द्वारा बनाई गई, Yamaha द्वारा बेची गई। खुद बनाने का कोई तरीका नहीं। UTAU, कोई भी अपनी आवाज़ रिकॉर्ड कर सकता है और उसे एक गाने वाला वाद्य बना सकता है।

CV मोड (सबसे सरल) है : तुम जापानी के ~100 बुनियादी सिलेबल ("a", "ka", "sa", "ta"...), रिकॉर्ड करते हो, कटिंग पॉइंट कॉन्फ़िगर करते हो, और तुम्हारी voicebank तैयार। कुछ घंटों का काम।

नतीजा : इकोसिस्टम फट गया। हजारों voicebanks समुदाय द्वारा बनाई गई -- प्रशंसकों की आवाज़ें, दोस्तों की, काल्पनिक किरदारों की। वर्चुअल गायकों का एक पूरा ब्रह्मांड, मुफ़्त। और सॉफ़्टवेयर Defoko (Utane Uta) के साथ आता था, AquesTalk TTS इंजन द्वारा जनरेट की गई एक डिफ़ॉल्ट आवाज़, ताकि तुम बिना माइक के भी शुरू कर सकते थे।


oto.ini : सिस्टम का दिल

UTAU कैसे जानता है कि आवाज़ों को कहाँ काटना और जोड़ना है ? एक कॉन्फ़िग फ़ाइल के ज़रिए प्रति voicebank : oto.ini। हर WAV के लिए, यह कटिंग पॉइंट (मिलीसेकंड में) परिभाषित करता है :

  • Offset → शुरू में हटाने के लिए साइलेंस
  • Preutterance → वह बिंदु जहाँ व्यंजन स्वर में बदलता है (सीमा "s"→"a" "sa" में)
  • Overlap → पिछला नोट इस पर कितना ओवरलैप करता है
  • Fixed region → वह हिस्सा जो लंबे नोट पर खिंचना नहीं चाहिए (आमतौर पर व्यंजन)
  • Cutoff → अंत कहाँ काटना है

Preutterance सबसे चालाक पैरामीटर है। एक सिलेबल में हमेशा स्वर से पहले कुछ व्यंजन होता है। ताकि तुम्हारा नोट समय पर गिरे, स्वर को सही समय पर गिरना चाहिए, व्यंजन नहीं। इसलिए UTAU नमूने को पीछे खिसका देता है : "sa" का "a" समय पर गिरता है, "s" ठीक पहले फैलता है। जैसे कोई ड्रमर अपनी स्ट्राइक का अनुमान लगाता है ताकि आवाज़ सही समय पर गिरे -- सिवाय इसके कि यहाँ यह एक .ini में है।

दृश्य रूप से, नमूना "ka" पर, oto.ini के ज़ोन इस तरह कटते हैं :

mermaid diagram

व्यंजन और स्वर के बीच की सीमा, यही preutterance है। स्वर वह ज़ोन है जिसे लंबे नोटों के लिए खींचा जाता है ; व्यंजन बरकरार रहता है, नहीं तो तुम्हारा "k" दो सेकंड चलेगा और भयानक लगेगा।

# oto.ini (सरलीकृत)
# फ़ाइल=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

पाँच मान प्रति ध्वनि, सभी नमूनों पर, और UTAU किसी भी शब्द को सही ढंग से जोड़ता है।


CV, VCV, CVVC : यथार्थवाद की दौड़

बेसिक मोड, CV (Consonne-Voyelle / व्यंजन-स्वर), एक ध्वनि प्रति सिलेबल है। सरल लेकिन थोड़ा रोबोटिक : सिलेबल्स के बीच के जोड़ कच्चे हैं।

2010 में समुदाय ने VCV (Voyelle-Consonne-Voyelle / स्वर-व्यंजन-स्वर) का आविष्कार किया। अकेला "ka" रिकॉर्ड करने के बजाय, तुम "a ka" रिकॉर्ड करते हो -- पिछले स्वर की पूँछ के साथ। संक्रमण प्राकृतिक हो जाता है क्योंकि यह रिकॉर्डिंग के अंदर है, बाद में गणना नहीं की गई।

दिलचस्प बात : VOCALOID के पास VOCALOID3 (2011) से पहले VCV नहीं था। VB6 में एक अकेले आदमी द्वारा कोड किया गया फ्रीवेयर Yamaha को संक्रमण के यथार्थवाद में एक साल से पिछाड़ गया। बहुराष्ट्रीय कंपनी से तेज़ प्रशंसकों का समुदाय।

फिर आए CVVC, ARPAsing (अंग्रेज़ी), VCCV... हर तरीका यथार्थवाद को और आगे ले गया, सभी समुदाय द्वारा आविष्कृत और प्रलेखित।


पूरी पाइपलाइन : एक शब्द कैसे ध्वनि बनता है

जब तुम एक नोट रखते हो और बोल टाइप करते हो, तो पर्दे के पीछे यह होता है :

mermaid diagram

Resampler मुख्य घटक है : वह तुम्हारा "ka" नमूना लेता है जो एक निश्चित पिच पर रिकॉर्ड किया गया है और उसे वांछित नोट से मिलाने के लिए फिर से खींचता/रीपिच करता है -- केवल खिंचने योग्य ज़ोन को खींचता है और व्यंजन को बरकरार रखता है (इसलिए oto.ini)।

और यह मॉड्युलर है। UTAU एक बेसिक resampler के साथ आता था, लेकिन समुदाय ने और बनाए (moresampler, TIPS...), हर एक की अपनी ध्वनि विशेषता। तुम सिंथेसिस इंजन को प्लगइन की तरह बदल सकते थे। 2008 में। एक फ्रीवेयर पर।


हुड के नीचे की गड़बड़ (और यह प्यारा क्यों है)

चीज़ की तकनीकी स्थिति के बारे में ईमानदार होना होगा :

  • Visual Basic 6 में कोडित। 2008 में पहले से मरा हुआ भाषा। इसे चलाने के लिए VB6 रनटाइम चाहिए।
  • मूल रूप से केवल Windows (Mac पोर्ट, UTAU-Synth, 2011 में आया)।
  • Shift-JIS एन्कोडिंग अनिवार्य। अगर तुम्हारी फ़ाइलें जापानी Shift-JIS में एन्कोडेड नहीं हैं, UTAU कुछ नहीं समझता। आज भी अक्सर अपना PC जापानी लोकल में डालना या AppLocale का उपयोग करना पड़ता है।
  • बेहद सादा इंटरफ़ेस, उस समय लगभग 100% जापानी में डॉक्यूमेंटेशन।

और फिर भी। फिर भी इस चीज़ ने एक वैश्विक आंदोलन बनाया। हज़ारों voicebanks। लाखों बार सुने गए गाने।

सबसे अच्छा उदाहरण : Kasane Teto। 2008 में बनाया गया एक किरदार और 1 अप्रैल के मज़ाक के रूप में डाला गया, VOCALOID होने का नाटक करते हुए। यह एक मज़ाक था। सिवाय इसके कि लोगों को किरदार पसंद आया, एक असली UTAU voicebank पीछे बनाई गई, और Teto दुनिया की सबसे मशहूर वर्चुअल गायिकाओं में से एक बन गई। 2023 में उसे एक सरकारी Synthesizer V आवाज़ भी मिली। एक किरदार जो एक फ्रीवेयर पर अप्रैल फूल के मज़ाक से पैदा हुआ।


यह आज भी क्यों मायने रखता है

UTAU एक "गरीब" तकनीक का सही उदाहरण है जो खुलेपन से जीतती है।

VOCALOID तकनीकी रूप से बेहतर था, बेहतर वित्तपोषित, ज़्यादा प्रोफ़ेशनल। लेकिन बंद। UTAU अस्थायी था, बदसूरत, VB6 में -- लेकिन इसमें हर कोई भाग ले सकता था। आवाज़ें बनाओ, resamplers बनाओ, प्लगइन्स बनाओ, रिकॉर्डिंग के तरीके बनाओ। समुदाय ने बाकी किया।

और यह अवधारणा आज भी पूरी तरह से जीवित है। OpenUtau, एक आधुनिक ओपन-सोर्स उत्तराधिकारी, विचार को लेता है और उसे धूल झाड़ता है (मल्टी-प्लेटफ़ॉर्म, UTF-8, आधुनिक resamplers और AI का समर्थन)। कॉन्केटेनेटिव सिंथेसिस आज भी डीप लर्निंग मॉडल के बगल में खड़ा है, क्योंकि इसमें वह चीज़ है जो उनमें नहीं : तुम ठीक-ठीक समझते हो क्या हो रहा है, और तुम हर मिलीसेकंड को नियंत्रित करते हो।

यही वो चीज़ है जो मुझे UTAU में हमेशा पसंद आई है। तुम ठीक-ठीक देखते हो क्या हो रहा है। यह कोई AI नहीं जो तुम्हें कोई जादुई चीज़ उगल दे जो तुम समझते नहीं : तुम्हारे पास तुम्हारे WAV, तुम्हारे कटिंग पॉइंट हैं, और तुम ही सब कुछ तय करते हो। जब यह बुरा लगता है, तुम जानते हो क्यों और तुम सुधार सकते हो। मुझे इस तरह का नियंत्रण पसंद है।


याद रखने लायक 3 बातें :

  1. कॉन्केटेनेटिव सिंथेसिस = आवाज़ की पहेली -- UTAU शब्द बनाने के लिए छोटे WAV नमूनों को जोड़ता है। oto.ini परिभाषित करता है कि हर ध्वनि को कहाँ काटना और जोड़ना है। तुम सब कुछ मिलीसेकंड में नियंत्रित करते हो, बिना किसी ब्लैक बॉक्स के।

  2. खुलापन तकनीक को हराता है -- VOCALOID बेहतर था लेकिन बंद था। UTAU अस्थायी था लेकिन हर किसी को अपनी आवाज़ें बनाने देता था। समुदाय ने इकोसिस्टम को विस्फोटित कर दिया, और VCV पर Yamaha को भी पिछाड़ दिया।

  3. एक अच्छा विचार अपने कोड से बच जाता है -- VB6, Shift-JIS, केवल Windows... और फिर भी अवधारणा OpenUtau के ज़रिए आज भी चलती है। एक शानदार तकनीक पैरों से कोड की जा सकती है।

ईमानदारी से, सिर्फ Kasane Teto के लिए जो अप्रैल फूल से पैदा हुई, यह सॉफ़्टवेयर सम्मान का हकदार है xD

UTAU : كيف أضفى برنامج بلغة Visual Basic 6 الطابع الديمقراطي على الصوت الاصطناعي

كيف سمح UTAU، وهو برنامج مجاني بلغة VB6 من عام 2008، لأي شخص بإنشاء أصوات غنائية عبر التركيب التجميعي -- ولماذا لا يزال مهمًا حتى اليوم.

UTAU : كيف أضفى برنامج بلغة Visual Basic 6 الطابع الديمقراطي على الصوت الاصطناعي

لقد أشرت إليه في صفحتي الرئيسية: أنا أحب UTAU. إليكم السبب.

في عام 2008، إذا أردت جعل صوت اصطناعي يغني، كان لديك خيار واحد : VOCALOID. برنامج Yamaha. مكلف، مغلق، بأصوات رسمية لم يكن بإمكانك إنشاؤها بنفسك.

ثم جاء رجل ياباني، Ameya/Ayame، وأصدر شيئًا في زاويته الخاصة. برنامج كُتب بلغة Visual Basic 6. مجاني. يتيح لك إنشاء صوتك الخاص باستخدام... ملفات WAV تسجلها بنفسك.

هذا الشيء اسمه UTAU (歌う، "يغني" باليابانية). وبالنسبة لعصره، كان سحرًا.

لطالما وجدت هذا البرنامج رائعًا. ليس لأنه كان نظيفًا تقنيًا (تنبيه : في الحقيقة، كان عليك حقًا التفكير في إنشاء هذا الشيء يا إلهي... إنها فوضى جميلة)، ولكن لأنه فعل شيئًا لم يفعله أي شخص آخر : لقد جعل التركيب الصوتي في متناول الجمهور العام. أعني أنت، أنا، أي شخص لديه ميكروفون.

دعني أشرح لك لماذا كان هذا رائعًا.


أولاً، لماذا تركيب الغناء صعب

الصوت الغنائي ليس مجرد نوتات. لديك الحرف الساكن الذي يبدأ، والحرف المتحرك الذي يستمر، والتنفس، والانتقالات بينهما. كلمة "sa" في "salut" هي حرف "s" يصفر ثم ينزلق نحو "a" مفتوح، وهذا الانزلاق هو ما يجعل الصوت بشريًا أم لا.

اليوم نحل هذا بالتعلم العميق : تدرب نموذجًا على ساعات من الغناء فيولد الصوت (Synthesizer V, DiffSinger). لكن هذا كان 2020+. في 2008، لا شيء.

يستخدم UTAU الطريقة الأقدم والأكثر ذكاءً : التركيب التجميعي.


التركيب التجميعي : قص ولصق أجزاء الصوت

الفكرة بسيطة جدًا : تسجل أجزاء صغيرة من الصوت وتلصقها معًا لتكوين كلمات. "salut" = عينة "sa" + "lu" + "to" متسلسلة. أحجية صوتية تقودها نوتة موسيقية.

هذا هو مبدأ YouTube Poop حيث يتم تقطيع كلمات شخصية ما لجعلها تقول أي شيء -- إلا أن الأمر هنا منظم ومؤتمت.

وUTAU جاء حرفيًا من هنا. قبله كان هناك "Jinriki Vocaloid" (人力ボーカロイド، "Vocaloid يدوي") : حيث كان الناس يقطعون المقاطع الصوتية يدويًا، يستخرجون الفونيمات، يعدلون الطبقة الصوتية، ويعيدون تجميع الكل في محرر صوتي لتقليد صوت VOCALOID. يدويًا. تخيل ذلك العمل.

رأى Ameya هذه المعاناة وكتب الأداة لأتمتتها. في الأساس، كان UTAU مجرد ذلك : مساعد لـ Vocaloid اليدوي.


لماذا كان ثوريًا : أنت من تصنع الصوت

هذا هو الشيء الذي يغير كل شيء.

في VOCALOID، كنت تشتري صوتًا. Miku، Luka، إلخ. صممها محترفون، تباع بواسطة Yamaha. لا يمكنك صنع واحد بنفسك. أما في UTAU، أي شخص يمكنه تسجيل صوته وجعله آلة غنائية.

وضع CV (الأبسط) : تسجل الـ ~100 مقطع أساسي من اليابانية ("a"، "ka"، "sa"، "ta"...)، تضبط نقاط القطع، وفويلا لديك voicebank. بضع ساعات عمل.

النتيجة : انفجر النظام البيئي. الآلاف من voicebanks أنشأها المجتمع -- أصوات معجبين، أصدقاء، شخصيات مخترعة. عالم كامل من المطربين الافتراضيين، مجانًا. وكان البرنامج يأتي مع Defoko (Utane Uta)، صوت افتراضي يُولد عبر محرك TTS AquesTalk، لذا يمكنك البدء حتى بدون ميكروفون.


oto.ini : قلب النظام

كيف يعرف UTAU أين يقطع ويلصق الأصوات؟ عبر ملف إعداد لكل voicebank : oto.ini. لكل ملف WAV، يحدد نقاط القطع (بالمللي ثانية) :

  • Offset → الصمت الذي يجب إزالته في البداية
  • Preutterance → النقطة التي ينتقل فيها الحرف الساكن إلى الحرف المتحرك (الحدود "s"←"a" في "sa")
  • Overlap → مقدار تداخل النوتة السابقة مع هذه النوتة
  • Fixed region → الجزء الذي يجب ألا يُمدد على نوتة طويلة (عادة الحرف الساكن)
  • Cutoff → أين يُقطع النهاية

Preutterance هي المعلمة الأكثر ذكاءً. المقطع دائمًا يحتوي على جزء من الحرف الساكن قبل الحرف المتحرك. لكي تقع نوتتك على الزمن، يجب أن يقع الحرف المتحرك بالضبط، وليس الحرف الساكن. لذلك يزاح UTAU العينة للخلف : حرف "a" من "sa" يصل على الزمن، بينما "s" يسبقه قليلاً. مثل عازف طبول يستعد لضربته لكي يصدر الصوت في الوقت المناسب -- لكن الفرق أن هذا في ملف .ini.

بصريًا، على عينة "ka"، تُقطع مناطق oto.ini بهذا الشكل :

mermaid diagram

الحدود بين الحرف الساكن والمتحرك هي preutterance. الحرف المتحرك هو المنطقة التي تُمدد للنوتات الطويلة؛ الحرف الساكن يبقى سليمًا، وإلا فإن حرف "k" سيستمر لثانيتين وسيبدو فظيعًا.

# oto.ini (مبسط)
# ملف=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

خمس قيم لكل صوت، على جميع عيناتك، وUTAU يجمع أي كلمة بشكل صحيح.


CV، VCV، CVVC : السباق نحو الواقعية

الوضع الأساسي، CV (حرف ساكن-متحرك Consonne-Voyelle)، هو صوت واحد لكل مقطع. بسيط لكنه آلي بعض الشيء : الوصلات بين المقاطع خشنة.

في 2010 اخترع المجتمع VCV (حرف متحرك-ساكن-متحرك Voyelle-Consonne-Voyelle). بدلاً من تسجيل "ka" بمفردها، تسجل "a ka" -- مع ذيل الحرف المتحرك السابق. يصبح الانتقال طبيعيًا لأنه داخل التسجيل، وليس محسوبًا بعد القص.

التفصيل اللافت : VOCALOID لم يحصل على VCV قبل VOCALOID3 في 2011. البرنامج المجاني بلغة VB6 الذي كتبه شخص بمفرده سبق Yamaha بعام كامل في واقعية الانتقالات. مجتمع من المعجبين أسرع من شركة متعددة الجنسيات.

ثم جاء CVVC، ARPAsing (للإنجليزية)، VCCV... كل طريقة تدفع الواقعية أبعد، جميعها اخترعت ووثقت من قبل المجتمع.


المسار الكامل : كيف تتحول الكلمة إلى صوت

عندما تضع نوتة وتكتب كلمة، إليك ما يحدث في الكواليس :

mermaid diagram

Resampler هو القطعة الأساسية : يأخذ عينتك "ka" المسجلة عند طبقة معينة ويمدد/يغير طبقتها لتطابق النوتة المطلوبة -- ممددًا فقط المنطقة القابلة للمد مع إبقاء الحرف الساكن سليمًا (من هنا يأتي oto.ini).

وهو معياري. أتى UTAU مع resampler أساسي، لكن المجتمع ابتكر آخرين (moresampler، TIPS...)، كل منها بصوته الخاص. كنت تغير محرك التركيب مثل إضافة Plugin. في 2008. على برنامج مجاني.


الفوضى تحت الغطاء (ولماذا هي محببة)

يجب أن نكون صادقين بشأن الحالة التقنية لهذا الشيء :

  • مكتوب بلغة Visual Basic 6. لغة كانت ميتة حتى في 2008. يتطلب تشغيل VB6 runtime.
  • لنظام Windows فقط في الأساس (إصدار Mac، UTAU-Synth، جاء في 2011).
  • ترميز Shift-JIS إلزامي. إذا كانت ملفاتك غير مشفرة بـ Shift-JIS الياباني، UTAU لا يفهم شيئًا. حتى اليوم يجب غالبًا ضبط جهاز الكمبيوتر على اللغة اليابانية أو استخدام AppLocale لتشغيله.
  • واجهة زاهدة، وثائق 100% تقريبًا باليابانية في ذلك الوقت.

ومع ذلك. ورغم هذا، خلق هذا الشيء حركة عالمية. عشرات الآلاف من voicebanks. أغانٍ استمع إليها الملايين.

أفضل مثال : Kasane Teto. شخصية أنشئت في 2008 وأطلقت كخدعة كذبة أبريل، متظاهرة بأنها VOCALOID. كانت مزحة. لكن الناس أحبوا الشخصية، وتم إنشاء voicebank حقيقي لـ UTAU فيما بعد، وأصبحت Teto واحدة من أشهر المطربات الافتراضيات في العالم. في 2023 حصلت حتى على صوت Synthesizer V رسمي. شخصية ولدت من كذبة أبريل على برنامج مجاني.


لماذا لا يزال مهمًا

UTAU هو المثال المثالي لتقنية "فقيرة" تربح بالانفتاح.

VOCALOID كان متفوقًا تقنيًا، أفضل تمويلًا، أكثر احترافية. لكنه مغلق. UTAU كان مرقعًا، قبيحًا، بلغة VB6 -- لكنه سمح للجميع بالمشاركة. إنشاء أصوات، إنشاء resamplers، إنشاء إضافات، إنشاء طرق تسجيل. المجتمع فعل الباقي.

والمفهوم لا يزال حيًا تمامًا اليوم. OpenUtau، الخلف مفتوح المصدر الحديث، يأخذ الفكرة وينفض عنها الغبار (متعدد المنصات، UTF-8، دعم resamplers الحديثة والذكاء الاصطناعي). التركيب التجميعي لا يزال صامدًا بجانب نماذج التعلم العميق، لأنه يمتلك شيئًا لا تملكه : أنت تفهم بالضبط ما يحدث، وتتحكم بكل مللي ثانية.

هذا ما أعجبني دائمًا في UTAU. ترى بالضبط ما يحدث. ليس ذكاء اصطناعي يبصق لك شيئًا سحريًا لا تفهمه : لديك ملفات WAV، نقاط القطع، وأنت من يقرر كل شيء. عندما يبدو الصوت سيئًا، تعرف السبب ويمكنك التصحيح. أحب هذا النوع من التحكم.


3 أشياء يجب تذكرها :

  1. التركيب التجميعي = أحجية صوت -- UTAU يلصق عينات WAV صغيرة معًا لتكوين كلمات. oto.ini يحدد أين يقطع ويلصق كل صوت. تتحكم بكل شيء، بدقة المللي ثانية، دون صندوق أسود.

  2. الانفتاح يهزم التقنية -- VOCALOID كان أفضل لكنه مغلق. UTAU كان مرقعًا لكنه سمح للجميع بإنشاء أصواتهم. المجتمع فجر النظام البيئي، بل وسبق Yamaha في VCV.

  3. الفكرة الجيدة تنجو من شفرتها -- VB6، Shift-JIS، Windows فقط... ومع ذلك المفهوم لا يزال يعمل عبر OpenUtau. تقنية رائعة يمكن كتابتها بأرجل.

بصراحة، فقط من أجل Kasane Teto التي ولدت من كذبة أبريل، هذا البرنامج يستحق الاحترام xD

UTAU : cách một phần mềm Visual Basic 6 đã dân chủ hóa giọng hát tổng hợp

UTAU, một phần mềm miễn phí viết bằng VB6 ra mắt năm 2008, đã cho phép bất kỳ ai tạo giọng hát bằng tổng hợp ngưng kết -- và tại sao điều đó vẫn còn quan trọng đến ngày nay.

UTAU : cách một phần mềm Visual Basic 6 đã dân chủ hóa giọng hát tổng hợp

Tôi đã đề cập trên trang chính của mình : tôi yêu UTAU. Đây là lý do.

Năm 2008, nếu bạn muốn tạo giọng hát tổng hợp, bạn chỉ có một lựa chọn : VOCALOID. Phần mềm của Yamaha. Đắt tiền, độc quyền, với những giọng hát chính thức mà bạn không thể tự tạo.

Rồi một người Nhật tên Ameya/Ayame đã phát hành một thứ gì đó tự làm. Một phần mềm được viết bằng Visual Basic 6. Miễn phí. Cho phép bạn tạo giọng hát của riêng mình với... những file WAV bạn tự thu âm.

Thứ đó có tên UTAU (歌う, "hát" trong tiếng Nhật). Và ở thời điểm đó, nó thực sự kỳ diệu.

Tôi luôn thấy phần mềm này hấp dẫn. Không phải vì nó sạch sẽ về mặt kỹ thuật (spoiler : thực ra thì, phải nghĩ ra được thứ này mới tài... nó là một mớ hỗn độn đẹp đẽ, tôi khóc cho con gà này), mà vì nó đã làm được điều không ai khác làm : nó mang tổng hợp giọng nói đến với đại chúng. Ý là bạn, tôi, bất kỳ ai có một cái micro.

Để tôi giải thích tại sao nó tuyệt vời.


Trước hết, tại sao tổng hợp giọng hát lại khó

Giọng hát không chỉ là những nốt nhạc. Bạn có phụ âm tấn công, nguyên âm kéo dài, hơi thở, sự chuyển tiếp giữa chúng. Chữ "sa" trong "sao" là âm "s" xuýt xoa trượt dần sang âm "a" mở, và chính sự trượt đó làm nên âm thanh tự nhiên hay không.

Ngày nay ta giải quyết bằng deep learning : bạn huấn luyện một mô hình trên hàng giờ hát và nó sinh ra giọng hát (Synthesizer V, DiffSinger). Nhưng đó là 2020+. Năm 2008, không có gì cả.

UTAU sử dụng phương pháp cũ hơn, thông minh hơn : tổng hợp ngưng kết (concatenative synthesis).


Tổng hợp ngưng kết : ghép nối các mảnh giọng nói

Ý tưởng đơn giản đến ngây ngô : bạn thu âm những mảnh giọng nhỏ và ghép chúng lại để tạo thành từ. "sao" = mẫu "sa" + "o" nối tiếp nhau. Một trò ghép hình âm thanh điều khiển bằng bản nhạc.

Đó cũng là nguyên lý của YouTube Poop, nơi người ta cắt ghép lời của một nhân vật để bắt họ nói đủ thứ -- chỉ có điều ở đây nó có tổ chức và tự động hóa.

Và UTAU thực sự ra đời từ đó. Trước nó đã tồn tại "Jinriki Vocaloid" (人力ボーカロイド, "Vocaloid thủ công") : người ta tự tay cắt các track giọng hát, trích xuất âm vị, chỉnh cao độ, và ráp lại trong một trình chỉnh sửa âm thanh để bắt chước giọng VOCALOID. Làm bằng tay. Bạn tưởng tượng khối lượng công việc đi.

Ameya đã nhìn thấy sự vất vả đó và viết công cụ để tự động hóa nó. Ban đầu UTAU chỉ đơn giản là vậy : một trợ lý cho Vocaloid thủ công.


Tại sao nó mang tính cách mạng : BẠN tạo ra giọng hát

Đây là điểm làm nên khác biệt.

VOCALOID, bạn mua một giọng hát. Miku, Luka, v.v. Được tạo bởi chuyên gia, bán bởi Yamaha. Không cách nào tự tạo một giọng cho riêng mình. Với UTAU, bất kỳ ai cũng có thể thu âm giọng mình và biến nó thành một nhạc cụ biết hát.

Chế độ CV (đơn giản nhất) là : bạn thu âm ~100 âm tiết cơ bản của tiếng Nhật ("a", "ka", "sa", "ta"...), cấu hình các điểm cắt, và thế là bạn đã có voicebank của mình. Chỉ mất vài giờ.

Kết quả : hệ sinh thái bùng nổ. Hàng ngàn voicebank được tạo ra bởi cộng đồng -- giọng của fan, của bạn bè, của nhân vật tưởng tượng. Cả một vũ trụ ca sĩ ảo, miễn phí. Và phần mềm đi kèm với Defoko (Utane Uta), một giọng mặc định được tạo qua engine TTS AquesTalk, nên bạn có thể bắt đầu ngay cả khi không có micro.


oto.ini : trái tim của hệ thống

Làm thế nào UTAU biết cắt và ghép âm thanh ở đâu? Thông qua một file cấu hình cho mỗi voicebank : oto.ini. Với mỗi file WAV, nó định nghĩa các điểm cắt (tính bằng mili giây) :

  • Offset → khoảng lặng cần loại bỏ ở đầu
  • Preutterance → điểm mà phụ âm chuyển sang nguyên âm (ranh giới "s"→"a" trong "sa")
  • Overlap → mức độ nốt trước chồng lên nốt này
  • Fixed region → phần KHÔNG được kéo dãn khi nốt kéo dài (thường là phụ âm)
  • Cutoff → chỗ cắt ở cuối

Preutterance là tham số thông minh nhất. Một âm tiết luôn có một phần phụ âm trước nguyên âm. Để nốt nhạc rơi đúng nhịp, chính nguyên âm phải rơi đúng nhịp, không phải phụ âm. Vì vậy UTAU dịch chuyển mẫu âm thanh về phía trước : âm "a" trong "sa" rơi đúng nhịp, âm "s" chỉ chồm ra trước một chút. Giống như một tay trống đánh trước để âm thanh vang lên đúng lúc -- chỉ khác là điều này nằm trong một file .ini.

Về mặt hình ảnh, trên một mẫu "ka", các vùng trong oto.ini được cắt như sau :

mermaid diagram

Ranh giới giữa phụ âm và nguyên âm là preutterance. Nguyên âm là vùng được kéo dãn cho các nốt dài ; phụ âm giữ nguyên, nếu không âm "k" của bạn sẽ kéo dài hai giây và nghe rất khủng khiếp.

# oto.ini (simplifié)
# fichier=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

Năm giá trị cho mỗi âm thanh, trên tất cả các mẫu của bạn, và UTAU ghép bất kỳ từ nào một cách chính xác.


CV, VCV, CVVC : cuộc đua tìm tính chân thực

Chế độ cơ bản, CV (Consonne-Voyelle), là một âm thanh cho mỗi âm tiết. Đơn giản nhưng hơi robot : các điểm nối giữa các âm tiết khá thô.

Năm 2010, cộng đồng phát minh ra VCV (Voyelle-Consonne-Voyelle). Thay vì thu âm "ka" đơn lẻ, bạn thu âm "a ka" -- với phần đuôi của nguyên âm trước. Sự chuyển tiếp trở nên tự nhiên vì nó nằm trong bản ghi âm, không phải tính toán sau đó.

Chi tiết đau đớn : VOCALOID đã không có VCV cho đến VOCALOID3, năm 2011. Phần mềm freeware viết bằng VB6 do một người tự code đã vượt mặt Yamaha một năm về độ chân thực của chuyển tiếp. Một cộng đồng fan nhanh hơn cả tập đoàn đa quốc gia.

Tiếp theo là CVVC, ARPAsing (tiếng Anh), VCCV... mỗi phương pháp đẩy độ chân thực xa hơn, tất cả đều do cộng đồng phát minh và ghi chép lại.


Quy trình hoàn chỉnh : một từ trở thành âm thanh như thế nào

Khi bạn đặt một nốt nhạc và gõ lời, đây là những gì xảy ra ở hậu trường :

mermaid diagram

Resampler là trung tâm : nó lấy mẫu "ka" của bạn được thu ở một cao độ nhất định và kéo dãn/chỉnh pitch để khớp với nốt mong muốn -- chỉ kéo dãn vùng có thể kéo dãn và giữ nguyên phụ âm (đó là lý do cho oto.ini).

Và nó có tính mô-đun. UTAU đi kèm với một resampler cơ bản, nhưng cộng đồng đã tạo ra nhiều resampler khác (moresampler, TIPS...), mỗi cái có chất âm riêng. Bạn đổi engine tổng hợp như đổi plugin. Vào năm 2008. Trên một phần mềm freeware.


Mớ hỗn độn dưới nắp capo (và tại sao nó đáng yêu)

Phải thành thật về tình trạng kỹ thuật của nó :

  • Viết bằng Visual Basic 6. Một ngôn ngữ đã chết từ năm 2008. Cần runtime VB6 để chạy.
  • Ban đầu chỉ dành cho Windows (bản Mac, UTAU-Synth, ra mắt năm 2011).
  • Bắt buộc mã hóa Shift-JIS. Nếu file của bạn không được mã hóa bằng Shift-JIS tiếng Nhật, UTAU không hiểu gì cả. Cho đến ngày nay, bạn thường phải đặt locale máy tính thành tiếng Nhật hoặc dùng AppLocale để chạy nó.
  • Giao diện khô khan, tài liệu gần như 100% tiếng Nhật thời bấy giờ.

Thế mà. Thế mà thứ này đã tạo ra một phong trào toàn cầu. Hàng chục ngàn voicebank. Những bài hát được nghe hàng triệu lần.

Ví dụ điển hình nhất : Kasane Teto. Một nhân vật được tạo năm 2008 và tung ra như một trò đùa ngày Cá tháng Tư, giả làm VOCALOID. Đó là một trò đùa. Nhưng mọi người yêu thích nhân vật này, một voicebank UTAU thật đã được tạo ra sau đó, và Teto trở thành một trong những ca sĩ ảo nổi tiếng nhất thế giới. Năm 2023, cô ấy thậm chí còn được phát hành giọng Synthesizer V chính thức. Một nhân vật sinh ra từ trò đùa cá tháng tư trên một phần mềm miễn phí.


Tại sao nó vẫn còn quan trọng

UTAU là ví dụ hoàn hảo về công nghệ "nghèo" chiến thắng nhờ tính mở.

VOCALOID vượt trội về kỹ thuật, được đầu tư tốt hơn, chuyên nghiệp hơn. Nhưng đóng. UTAU thì chắp vá, xấu xí, viết bằng VB6 -- nhưng nó cho phép mọi người tham gia. Tạo giọng hát, tạo resampler, tạo plugin, tạo phương pháp thu âm. Cộng đồng đã làm phần còn lại.

Và khái niệm này vẫn tồn tại đến ngày nay. OpenUtau, một người kế nhiệm mã nguồn mở hiện đại, tiếp nối ý tưởng và làm mới nó (đa nền tảng, UTF-8, hỗ trợ resampler hiện đại VÀ AI). Tổng hợp ngưng kết vẫn đứng vững bên cạnh các mô hình deep learning, vì nó có một thứ mà chúng không có : bạn hiểu chính xác điều gì đang xảy ra, và bạn kiểm soát từng mili giây.

Đó là điều tôi luôn thích ở UTAU. Bạn thấy chính xác điều gì đang xảy ra. Nó không phải là một AI nhả ra thứ kỳ diệu mà bạn không hiểu : bạn có file WAV, các điểm cắt của bạn, và chính bạn quyết định mọi thứ. Khi nó nghe tệ, bạn biết tại sao và có thể sửa. Tôi thích kiểu kiểm soát đó.


3 điều cần nhớ :

  1. Tổng hợp ngưng kết = ghép hình giọng nói -- UTAU ghép các mẫu WAV nhỏ lại với nhau để tạo thành từ. File oto.ini định nghĩa chỗ cắt và chỗ dán cho mỗi âm thanh. Bạn kiểm soát mọi thứ, đến từng mili giây, không có hộp đen.

  2. Tính mở đánh bại kỹ thuật -- VOCALOID tốt hơn nhưng đóng. UTAU chắp vá nhưng cho phép mọi người tạo giọng hát của riêng mình. Cộng đồng đã làm bùng nổ hệ sinh thái, và thậm chí còn vượt mặt Yamaha về VCV.

  3. Một ý tưởng hay tồn tại lâu hơn code của nó -- VB6, Shift-JIS, Windows only... thế mà khái niệm vẫn chạy qua OpenUtau. Một công nghệ tuyệt vời có thể được viết bằng chân.

Thành thật mà nói, chỉ riêng vì Kasane Teto sinh ra từ trò đùa cá tháng tư, phần mềm này đã đáng được tôn trọng xD

UTAU: ซอฟต์แวร์ Visual Basic 6 ที่ทำให้เสียงสังเคราะห์เป็นของทุกคน

UTAU ซอฟต์แวร์ฟรีที่เขียนด้วย VB6 ในปี 2008 ทำให้ทุกคนสามารถสร้างเสียงร้องเพลงด้วยการสังเคราะห์แบบต่อเนื่อง -- และทำไมมันถึงยังสำคัญจนถึงทุกวันนี้

UTAU: ซอฟต์แวร์ Visual Basic 6 ที่ทำให้เสียงสังเคราะห์เป็นของทุกคน

ผมเคยพูดถึงมันไปแล้วบนหน้าเว็บหลัก: ผมชอบ UTAU นี่คือเหตุผล

ปี 2008 ถ้าคุณอยากให้เสียงสังเคราะห์ร้องเพลง คุณมีทางเลือกเดียว: VOCALOID ซอฟต์แวร์ของ Yamaha แพง เป็นลิขสิทธิ์ มีแต่เสียงทางการที่คุณสร้างเองไม่ได้

แล้วก็มีคนญี่ปุ่นคนหนึ่ง ชื่อ Ameya/Ayame ที่ปล่อยอะไรบางอย่างออกมาจากมุมห้องของเขา ซอฟต์แวร์ที่เขียนด้วย Visual Basic 6 ฟรี ให้คุณสร้างเสียงของคุณเองด้วย... ไฟล์ WAV ที่คุณอัดเอง

สิ่งนั้นชื่อ UTAU (歌う, "ร้องเพลง" ในภาษาญี่ปุ่น) และสำหรับยุคนั้น มันคือเวทมนตร์

ผมรู้สึกว่าซอฟต์แวร์นี้น่าทึ่งเสมอ ไม่ใช่เพราะมันสะอาดทางเทคนิค (สปอยล์: จริง ๆ แล้วต้องคิดหนักมากถึงจะสร้างสิ่งนี้ได้... มันเละเทะมาก ผมร้องไห้กับเจ้าไก่ตัวนี้) แต่เพราะมันทำสิ่งที่ไม่มีใครอื่นทำ: มันนำการสังเคราะห์เสียงมาสู่คนทั่วไป แบบคุณ ผม ใครก็ตามที่มีไมโครโฟน

ให้ผมอธิบายว่าทำไมมันถึงเจ๋ง


ก่อนอื่น ทำไมการสังเคราะห์เสียงร้องถึงยาก

เสียงร้องเพลงไม่ใช่แค่โน้ตดนตรี คุณมีพยัญชนะที่เริ่มต้น สระที่ยืด ลมหายใจ การเปลี่ยนผ่านระหว่างทั้งสอง "sa" ใน "สวัสดี" คือ "ส" ที่เสียดแล้วไถลไปหา "อา" ที่เปิดกว้าง และการไถลนี้แหละที่ทำให้ฟังดูเป็นมนุษย์หรือไม่

วันนี้เราใช้ deep learning แก้ปัญหา: ฝึกโมเดลกับชั่วโมงเสียงร้อง แล้วมันจะสร้างเสียงออกมา (Synthesizer V, DiffSinger) แต่นั่นคือปี 2020+ ส่วนปี 2008 ไม่มีอะไรเลย

UTAU ใช้วิธีก่อนหน้า ที่เก่ากว่าและฉลาดกว่า: การสังเคราะห์แบบต่อเนื่อง (concatenative synthesis)


การสังเคราะห์แบบต่อเนื่อง: การตัดต่อเสียงพูด

แนวคิดง่ายมาก: คุณอัดเสียงเล็ก ๆ แล้วนำมาต่อกันเป็นคำ "สวัสดี" = ตัวอย่าง "สวะ" + "สดี" ต่อกัน เป็นจิ๊กซอว์เสียงที่ควบคุมด้วยโน้ตเพลง

มันคือหลักการเดียวกับ YouTube Poop ที่ตัดคำตัวละครมาพูดอะไรก็ได้ -- แต่ที่นี่มันเป็นระบบและอัตโนมัติ

และ UTAU มาจากสิ่งนั้นโดยตรง ก่อนหน้ามันมี "Jinriki Vocaloid" (人力ボーカロイド, "Vocaloid แบบใช้มือ") : คนตัดเสียงร้องด้วยมือ แยกหน่วยเสียง ปรับระดับเสียง แล้วประกอบกลับในโปรแกรมตัดต่อเสียงเพื่อเลียนแบบเสียง VOCALOID ทำด้วยมือ คุณลองคิดดูว่ามันงานขนาดไหน

Ameya มองดูความยากลำบากนี้แล้วเขียนเครื่องมือเพื่อทำให้มันอัตโนมัติ โดยพื้นฐานแล้ว UTAU ตอนแรกเป็นแค่ตัวช่วยสำหรับ Vocaloid แบบใช้มือ


ทำไมมันถึงปฏิวัติวงการ: คุณสร้างเสียงเอง

นี่คือสิ่งที่เปลี่ยนทุกอย่าง

VOCALOID คุณซื้อเสียง Miku, Luka ฯลฯ สร้างโดยมืออาชีพ ขายโดย Yamaha ไม่มีทางสร้างเองได้ UTAU ใครก็ได้อัดเสียงตัวเองแล้วทำให้เป็นเครื่องดนตรีร้องเพลงได้

โหมด CV (แบบง่ายที่สุด) คือ: คุณอัด ~100 พยางค์พื้นฐานของภาษาญี่ปุ่น ("a", "ka", "sa", "ta"...) ตั้งค่าจุดตัด เท่านี้ก็ได้ voicebank ของคุณแล้ว ใช้เวลาไม่กี่ชั่วโมง

ผลลัพธ์: ระบบนิเวศระเบิดขึ้น มี voicebanks นับพันที่สร้างโดยชุมชน -- เสียงแฟน เพื่อน ตัวละครที่สร้างขึ้น โลกทั้งใบของนักร้องเสมือน ฟรี และซอฟต์แวร์มาพร้อม Defoko (Utane Uta) เสียงเริ่มต้นที่สร้างผ่าน TTS AquesTalk ดังนั้นคุณเริ่มได้แม้ไม่มีไมโครโฟน


oto.ini: หัวใจของระบบ

UTAU รู้ได้ยังไงว่าต้องตัดและต่อเสียงตรงไหน? ผ่านไฟล์คอนฟิกของแต่ละ voicebank: oto.ini สำหรับ WAV แต่ละไฟล์ มันกำหนดจุดตัด (ในหน่วยมิลลิวินาที):

  • Offset → ตัดความเงาที่ต้นทิ้ง
  • Preutterance → จุดที่พยัญชนะเปลี่ยนเป็นสระ (ขอบ "ส"→"อา" ใน "สา")
  • Overlap → จำนวนที่โน้ตก่อนหน้าทับซ้อนกับโน้ตนี้
  • Fixed region → ส่วนที่ห้ามยืดเมื่อเล่นโน้ตยาว (โดยปกติคือพยัญชนะ)
  • Cutoff → จุดตัดท้าย

Preutterance เป็นพารามิเตอร์ที่ฉลาดที่สุด พยางค์มักมีส่วนพยัญชนะก่อนสระ เพื่อให้โน้ตตรงจังหวะ สระ ต้องตรงจังหวะ ไม่ใช่พยัญชนะ UTAU จึงเลื่อนตัวอย่างไปข้างหลัง: "อา" ของ "สา" ลงจังหวะพอดี "ส" เลยออกมาก่อนหน้านิดหน่อย เหมือนมือกลองที่ดีดก่อนเพื่อให้เสียงตรงจังหวะ -- ต่างกันตรงที่มันอยู่ใน .ini

ในเชิงภาพ สำหรับตัวอย่าง "ka" โซนต่าง ๆ ใน oto.ini ตัดแบ่งแบบนี้:

mermaid diagram

เส้นแบ่งระหว่างพยัญชนะและสระคือ preutterance สระคือโซนที่ยืดสำหรับโน้ตยาว ส่วนพยัญชนะคงเดิม ไม่งั้น "ก" ของคุณจะยาวสองวินาทีแล้วฟังดูแย่

# oto.ini (แบบง่าย)
# ไฟล์=alias,offset,consonant,cutoff,preutterance,overlap
_ka.wav=ka,120,80,-200,90,40

ห้าค่าต่อเสียง สำหรับทุกตัวอย่างของคุณ แล้ว UTAU ก็ประกอบคำใดก็ได้อย่างถูกต้อง


CV, VCV, CVVC: การไล่ตามความสมจริง

โหมดพื้นฐาน CV (Consonant-Vowel) คือหนึ่งเสียงต่อหนึ่งพยางค์ ง่ายแต่ค่อนข้างหุ่นยนต์: รอยต่อระหว่างพยางค์หยาบ

ปี 2010 ชุมชนคิดค้น VCV (Vowel-Consonant-Vowel) แทนที่จะอัด "ka" เฉย ๆ คุณอัด "a ka" -- มีหางของสระก่อนหน้าด้วย การเปลี่ยนผ่านเป็นธรรมชาติเพราะมัน อยู่ใน เสียงที่อัด ไม่ใช่คำนวณทีหลัง

จุดที่น่าสนใจ: VOCALOID ไม่มี VCV จนกระทั่ง VOCALOID3 ในปี 2011 ซอฟต์แวร์ฟรีที่เขียน VB6 โดยคนคนเดียวเอาชนะ Yamaha ได้หนึ่งปีในเรื่องความสมจริงของการเปลี่ยนผ่าน ชุมชนแฟน ๆ เร็วกว่าบริษัทข้ามชาติ

ต่อมามี CVVC, ARPAsing (ภาษาอังกฤษ), VCCV... แต่ละวิธีผลักดันความสมจริงยิ่งขึ้นไปอีก ทั้งหมดถูกคิดค้นและบันทึกโดยชุมชน


ขั้นตอนทั้งหมด: คำกลายเป็นเสียงได้อย่างไร

เมื่อคุณวางโน้ตและพิมพ์เนื้อเพลง นี่คือสิ่งที่เกิดขึ้นเบื้องหลัง:

mermaid diagram

Resampler คือชิ้นส่วนสำคัญ: มันนำตัวอย่าง "ka" ที่อัดที่ระดับเสียงหนึ่งมายืด/ปรับระดับเสียงให้ตรงกับโน้ตที่ต้องการ -- โดยยืดเฉพาะส่วนที่ยืดได้ และคงพยัญชนะไว้เหมือนเดิม (นี่คือที่มาของ oto.ini)

และมันเป็น โมดูลาร์ UTAU มาพร้อม resampler พื้นฐาน แต่ชุมชนได้ทำเพิ่มเติม (moresampler, TIPS...) แต่ละตัวมีลายเซ็นเสียงของตัวเอง คุณเปลี่ยนเอนจินสังเคราะห์ได้เหมือนเปลี่ยนปลั๊กอิน ในปี 2008 บนซอฟต์แวร์ฟรี


ความเละเทะใต้ฝาครอบ (และทำไมมันถึงน่ารัก)

ต้องพูดตรง ๆ เกี่ยวกับสภาพเทคนิคของเจ้านี่:

  • เขียนด้วย Visual Basic 6 ภาษาที่ตายแล้วในปี 2008 ต้องใช้ runtime VB6 ถึงจะรันได้
  • Windows only ตั้งแต่แรก (พอร์ต Mac, UTAU-Synth, มาในปี 2011)
  • ต้องใช้การเข้ารหัส Shift-JIS ถ้าไฟล์ของคุณไม่ได้เข้ารหัส Shift-JIS ญี่ปุ่น UTAU จะไม่เข้าใจอะไรเลย ถึงทุกวันนี้ก็ต้องตั้งค่า locale ของ PC เป็นญี่ปุ่นหรือใช้ AppLocale เพื่อเปิด
  • หน้าตาดูเรียบ เอกสารเกือบ 100% เป็นภาษาญี่ปุ่นในยุคนั้น

และกระนั้น กระนั้นเจ้านี่ก็สร้างกระแสระดับโลก Voicebanks นับหมื่น เพลงที่ถูกฟังเป็นล้านครั้ง

ตัวอย่างที่ดีที่สุด: Kasane Teto ตัวละครที่สร้างในปี 2008 ปล่อยเป็นเรื่องหลอกวันเอพริลฟูล โดยแกล้งทำเป็น VOCALOID มันเป็นเรื่องตลก แต่คนชอบตัวละครนี้ มีการสร้าง voicebank UTAU จริงขึ้นมาภายหลัง และ Teto กลายเป็นหนึ่งในนักร้องเสมือนที่มีชื่อเสียงที่สุดในโลก ปี 2023 เธอได้มีเสียง Synthesizer V อย่างเป็นทางการด้วยซ้ำ ตัวละครที่เกิดจากเรื่องหลอกวันเอพริลฟูลบนซอฟต์แวร์ฟรี


ทำไมมันยังสำคัญ

UTAU คือตัวอย่างสมบูรณ์แบบของเทคโนโลยี "จน" ที่ชนะเพราะความเปิดกว้าง

VOCALOID เหนือกว่าทางเทคนิค ได้ทุนมากกว่า มืออาชีพกว่า แต่ปิด UTAU ลวกๆ ขี้เหร่ เขียนด้วย VB6 -- แต่มันให้ทุกคนมีส่วนร่วม สร้างเสียง สร้าง resamplers สร้างปลั๊กอิน สร้างวิธีการอัดเสียง ชุมชนทำส่วนที่เหลือ

และแนวคิดนี้ยังมีชีวิตอยู่ถึงทุกวันนี้ OpenUtau ผู้สืบทอดโอเพนซอร์สยุคใหม่ นำไอเดียเดียวกันมาปัดฝุ่น (ข้ามแพลตฟอร์ม UTF-8 รองรับ resamplers สมัยใหม่และ AI) การสังเคราะห์แบบต่อเนื่องยังยืนหยัดอยู่เคียงข้างโมเดล deep learning เพราะมันมีสิ่งที่พวกมันไม่มี: คุณเข้าใจสิ่งที่เกิดขึ้น และคุณควบคุมทุกมิลลิวินาที

นั่นคือสิ่งที่ผมชอบเกี่ยวกับ UTAU เสมอมา คุณเห็นสิ่งที่เกิดขึ้นเป๊ะ ๆ มันไม่ใช่ AI ที่พ่นสิ่งมหัศจรรย์ที่คุณไม่เข้าใจ: คุณมี WAV ของคุณ จุดตัดของคุณ และคุณเป็นคนตัดสินใจทุกอย่าง เมื่อมันฟังดูไม่ดี คุณรู้ว่าทำไมและคุณแก้ไขได้ ผมชอบการควบคุมแบบนั้น


3 เรื่องที่ควรจำ:

  1. การสังเคราะห์แบบต่อเนื่อง = จิ๊กซอว์เสียง -- UTAU ต่อตัวอย่าง WAV เล็ก ๆ เข้าด้วยกันเป็นคำ oto.ini กำหนดว่าจะตัดและต่อแต่ละเสียงตรงไหน คุณควบคุมทุกอย่าง จนถึงมิลลิวินาที ไม่มีกล่องดำ

  2. ความเปิดกว้างชนะเทคนิค -- VOCALOID ดีกว่าแต่ปิด UTAU ลวกๆแต่ให้ทุกคนสร้างเสียงของตัวเอง ชุมชนทำให้ระบบนิเวศระเบิด และยังนำหน้า Yamaha ในเรื่อง VCV

  3. ไอเดียที่ดีอยู่เหนือโค้ดของมัน -- VB6, Shift-JIS, Windows only... แต่แนวคิดยังทำงานผ่าน OpenUtau เทคโนโลยีที่เจ๋งมากสามารถเขียนด้วยภาษาที่ห่วยก็ได้

เอาจริง ๆ แค่เรื่อง Kasane Teto ที่เกิดจากเรื่องหลอกวันเอพริลฟูล ซอฟต์แวร์นี้ก็สมควรได้รับความเคารพแล้ว xD