慶應義塾大学 | Keio University / 理工学部 情報工学科
高道研究室
音声信号処理および機械学習に関する基礎的な知識の習得を進めながら、研究活動を開始しました。現在は、音素レベルにまで踏み込んだ自己音声の変換技術の実現を目指し、関連分野の先行研究や専門書籍を精読しながら知見を深めています。 具体的には、音声をスペクトログラムへ変換し、その画像をCycle-GANに入力することで、話者性を保ちつつ音声を別のスタイルへと変換する手法に注目しています。このCycle-GANベースの手法は、循環性損失(cycle-consistency loss)を活用することで、変換後の音声が元の話者の特徴を保持できる点において一定の効果を上げていますが、その変換精度や自然さの面で改善の余地もあると感じています。 そこで私は、より精緻な音素レベルでの変換や、言語学的特徴との整合性を高めるために、話者特徴抽出・音素アライメント・音声生成の各段階における改良点を検討しています。将来的には、これらの技術を融合させることで、例えば外国語の発音矯正など実用的な応用にも耐えうる、自然かつ正確な音声変換モデルの構築を目指しています。 現在の段階ではまだ実装フェーズには至っていませんが、理論的な枠組みを明確化しつつ、どの手法が既存の技術を超える可能性を持つかについて、定量的な検討を進めている段階です。短期間ながらも、自主的に学びながら研究の土台を築いており、今後の実験や論文化に向けて着実に歩を進めています。