Kana & Mari’s SoundRepos podcast artwork

PODCAST · technology

Kana & Mari’s SoundRepos

Kana と Mari が、GitHub で見つけた TTS・MIDI・Audio など “音” にまつわる注目リポジトリを声で紹介。音とコードが交差するオープンソースの世界を軽やかにナビゲートします。 Kana と Mari のプロフィールはこちら:Kana – Newbie Esports CasterMari – Newbie Esports Analyst※ 本番組の原稿は生成 AI を用いて自動生成されています。内容には誤りを含む可能性がありますので参考情報としてお楽しみください。

Publisher-supplied feed metadata · PodParley refreshed Jun 14, 2026 · Source feed

  1. 101

    Big-Sh0t114/NachoBot

    NachoBot は、長時記憶・多模態認識を備えた多プラットフォーム向けの AI 虚拟生命/チャットボット基盤です。Bilibili、Discord、QQ(NapCat)などに対応し、LLM、ASR/VLM、本地TTS、Live2D連携、メッセージ仲介や予約通知などを統合して動作します。

  2. 100

    kizuna-ai-lab/sokuji

    Sokuji は、会議や通話中の音声をリアルタイムで双方向翻訳するためのアプリです。Electron デスクトップアプリと Chrome/Edge ブラウザ拡張の両方を提供し、クラウドAPI(OpenAI、Gemini など)と、WASM/WebGPU を使った完全オフラインのローカル推論の両方に対応しています。

  3. 99

    codedogQBY/ReadAny

    ReadAny は、デスクトップとモバイル向けのローカルファーストなAI電子書籍リーダーです。RAGチャット、意味検索、ハイライト、TTS、WebDAV同期などを備え、書籍をオフライン中心で管理しながらAIで質問・要約・検索できることを目的としています。

  4. 98

    katipally/openlive

    OpenLiveは、AIエージェント向けの音声・視覚レイヤーを提供するデスクトップアプリです。ローカル環境で音声入力、音声認識、会話の切り替え、音声合成、カメラ/画面共有、バージインを統合し、Claude CodeやCodexなどのコーディングエージェントとも連携できます。

  5. 97

    ciddwd/overlay-translator

    Android向けの画面リアルタイム翻訳アプリです。MediaProjectionやShizukuでスクリーンショットを取得し、端末内/ローカルHTTP/クラウドのOCRで文字認識した後、LLMや機械翻訳で翻訳し、結果を画面上に重ね表示したり音声読み上げしたりできます。ゲーム、漫画、ビジュアルノベルのような画面上テキストの翻訳に特化しています。

  6. 96

    huggingface/optimum-intel

    Transformers、Diffusers、Sentence Transformers、timm と OpenVINO をつなぐ Intel 向け最適化ライブラリです。モデルを OpenVINO IR へ変換し、推論や量子化(INT8/INT4 など)を通じて Intel CPU/GPU/専用アクセラレータ上で高速化することを目的としています。

  7. 95

    kigner/audio.cpp-webui

    audio.cpp は、ggml 上に構築された高性能な C++ ベースの音声推論フレームワークです。TTS、ASR、音声変換、話者分離、VAD、音楽生成などを共通ランタイムで扱い、CLI・サーバー・WebUI からローカル実行できるようにしています。

  8. 94

    Alisa0808/vox-director

    このリポジトリは、1つのテーマからVox風の紙コラージュ解説・広告動画を自動生成する「agent skill」です。脚本作成、コラージュのキーフレーム生成、モーション付与、音声合成、BGM、字幕焼き込み、ffmpegによる最終合成までをAtlas Cloud APIとローカル環境で一気通貫に実行します。

  9. 93

    lucasnewman/nanospeech

    Nanospeechは、PyTorchとMLXで実装されたシンプルで改造しやすいテキスト読み上げ(TTS)システムです。参照音声サンプルから話者の声を合わせる機能を持ち、事前学習済みの英語モデル、CLI、Gradioデモ、学習用スクリプトを備えています。

  10. 92

    divyaprakash0426/autoshorts

    AutoShortsは、長尺のゲームプレイ動画からAIで見どころシーンを抽出し、縦型のショート動画として自動生成するツールです。字幕生成、AI音声ナレーション、GPU加速レンダリング、複数のAIプロバイダ(OpenAI/Gemini/ローカル)対応を備え、TikTok/YouTube Shorts/Reels向けの投稿用クリップを作成します。

  11. 91

    sdsds222/Unitale

    このリポジトリは、LLMとTTSを組み合わせて有声書・有声ストーリーをブラウザ上で制作するためのWebツールです。脚本の自動分解、感情推定、多角色音声合成、SFX/BGMの自動編成、音声フィルタの挿入、さらに背景画像付きMP4動画の生成までを一括で行えることを目的としています。

  12. 90

    YuriCrystal/ai-avatar-bot

    右下角に常駐するAI虚擬人ウィジェットを、1行ので任意のWebサイトへ埋め込むためのデモ兼実装リポジトリです。Live2D/VRMのキャラクター表示、音声入力(STT)、音声出力(TTS)、口パク、知識ベース検索、任意のWebLLM連携、サイト側API連携をブラウザ中心で提供します。基本は純フロントエンドで動作し、必要に応じてVercelのserverless functionで自然な音声合成を追加できます。

  13. 89

    keonlee9420/Parallel-Tacotron2

    Googleの論文「Parallel Tacotron 2」をPyTorchで実装した音声合成(TTS)リポジトリです。テキストからメルスペクトログラムを生成する非自己回帰モデルの学習・評価・推論、データ前処理、TensorBoardログ出力、HiFi-GANなどのボコーダ連携を提供しています。

  14. 88

    roryeckel/wyoming_openai

    Wyomingプロトコル向けのOpenAI互換プロキシミドルウェアです。Home AssistantなどのWyomingクライアントから、OpenAI互換の音声認識(STT/ASR)と音声合成(TTS)サービスを利用できるようにし、OpenAI公式APIだけでなくSpeaches、LocalAI、Kokoro、Mistral Voxtral、Edge TTS、Groqなど複数のバックエンドに対応します。TTSのストリーミングではpySBDによる文境界分割と並列プリフェッチで低遅延配信を行います。

  15. 87

    Orkas-AI/Orkas-VideoStudio

    OrkasVideoStudio は、coding agent から自然言語で動画の合成・編集・生成を指示できる、エージェント向け動画制作ツールキットです。可読で差分可能な `plan.json` を中核に、Compose / Edit / Generate / Auto の4つの制作ラインを CLI と MCP で提供し、ffmpeg・whisper.cpp・HyperFrames などを薄くラップして決定的に実行します。

  16. 86

    mateogon/pdf-narrator

    PDFやEPUB、TXT、HTMLファイルを読み込み、テキスト抽出・整形を行ったうえで、Kokoro TTSを使ってオーディオブック化するGUIアプリです。PDFはTOCやヒューリスティック、スキャンPDFのOCRにも対応し、EPUBは内部構造やTOCを解析して章単位で抽出できます。

  17. 85

    yl365/MoneyPrinterTurboEasy

    このリポジトリは、ユーザーが入力したテーマからAIで口述文案を生成し、Pexels/Pixabayの動画素材や音声と組み合わせて短尺の音声付き動画を作成するためのデスクトップアプリです。READMEでは「一句話で专业爆款短视频を生成」と説明されており、設定ファイルを編集して実行する形の動画生成ツールとして提供されています。

  18. 84

    balisujohn/tortoise.cpp

    GGMLベースでTortoise-TTSをC++へ移植した音声合成(TTS)プロジェクトです。CPU/CUDA/一部Metalで動作し、モデルファイルと話者ボイスファイルを読み込んで、コマンドラインから音声を生成します。README上では、音声プロンプトの文字種制限やボイス追加方法も案内されています。

  19. 83

    keonlee9420/Cross-Speaker-Emotion-Transfer

    PyTorchで実装された、話者条件付きLayer Normalizationと半教師あり学習を用いるクロススピーカー感情転送TTS(Text-to-Speech)モデルのリポジトリです。学習・推論・評価・前処理の一連の処理に対応しており、RAVDESSなどの感情音声データセットを使って、話者と感情を制御した音声合成を行います。

  20. 82

    journey-ad/CosyVoice2-Ex

    CosyVoice2-Ex は、CosyVoice2 を拡張した音声合成(TTS)向けの WebUI/API リポジトリです。事前学習音色の利用、3秒程度の高速音色クローン、自然言語による発話制御、自動音声認識、音色保存、API 提供を行い、Windows / Linux / macOS での利用を想定しています。

  21. 81

    Aratako/MioTTS-Inference

    MioTTSという軽量・高速なTTSモデルの推論用リポジトリで、OpenAI互換APIを持つLLM推論基盤(llama.cpp、Ollama、vLLMなど)をバックエンドとして音声合成を行います。REST APIと簡易WebUIを提供し、参照音声プリセットの登録やBest-of-Nによる品質選択にも対応しています。

  22. 80

    sfortis/openai_tts

    Home Assistant向けのカスタムTTS統合で、OpenAIの音声合成APIおよびOpenAI互換バックエンドを使ってテキストを音声再生します。複数のTTSプロファイル、音声・モデル・音声形式の選択、ジングル追加、音量正規化、再生前後の音量復元や一時停止/再開など、アナウンス用途の機能が中心です。

  23. 79

    yerfor/SyntaSpeech

    SyntaSpeechは、IJCAI 2022論文の公式PyTorch実装で、語法情報を取り入れた非自回帰Text-to-Speech(TTS)システムです。句法グラフの構築・エンコードと、多長度の敵対的学習を用いて、韻律や音質を改善しつつ推論を高速化することを目的としています。LJSpeech、Biaobei、LibriTTSに対応し、学習・推論・データ前処理の一連のパイプラインを提供します。

  24. 78

    soobinseo/Tacotron-pytorch

    TacotronのPyTorch実装で、テキストから音声波形を生成するTTS(Text-to-Speech)モデルを学習・推論するためのリポジトリです。LJSpeechデータセットを前提に、テキスト前処理、メル/線形スペクトログラム生成、Tacotron本体の学習、チェックポイント保存、音声合成までを一通り提供しています。

  25. 77

    dramaclaw/dramaclaw

    DramaClaw は、脚本の取り込みからキャラクター抽出、エピソード設計、台本生成、絵コンテ・初稿画像生成、音声合成、動画編集・書き出しまでを一気通貫で行う、短編ドラマ制作向けのソース公開型パイプラインです。個人クリエイターや小規模スタジオが、自前の環境で“ドラマ工場”を運用できることを目的としており、Freezone(無限キャンバス)やディレクター支援AI、スタイルテンプレート、タスク管理なども備えています。

  26. 76

    karim23657/Persian-tts-coqui

    このリポジトリは、Coqui TTSを使ってペルシア語(Farsi)のテキスト読み上げモデルを学習・微調整・テストするためのサンプルコード集です。GlowTTS、VITS、マルチスピーカーVITSの学習ノートブックや推論例、事前学習済みモデルへのリンクが含まれています。

  27. 75

    lucoiso/UEAzSpeech

    Unreal Engine向けのプラグイン「AzSpeech」で、Microsoft Azure Speech Cognitive Services を統合し、音声認識(Speech-to-Text)と音声合成(Text-to-Speech/SSML)を非同期タスクとして利用できるようにします。さらに、エディタ上で音声データをUSoundWaveとして生成・保存するツールや、認識/合成タスクの管理機能も提供します。

  28. 74

    Deepest-Project/MelNet

    MelNetという、音声を周波数領域のメルスペクトログラムとして生成する深層生成モデルの実装です。学習用のトレーナーと、チェックポイントから音声をサンプリングしてスペクトログラム・波形・WAVを出力する推論スクリプトが含まれています。KSSやBlizzard、VoxCeleb2向けの設定が用意されており、条件付きTTS生成にも対応しています。

  29. 73

    pkozul/ha-tts-bluetooth-speaker

    Home Assistant向けのカスタムコンポーネント集で、BluetoothスピーカーへTTS(音声合成)を再生するメディアプレーヤーを提供します。さらに、Bluetooth存在検知(device_tracker)と音声再生が同時にBluetoothを奪い合って音切れする問題を避けるため、Bluetoothトラッカーを一時停止・再開できる仕組みも含まれています。

  30. 72

    sekift/so-vits-models

    このリポジトリは、LLM、音声変換(so-vits-svc/TTS)、Stable Diffusion、プロンプトエンジニアリングなどのAI関連モデル・アプリ・データセット・参考資料を集約したリンク集です。各分野ごとに代表的なサービス、GitHub、論文、Hugging Faceスペースなどを整理しており、特にDeepSeekの進化や各種AIアプリの比較情報も含まれています。

  31. 71

    PiSugar/whisplay-ai-chatbot

    Raspberry Pi Zero 2W / Pi 5 向けのポケットサイズAIチャットボット端末を構築するリポジトリです。ボタン押下で音声入力し、ASR・LLM・TTSを使って応答するほか、LCD表示、RGB LED、ウェイクワード、画像生成、RAG、プラグイン拡張などに対応しています。

  32. 70

    ZDisket/TensorVox

    TensorVoxは、Windowsデスクトップ向けの軽量なニューラル音声合成(TTS)アプリです。複数のAI音声モデルを読み込み、テキストから音声を生成したり、バッチで音声をデノイズ/リサンプルしたりできます。

  33. 69

    gpustack/vox-box

    Vox Box は、OpenAI API 互換の音声認識(speech-to-text)/音声合成(text-to-speech)サーバーです。Whisper、FunASR、Bark、Dia、CosyVoice などのバックエンドモデルを切り替えて利用でき、/v1/audio/speech、/v1/audio/transcriptions、/v1/models、/v1/voices、/health などのAPIを提供します。

  34. 68

    zhenye234/CoMoSpeech

    CoMoSpeechという、テキストから音声・歌声を生成するための拡散モデル/Consistency Modelベースの音声合成リポジトリです。1ステップ生成による高速推論を目指しており、教師モデルの蒸留による学生モデル学習、推論、LJSpeechを用いた学習コードが含まれています。HiFi-GAN вокoder を使ってメルスペクトログラムから波形を生成します。

  35. 67

    jscrane/TTS

    Arduino向けのText-to-Speech(TTS)ライブラリです。英語の語彙・音素変換ルールと音声データをPROGMEMに保持し、PWMやDAC出力を使ってArduino系ボード上で音声合成を行います。

  36. 66

    hegedustibor/htgo-tts

    Go言語向けのText-to-Speech(TTS)ライブラリです。Google Translateの音声生成APIを利用してテキストをMP3化し、ファイル保存や再生まで行えます。再生はmplayerを使う方法と、go-mp3 + oto/v2 を使うネイティブ再生の両方に対応しています。

  37. 65

    mtkresearch/BreezeApp

    BreezeAPP 是一款為 Android 和 iOS 平台開發的純手機 AI 應用程式。從 App Store下載,即可在不連網的狀態下享受多項 AI 功能。源碼由聯發創新基地(MediaTek Research)提供。我們旨在推廣兩個概念: 人人都可以在自己的手機上自由選擇並運行不同的LLM - one is free to choose one's own LLM to run on a phone,以及任何app開發者都可以輕鬆寫作創意的純手機AI應用 - any dev can create purely phone-based AI apps easily。

  38. 64

    netease-youdao/Confucius4-TTS

    Confucius4-TTS: a Multilingual and Cross-Lingual Zero-Shot TTS Engine

  39. 63

    Lyrcaxis/KokoroSharp

    Fast local TTS inference engine in C# with ONNX runtime. Multi-speaker, multi-platform and multilingual. Integrate on your .NET projects using a plug-and-play NuGet package, complete with all voices.

  40. 62

    OEvortex/llm4free

    LLM4Free — All-in-one Python toolkit for web search, AI interaction (40+ free providers), digital utilities, and more. Formerly WebScout.

  41. 61

    p0p4k/pflowtts_pytorch

    Unofficial implementation of NVIDIA P-Flow TTS paper

  42. 60

    OpenMOSS/MOSS-Audio-Tokenizer

    MOSS-Audio-Tokenizer is a Causal Transformer-based audio tokenizer built on the CAT architecture. Trained on 3M hours of diverse audio, it supports streaming and variable bitrates, delivering SOTA reconstruction and strong performance in generation and understanding—serving as a unified interface for next-generation native audio language models.

  43. 59

    worldwonderer/video-recap-skills

    Turn any video into a narration recap with claude code skill|用claude code skill把任何视频剪辑成中文解说视频,支持剪映导出

  44. 58

    thuhcsi/Crystal

    Crystal - C++ implementation of a unified framework for multilingual TTS synthesis engine with SSML specification as interface.

  45. 57

    dunky11/voicesmith

    [WIP] VoiceSmith makes training text to speech models easy.

  46. 56

    ekwek1/soprano-factory

    Soprano-Factory: Train your own 2000x realtime text-to-speech model

  47. 55

    small-cactus/M.I.L.E.S

    M.I.L.E.S, a GPT-4-Turbo voice assistant, self-adapts its prompts and AI model, can play any Spotify song, adjusts system and Spotify volume, performs calculations, browses the web and internet, searches global weather, delivers date and time, autonomously chooses and retains long-term memories. Available for macOS and Windows.

  48. 54

    Yazdi9/Talking_Face_Avatar

    Avatar Generation For Characters and Game Assets Using Deep Fakes

  49. 53

    XilinJia/Podcini

    Open source podcast instrument for Android supporting contents from YouTube and YT Music as well as normal podcasts.

  50. 52

    LonePheasantWarrior/TalkifyTTS

    云端大模型驱动的 Android 语音合成应用(TTS引擎)。支持豆包、腾讯、微软、千问等模型。An Android text-to-speech (TTS) engine powered by cloud-based large language models. Supports models such as Doubao, Tencent, Microsoft, and Qwen.

Type above to search every episode's transcript for a word or phrase. Matches are scoped to this podcast.

Searching…

We're indexing this podcast's transcripts for the first time — this can take a minute or two. We'll show results as soon as they're ready.

No matches for "" in this podcast's transcripts.

Showing of matches

No topics indexed yet for this podcast.

Loading reviews...

ABOUT THIS SHOW

Kana と Mari が、GitHub で見つけた TTS・MIDI・Audio など “音” にまつわる注目リポジトリを声で紹介。音とコードが交差するオープンソースの世界を軽やかにナビゲートします。 Kana と Mari のプロフィールはこちら:Kana – Newbie Esports CasterMari – Newbie Esports Analyst※ 本番組の原稿は生成 AI を用いて自動生成されています。内容には誤りを含む可能性がありますので参考情報としてお楽しみください。

HOSTED BY

Kana & Mari

Produced by Aquariumy Studio Inc.

CATEGORIES

Frequently Asked Questions

How many episodes does Kana & Mari’s SoundRepos have?

Kana & Mari’s SoundRepos currently has 50 episodes available on PodParley. New episodes are automatically indexed when they're published to the podcast feed.

What is Kana & Mari’s SoundRepos about?

Kana と Mari が、GitHub で見つけた TTS・MIDI・Audio など “音” にまつわる注目リポジトリを声で紹介。音とコードが交差するオープンソースの世界を軽やかにナビゲートします。 Kana と Mari のプロフィールはこちら:Kana – Newbie Esports CasterMari – Newbie Esports Analyst※ 本番組の原稿は生成 AI を用いて自動生成されています。内容には誤りを含む可能性がありますので参考情報としてお楽しみください。

How often does Kana & Mari’s SoundRepos release new episodes?

Kana & Mari’s SoundRepos has 50 episodes. Check the episode list to see recent publication dates and frequency.

Where can I listen to Kana & Mari’s SoundRepos?

You can listen to Kana & Mari’s SoundRepos on PodParley by clicking any episode. We provide an embedded audio player for direct listening, and you can also subscribe via your preferred podcast app using the RSS feed.

Who hosts Kana & Mari’s SoundRepos?

Kana & Mari’s SoundRepos is created and hosted by Kana & Mari.
URL copied to clipboard!