Qwen2.5-Omni-3B:マルチモーダル対応の軽量AIモデル、ローカル環境での実行が可能

アルイババクラウドがリリースしたQwen2.5-Omni-3Bは、動画、音声、画像、テキストを同時に処理できるマルチモーダルAIモデルです。パラメータ数が30億個と少ないながらも、ローカル環境で強力なマルチモーダル機能を実現しています。このモデルは最近Hugging Faceで公開されました。これは軽量なマルチモーダルAIシステムにおける重要な進歩を示しています。 1. 特徴 Qwen ...

7月21日 03:17 投稿

動画からテキストを抽出する簡単な実装

動画からテキストを抽出するプロセスを簡潔に説明します。このプロセスは以下の3つのステップで構成されています: 動画ファイルの取得 音声の分離 音声からテキストへの変換 まず、動画ファイルをダウンロードするためのコードを示します。このコードはURLから動画ファイルをダウンロードし、そのInputStreamを返します。 public InputStream downloadVideo(String vide ...

7月9日 17:31 投稿

C#による音声認識の実装ガイド

環境設定の基本 音声認識には様々な手法が存在しますが、Windows標準のSystem.Speech.Recognitionは精度に課題があります。効果的かつ実用的なソリューションとして、Whisperモデルを基にしたWhisper.Netライブラリを採用します。 NuGetパッケージマネージャーで以下のパッケージをインストール: Install-Package Whisper.Net -Version 1.9.0 Install-Package Whisper.Net. ...

6月27日 17:33 投稿

Qwen3-ASR-1.7Bを活用した教育現場向けスマート教室音声文字起こしシステム

素晴らしい授業を聞き終わった後、メモを整理しようとしたら、多くの重要なポイントが思い出せないという経験はありませんか?あるいは、教師として自分の授業を振り返りたいのに、完全な記録が見つからない、ということも。従来の録音デバイスは音声しか記録できず、後で文字に起こすのは時間と労力がかかり、しかもアクセント、専門用語、環境ノイズのために、文字起こ ...

6月16日 22:40 投稿

Python音声とテキスト変換ライブラリによる会議録音変換ツールの実装例:SpeechRecognitionライブラリを用いたケーススタディ

シリーズ記事一覧 Python音声・テキスト変換ライブラリ技術事例シリーズ 記事一覧 はじめに SpeechRecognitionライブラリを使用することで、会議録音をテキストに変換し、記録や後続の参照を容易にする会議記録ツールを開発できます。 一、基本的な実装例 以下のコードは、SpeechRecognitionライブラリを使って会議録音をテキストに変換する基本的な実装例です: import sp ...

5月14日 20:05 投稿