大規模言語モデルの微調整入門:概念とフレームワーク
前言
大規模言語モデル(LLM)は、確率生成システムです。
知識のタイムリー性:モデルの知識は訓練データの時間点までに限定されます。
推論の制限:本質的には確率予測であり、複雑な数学的推論では誤りが生じやすい(deepseekのアーキテクチャは異なる)。
専門領域の盲点:特定の垂直領域の知識が不足しています。
幻覚現象:一見合理的だが実 ...
8月3日 07:27 投稿
HumanEvalコード評価フレームワークの完全使用ガイド
HumanEvalコード評価フレームワークの完全使用ガイド
HumanEvalは、AIモデルのプログラミング能力を評価するためのテストフレームワークです。164の手書きプログラミング問題セットを用いて、モデルの機能的正確性をテストします。本ガイドでは、この重要なツールの使用方法を網羅的に解説します。
プロジェクト概要と核心的な価値
HumanEvalフレームワークはOpenAIチーム ...
7月29日 23:03 投稿
XTunerを活用した大規模言語モデルのシングルGPU低コストファインチューニング実践
1. ファインチューニングの基礎
大規模な事前学習モデル(ベースモデル)は、膨大なデータから学習されますが、そのままでは「肺癌とは何ですか?」という質問に対して、適切な回答を生成できません。これは、モデルが単に訓練データの分布に沿った最も近い単語を出力しようとするからです。そこで、指示従属ファインチューニング(Instruction Following Fine-tuning) ...
7月24日 19:04 投稿
ゼロからワン:CozeエージェントがプロンプトでパーソナライズされたAIアシスタントを構築する方法
プロンプト:AIエージェントの魂を形作るもの
AIエージェントの開発において、プロンプトはその魂を形作る役割を担います。単なる指示の集合ではなく、エージェントの性格、能力、行動規範を定義する核心要素です。新入社員のアシスタントを訓練していると想像してください。プロンプトはそのアシスタントに対する研修マニュアルであり、どのように思考し、どのように応答 ...
7月24日 17:34 投稿
Qwen2-7BモデルのローカルデプロイメントとAPI活用ガイド
はじめに
阿里巴巴の通義千問チームがQwen2シリーズのオープンソースモデルをリリースしました。このシリーズには、5つのサイズの事前学習・指令微調整モデルが含まれています:Qwen2-0.5B、Qwen2-1.5B、Qwen2-7B、Qwen2-57B-A14BおよびQwen2-72Bです。現在の最も優れたオープンソースモデルと比較すると、Qwen2-72Bは自然言語理解、知識、コード、数学、多言語を含む多く ...
7月17日 17:01 投稿
大規模言語モデル(LLM)入門:定義から学習プロセスまで完全ガイド
🔥 大規模言語モデル(LLM)入門:定義から学習プロセスまでの完全ガイド
2022年11月、OpenAI が ChatGPT を公開し、一夜にして世界中に衝撃が走りました。
人々は、この「チャットボット」が詩を書き、プログラミングをし、作文を添削するだけでなく、数学の問題を推論し、有名人のスタイルで文章を書き、さらには「もっともらしく嘘をつく」ことができることに驚きまし ...
7月13日 22:29 投稿
混沌から秩序へ:vLLMが大規模言語モデル推論の業界標準を再定義する方法
混沌から秩序へ:vLLMが大規模言語モデル推論の業界標準を再定義する方法
大規模言語モデル(LLM)の応用がますます普及する中、効率的な推論とサービスエンジンが企業がAI能力を導入する上での重要なボトルネックとなっています。vLLMは、高スループットでメモリ効率の高い推論とサービスエンジンとして、革新的な技術ソリューションを通じて業界標準を再定義し、もともと ...
7月13日 21:34 投稿
Qwen-7BおよびQwen-7B-Chatのオープンソース公開と商用利用ライセンス
モデル概要と公開リポジトリ
アリババクラウドは、約70億パラメータを備える大規模言語モデル「Qwen-7B」および対話最適化版「Qwen-7B-Chat」をオープンソース化し、無料での商用利用を正式に提供した。モデルウェイト、推論スクリプト、および関連ドキュメントは以下のプラットフォームで公開されている。
GitHub: https://github.com/QwenLM/Qwen-7B
Hugging Face: http ...
6月24日 17:51 投稿
LLMをより賢くするためのプロンプト設計入門
現在の社会では、AIGCの普及に伴い、効果的なプロンプトの使い方を知ることは重要です。本記事では、iFlytekの星火大モデルを例に、プロンプト設計の基本と実践的なテクニックを解説します。
星火大モデルは、中国のiFlytekが開発した大規模言語モデルです。強力な中国語創作能力を持ち、複雑な文脈での論理的推論を処理し、様々なタスクを実行できます。
星火大モデル ...
6月18日 16:28 投稿
Qwen3-ASR-1.7Bを活用した教育現場向けスマート教室音声文字起こしシステム
素晴らしい授業を聞き終わった後、メモを整理しようとしたら、多くの重要なポイントが思い出せないという経験はありませんか?あるいは、教師として自分の授業を振り返りたいのに、完全な記録が見つからない、ということも。従来の録音デバイスは音声しか記録できず、後で文字に起こすのは時間と労力がかかり、しかもアクセント、専門用語、環境ノイズのために、文字起こ ...
6月16日 22:40 投稿