Ruda ドキュメント
English | 简体中文 | 日本語 | Deutsch | Русский
最初の GPU カーネルからライブラリ、テンソル トレーニング、ローカル モデル推論を計算します。まずは自分のタスクから始めて、プログラミング ガイドと API リファレンスを調べてください。
ここから始めてください
| あなたのタスク | 読み取りパス |
|---|---|
| 最初の GPU カーネルを実行します | インストールとクイックスタート → プログラミング ガイド |
| 行列、スパース、またはニューラル ネットワーク演算を使用する | 計算ライブラリ → テンソルとフレームワーク |
| モデルをトレーニングし、勾配を蓄積し、状態を保存する | トレーニングと状態の保存 |
| ローカル モデルの読み込み、テキストの生成、または画像の処理 | モデルの読み込みと推論 |
はじめに
- インストールとクイックスタート: ソースのセットアップ、バックエンドの選択、および最初の例。
- 例とチュートリアル: ベクトル加算、テンソル、共有メモリ、および半精度。
プログラミング ガイド
- Ruda プログラミング ガイド: ホストとデバイスのコード、実行階層、メモリ、同期、安全性。
- テンソルとフレームワーク: デバイス テンソル、ライブラリ ディスパッチ、融合、自動微分。
- トレーニングと状態の保存: トレーニング ステップ、勾配の累積、学習率のスケジューリング、保存、および復元。
- 分散学習と rank・device: rendezvous、デバイス配置、collective 順序、重み付き勾配と rank ごとの再開。
- アーキテクチャと Python Muon: mHC、DSA/CSA/HCA、圧縮 KV cache と hybrid model。
- LoRA/NF4 微調整: target 選択、重み準備、causal loss、checkpoint と再開。
- PyTorch モデルコンパイラ: AOT forward/backward、native 分割、設定と cache。
- 固定アドレス PyTorch graph: GraphOp、output の寿命と一階学習。
- モデルの読み込みと推論: ruLLM、テキストおよび画像入力、サンプリング、AWQ、および連続バッチ処理。
コンパイルと実行
- コンパイラー ガイド: Rust カーネル フロントエンド、IR、CUDA C++/NVRTC、およびダイレクト PTX。
- PTX バックエンドリファレンス: ターゲット構成、コンパイル出力、制約、およびエラー。
- 全スタック自動調整: 候補、検証、計時、policy と cache。
API リファレンス
- ランタイム API: デバイス クライアント、メモリ、送信、リードバック、および同期。
- ドライバー API とバックエンド: バックエンドの種類、デバイスの選択、およびランタイム統合。
- ネイティブ PyTorch API: コンポーネント版、tensor 契約、optimizer、stream と attention。
- 計算ライブラリ リファレンス: ライブラリの選択、Cargo の機能、およびエントリ ポイント。
計算ライブラリ
| ライブラリ | ガイド |
|---|---|
| ruBLAS | 線形代数とグループ化行列の乗算 |
| ruDNN | ニューラル ネットワーク操作と MoE |
| ruPRIM | 削減、スキャン、およびインデックス作成 |
| ruFFT | 高速フーリエ変換 |
| ruRAND | 乱数生成 |
| ruSPARSE | スパース計算 |
| ruCCL | 集団通信 |
デバッグと互換性
- デバッグと診断: コンパイル エラー、非同期エラー、キャッシュ、および数値チェック。
- 互換性ガイド: CUDA の概念、バックエンドの違い、API とコンパイルの境界。
- 寄稿: 問題と開発規約の報告。
最初のプロジェクトの場合は、クイックスタート、プログラミング ガイド、および関連するライブラリ ガイドに従ってください。バックエンドまたはカーネルを開発する場合は、コンパイラと API リファレンスを参照してください。