Документация / РусскийИсходный текст ↗

Примеры и руководства

English | 简体中文 | 日本語 | Deutsch | Русский

Документация · Краткое руководство · 中文

1. Пример выполнения NVIDIA

Точка входа: ptx-runtime.

В базовом случае сложение FP32 выполняется дважды для каждой длины: 1, 63, 64, 65 и 257. Он проверяет каждый результат и 16 хвостовых контрольных значений. Он демонстрирует выбор устройства, загрузку, привязку аргументов, хвостовые границы, обратное чтение и повторное выполнение.

См. быстрый старт для создания и выбора бэкенда.

2. Целевые случаи

Поместите эти аргументы после -- команды. Например, запустите тензорный случай с помощью:

cargo run --locked -p ruda-driver-cuda --features direct-ptx --example ptx-runtime -- --tensor
Аргумент Поведение Пример источника
--tensor Проверка метаданных и макета тензора tensor.rs
--shared Проверка общей памяти shared.rs
--half FP16/BF16 проверки half_precision.rs
--bitwise Проверка побитовых операций побитовый.rs
--shared-over-limit Диагностика ограничения общей памяти shared.rs
--expect-cold Компиляция утверждений произошла без обращения к дисковому кэшу Основная точка входа
--expect-warm Подтверждает попадание в дисковый кэш без перекомпиляции. Основная точка входа

--shared-over-limit занимает отдельную ветвь раннего возврата. Не комбинируйте его с проверками холодного/теплого кэша.

3. Холодные и теплые кэши

Используйте отдельный новый каталог кэша для каждого пути компиляции. Повторно используйте этот каталог для холодных и теплых запусков одного и того же пути.

После выбора пути компиляции, как описано в Начало работы, запустите эти команды в том же сеансе PowerShell:

$env:RUDA_PTX_TEST_CACHE = 'target/ptx-example-cache-' + [guid]::NewGuid().ToString('N')
cargo run --locked -p ruda-driver-cuda --features direct-ptx --example ptx-runtime -- --expect-cold
cargo run --locked -p ruda-driver-cuda --features direct-ptx --example ptx-runtime -- --expect-warm

Сохраняйте неизменными компилятор, входные аргументы и путь к кэшу между запусками.

4. Примеры вычислительных библиотек

Подготовьте среду сборки перед запуском примеров.

Задача Команда Проверка вывода
FP32 CSR Матрично-векторное умножение cargo run --locked -p ruSPARSE --features cuda --example csrmv Считывает и проверяет [7.0, 2.0, 18.5]
CUDA Кольцо AllReduce cargo run --locked -p ruCCL --features cuda --example all_reduce Четыре логических ранга в GPU 0, 257 элементов, сумма/среднее и сохранение входных данных.

5. Обучение и вывод модели