Примеры и руководства
English | 简体中文 | 日本語 | Deutsch | Русский
Документация · Краткое руководство · 中文
1. Пример выполнения NVIDIA
Точка входа: ptx-runtime.
В базовом случае сложение FP32 выполняется дважды для каждой длины: 1, 63, 64, 65 и 257. Он проверяет каждый результат и 16 хвостовых контрольных значений. Он демонстрирует выбор устройства, загрузку, привязку аргументов, хвостовые границы, обратное чтение и повторное выполнение.
См. быстрый старт для создания и выбора бэкенда.
2. Целевые случаи
Поместите эти аргументы после -- команды. Например, запустите тензорный случай с помощью:
cargo run --locked -p ruda-driver-cuda --features direct-ptx --example ptx-runtime -- --tensor
| Аргумент | Поведение | Пример источника |
|---|---|---|
--tensor |
Проверка метаданных и макета тензора | tensor.rs |
--shared |
Проверка общей памяти | shared.rs |
--half |
FP16/BF16 проверки | half_precision.rs |
--bitwise |
Проверка побитовых операций | побитовый.rs |
--shared-over-limit |
Диагностика ограничения общей памяти | shared.rs |
--expect-cold |
Компиляция утверждений произошла без обращения к дисковому кэшу | Основная точка входа |
--expect-warm |
Подтверждает попадание в дисковый кэш без перекомпиляции. | Основная точка входа |
--shared-over-limit занимает отдельную ветвь раннего возврата. Не комбинируйте его с проверками холодного/теплого кэша.
3. Холодные и теплые кэши
Используйте отдельный новый каталог кэша для каждого пути компиляции. Повторно используйте этот каталог для холодных и теплых запусков одного и того же пути.
После выбора пути компиляции, как описано в Начало работы, запустите эти команды в том же сеансе PowerShell:
$env:RUDA_PTX_TEST_CACHE = 'target/ptx-example-cache-' + [guid]::NewGuid().ToString('N')
cargo run --locked -p ruda-driver-cuda --features direct-ptx --example ptx-runtime -- --expect-cold
cargo run --locked -p ruda-driver-cuda --features direct-ptx --example ptx-runtime -- --expect-warm
Сохраняйте неизменными компилятор, входные аргументы и путь к кэшу между запусками.
4. Примеры вычислительных библиотек
Подготовьте среду сборки перед запуском примеров.
| Задача | Команда | Проверка вывода |
|---|---|---|
| FP32 CSR Матрично-векторное умножение | cargo run --locked -p ruSPARSE --features cuda --example csrmv |
Считывает и проверяет [7.0, 2.0, 18.5] |
| CUDA Кольцо AllReduce | cargo run --locked -p ruCCL --features cuda --example all_reduce |
Четыре логических ранга в GPU 0, 257 элементов, сумма/среднее и сохранение входных данных. |
5. Обучение и вывод модели
- Состояние обучения и сохранения: вперед, назад, накопление градиента и записи обучения.
- Загрузка и вывод модели: примеры команд Qwen2/Qwen3.5, чат, выборка, AWQ и ввод изображений.