我的cuda代码使用统一内存崩溃

我的cuda代码使用统一内存崩溃,cuda,nvidia,Cuda,Nvidia,我是cuda编程的新手。我对此代码有问题(它是由我的老师编写的): #包括 #根据块128定义线程 __全局无效添加(整数*a,常数整数N){ int index=threadIdx.x+blockIdx.x*blockDim.x; 如果(index这里的问题是您的GPU是费米GPU(计算能力2.x): 统一内存(用于cudamalocmanaged)具有3.0或更高的GPU计算能力 每当您在使用CUDA代码时遇到问题,最好在请求他人帮助之前使用。即使您不理解错误输出,也会对试图帮助您的其他人有

我是cuda编程的新手。我对此代码有问题(它是由我的老师编写的):

#包括
#根据块128定义线程
__全局无效添加(整数*a,常数整数N){
int index=threadIdx.x+blockIdx.x*blockDim.x;

如果(index这里的问题是您的GPU是费米GPU(计算能力2.x):

统一内存(用于
cudamalocmanaged
)具有3.0或更高的GPU计算能力


每当您在使用CUDA代码时遇到问题,最好在请求他人帮助之前使用。即使您不理解错误输出,也会对试图帮助您的其他人有用。在这种情况下,您会收到一条简明的错误消息,说明不支持
cudamalocmanaged
函数。

这里的问题是,您的GPU是费米GPU(计算能力2.x):

统一内存(用于
cudamalocmanaged
)具有3.0或更高的GPU计算能力


每当您在使用CUDA代码时遇到问题,最好在请求他人帮助之前使用。即使您不理解错误输出,也会对其他试图帮助您的人有用。在这种情况下,您会得到一条简明的错误消息,说明不支持
cudamalocmanaged
函数。

Your GPU不支持统一内存。如果您在代码中使用了任何类型的错误检查,您将从cudaMallocManaged调用的返回状态中知道这一点。我知道每个支持cuda 8的GPU都有统一内存。我错了吗?您是否检查过统一内存的系统要求?统一内存需要开普勒类或者更新的Nvidia GPU,而820M只是费米类。@alukard990:是的,你错了。你的GPU不支持统一内存。如果你在代码中使用了任何类型的错误检查,你会从cudaMallocManaged调用的返回状态知道这一点。我知道每个支持cuda 8的GPU都有统一内存。我错了吗?你错了吗r检查了统一内存的系统要求?统一内存需要开普勒类或更新的Nvidia GPU,而820M只是费米类。@alukard990:是的,你错了。
#include <stdio.h>

#define THREAD_PER_BLOCK 128

__global__ void add(int *a,const int N){
    int index=threadIdx.x+blockIdx.x*blockDim.x;
    if (index<N)
      a[index] = a[index]+10;
}
int main( void ){
    int *a;
    // managed
    int i;
    int N=1024;
    int size = N * sizeof( int );

    cudaMallocManaged( &a, size );
    for(i=0; i<N; i++) {
        a[i]=i;
    }

    add<<< N/THREAD_PER_BLOCK, THREAD_PER_BLOCK >>>( a,N);
    cudaDeviceSynchronize();
    for (int i=0; i<10; i++){
        printf("%d %d\n", i, a[i]);
    }
    cudaFree( a );
    return 0;
}
Detected 1 CUDA Capable device(s)

Device 0: "GeForce 820M"
 CUDA Driver Version / Runtime Version          8.0 / 8.0
 CUDA Capability Major/Minor version number:    2.1
 Total amount of global memory:                 1985 MBytes (2081095680 bytes)
  ( 2) Multiprocessors, ( 48) CUDA Cores/MP:     96 CUDA Cores
  GPU Max Clock rate:                            1550 MHz (1.55 GHz)
  Memory Clock rate:                             900 Mhz
  Memory Bus Width:                              64-bit
  L2 Cache Size:                                 131072 bytes
  Maximum Texture Dimension Size (x,y,z)         1D=(65536), 2D=(65536, 65535), 3D=(2048, 2048, 2048)
  Maximum Layered 1D Texture Size, (num) layers  1D=(16384), 2048 layers
  Maximum Layered 2D Texture Size, (num) layers  2D=(16384, 16384), 2048 layers
  Total amount of constant memory:               65536 bytes
  Total amount of shared memory per block:       49152 bytes
  Total number of registers available per block: 32768
  Warp size:                                     32
  Maximum number of threads per multiprocessor:  1536
  Maximum number of threads per block:           1024
  Max dimension size of a thread block (x,y,z): (1024, 1024, 64)
  Max dimension size of a grid size    (x,y,z): (65535, 65535, 65535)
  Maximum memory pitch:                          2147483647 bytes
  Texture alignment:                             512 bytes
  Concurrent copy and kernel execution:          Yes with 1 copy engine(s)
  Run time limit on kernels:                     No
  Integrated GPU sharing Host Memory:            No
  Support host page-locked memory mapping:       Yes
  Alignment requirement for Surfaces:            Yes
  Device has ECC support:                        Disabled
  Device supports Unified Addressing (UVA):      Yes
  Device PCI Domain ID / Bus ID / location ID:   0 / 1 / 0
  Compute Mode:
     < Default (multiple host threads can use ::cudaSetDevice() with device simultaneously) >

deviceQuery, CUDA Driver = CUDART, CUDA Driver Version = 8.0, CUDA Runtime  Version = 8.0, NumDevs = 1, Device0 = GeForce 820M
Result = PASS
Device 0: "GeForce 820M"
 ...
 CUDA Capability Major/Minor version number:    2.1
                                                ^^^