|
|
@@ -225,6 +225,7 @@ __global__ void cudaMulmod(GlobalThreadState *global_ts,
|
|
|
// cuPrintf("s_B = %08X\n", (unsigned int)b);
|
|
|
// cuPrintf("s_a = %08X%08X\n", global_a_base[1], global_a_base[0]);
|
|
|
// cuPrintf("s_b = %08X%08X\n", global_b_base[1], global_b_base[0]);
|
|
|
+ #pragma unroll 1 // to allow 'nmult' to be 2 or 3
|
|
|
for (i = 0; i < nmult; ++i)
|
|
|
{
|
|
|
//memset(ts[tid].z, 0, (WORDS + 2) * sizeof(unsigned int));
|