evaluation: continued with interpreter benchmarking and performance tuning

2025-05-29 15:13:17 +02:00
parent 99a222341d
commit 381a4819c9
13 changed files with 398 additions and 320 deletions
--- a/package/src/ExpressionExecutorCuda.jl
+++ b/package/src/ExpressionExecutorCuda.jl
@ -56,18 +56,19 @@ function evaluate_gpu(expressions::Vector{Expr}, X::Matrix{Float32}, p::Vector{V

 	largestParameterSetSize = Utils.get_max_inner_length(p) # parameters get transformed into matrix. Will be nr. of rows in parameter matrix

-	ptxKernels = Vector{String}(undef, length(expressions)) 
+	compiledKernels = Vector{CuFunction}(undef, length(expressions)) 
 	kernelName = "evaluate_gpu"
 	@inbounds Threads.@threads for i in eachindex(expressions)
 		ex = ExpressionProcessing.expr_to_postfix(expressions[i])
-		ptxKernels[i] = Transpiler.transpile(ex, variableSetSize, largestParameterSetSize, numVariableSets, i-1, kernelName) # i-1 because julia is 1-based but PTX needs 0-based indexing
+		ptxKernel = Transpiler.transpile(ex, variableSetSize, largestParameterSetSize, numVariableSets, i-1, kernelName) # i-1 because julia is 1-based but PTX needs 0-based indexing
+		compiledKernels[i] = Transpiler.compile_kernel(ptxKernel, kernelName)
 	end

 	results = Matrix{Float32}(undef, numVariableSets, length(expressions))
 	for i in 1:repetitions # Simulate parameter tuning -> local search (X remains the same, p gets changed in small steps and must be performed sequentially, which it is with this impl)
 		# evaluate
 		# results = Transpiler.evaluate(exprs, variables, numVariableSets, variableSetSize, p)
-		results = Transpiler.evaluate(ptxKernels, variables, numVariableSets, p, kernelName)
+		results = Transpiler.evaluate(compiledKernels, variables, numVariableSets, p, kernelName)
 	end

 	return results