当我将一个因子转换为数字或整数时,我得到的是底层级别代码,而不是数字形式的值。
f <- factor(sample(runif(5), 20, replace = TRUE)) ## [1] 0.0248644019011408 0.0248644019011408 0.179684827337041 ## [4] 0.0284090070053935 0.363644931698218 0.363644931698218 ## [7] 0.179684827337041 0.249704354675487 0.249704354675487 ## [10] 0.0248644019011408 0.249704354675487 0.0284090070053935 ## [13] 0.179684827337041 0.0248644019011408 0.179684827337041 ## [16] 0.363644931698218 0.249704354675487 0.363644931698218 ## [19] 0.179684827337041 0.0284090070053935 ## 5 Levels: 0.0248644019011408 0.0284090070053935 ... 0.363644931698218 as.numeric(f) ## [1] 1 1 3 2 5 5 3 4 4 1 4 2 3 1 3 5 4 5 3 2 as.integer(f) ## [1] 1 1 3 2 5 5 3 4 4 1 4 2 3 1 3 5 4 5 3 2
我必须求助于paste获得真正的价值:
paste
as.numeric(paste(f)) ## [1] 0.02486440 0.02486440 0.17968483 0.02840901 0.36364493 0.36364493 ## [7] 0.17968483 0.24970435 0.24970435 0.02486440 0.24970435 0.02840901 ## [13] 0.17968483 0.02486440 0.17968483 0.36364493 0.24970435 0.36364493 ## [19] 0.17968483 0.02840901
有没有更好的方法将因子转换为数字?
请参阅的警告部分?factor:
?factor
特别是,as.numeric应用于一个因素是没有意义的,并且可能通过隐式强制发生。建议将因子转换f为近似其原始数值,as.numeric(levels(f))[f]并且比 as.numeric(as.character(f)).
as.numeric
f
as.numeric(levels(f))[f]
as.numeric(as.character(f))
R 的常见问题解答有类似的建议。
为什么as.numeric(levels(f))[f]比 更有效as.numeric(as.character(f))?
as.numeric(as.character(f))是有效as.numeric(levels(f)[f])的,因此您正在对值执行转换为数值length(x),而不是对nlevels(x)值进行转换。对于具有很少级别的长向量,速度差异将最为明显。如果值大多是唯一的,则速度不会有太大差异。无论您如何进行转换,此操作都不太可能成为您代码中的瓶颈,因此不必太担心。
as.numeric(levels(f)[f])
length(x)
nlevels(x)
一些时间
library(microbenchmark) microbenchmark( as.numeric(levels(f))[f], as.numeric(levels(f)[f]), as.numeric(as.character(f)), paste0(x), paste(x), times = 1e5 ) ## Unit: microseconds ## expr min lq mean median uq max neval ## as.numeric(levels(f))[f] 3.982 5.120 6.088624 5.405 5.974 1981.418 1e+05 ## as.numeric(levels(f)[f]) 5.973 7.111 8.352032 7.396 8.250 4256.380 1e+05 ## as.numeric(as.character(f)) 6.827 8.249 9.628264 8.534 9.671 1983.694 1e+05 ## paste0(x) 7.964 9.387 11.026351 9.956 10.810 2911.257 1e+05 ## paste(x) 7.965 9.387 11.127308 9.956 11.093 2419.458 1e+05