我的数据集是这样的
bucket D_201009 D_201010 D_201011 D_201012 D_201101 D_201102 D_201103
0 0 0 0 0 0 0 0
1 1 0 0 0 1 0 0
2 3 0 3 0 1 6 3
3 0 0 0 0 0 0 0
4 0 4 0 0 0 0 0
5 4 0 4 0 4 8 1
6 8 0 8 0 8 10 8
7 0 0 0 0 0 0 0
8 7 0 7 0 0 7 3
我想要的是这个
bucket D_201009 D_201010 D_201011 D_201012 D_201101 D_201102 D_201103
0 23 4 22 0 14 31 15
1 23 4 22 0 14 31 15
2 22 4 22 0 13 31 15
3 19 4 19 0 12 25 12
4 19 4 19 0 12 25 12
5 19 0 19 0 12 25 12
6 15 0 15 0 8 17 11
7 7 0 7 0 0 7 3
8 7 0 7 0 0 7 3
其中总和是存储桶 0 的值,第 1 行对应的存储桶 2 用于列 D_201009 =sum-原始值 (1(,后来的存储桶 3 用于列D_201009前一个值(滞后值(-3(值原始(,并将此列标记为原始列名称。我编写了执行一列的代码。
data test;
input bucket D_201009 D_201010 D_201011 D_201012 D_201101 D_201102 D_201103;
datalines;
0 0 0 0 0 0 0 0
1 1 0 0 0 1 0 0
2 3 0 3 0 1 6 3
3 0 0 0 0 0 0 0
4 0 4 0 0 0 0 0
5 4 0 4 0 4 8 1
6 8 0 8 0 8 10 8
7 0 0 0 0 0 0 0
8 7 0 7 0 0 7 3
;
run;
将这些列名保存在宏中
proc contents data = test
out = vars(keep = varnum name)
noprint;
run;
proc sql noprint;
select distinct name
into :orderedvars2 separated by ' '
from vars
where varnum >=2
order by varnum;
quit;
仅查找一列的总和
proc sql;
select sum(D_201009) into :total from test;
quit;
使用滞后执行
data result(drop= D_201009 lag_D_201009 rename=(sum=D_201009));
set test;
retain sum;
if bucket < 2 then sum = &total;
sum = sum(sum, -lag(D_201009));
run;
如何更改代码以适用于列名存储为 macro &orderedvars2 的所有列。
我处理它的方法是将数据结构转换为更有用的数据结构; 那么你就不必使用宏变量了。 您可以改用 BY 处理,并且没有滞后。
我创建最终输出的方法是转置初始数据集,以便每个存储桶/D_var有一行,然后按D_vars排序(_NAME_ 保存(。 然后使用双 DoW 循环首先计算总和,然后减去该值。 请注意,我不必在此处使用保留或滞后,因为我处于 DoW 循环中,因此可以直接对该值进行操作。 我在减去之前输出,因为这似乎是你想要的。 然后我重新转置回来。
如果你有非常大的数据,这可能不是最快的选择,因为它要经历几个步骤;如果你这样做,无论如何你都应该使用更有效的算法。 但是,如果您并不总是具有相同的列,则可能是最不繁琐的。
proc transpose data=test out=test_t;
by bucket;
run;
proc sort data=test_t;
by _name_ bucket;
run;
data want_t;
do _n_ = 1 by 1 until (last._name_);
set test_t;
by _name_ bucket;
sum_var = sum(sum_var,col1);
end;
do _n_ = 1 by 1 until (last._name_);
set test_t;
by _name_ bucket;
output;
sum_var = sum_var - col1;
end;
run;
proc sort data=want_t;
by bucket _name_;
run;
proc transpose data=want_t out=want;
by bucket;
id _name_;
var sum_var;
run;
使用 proc summary 获取每个变量的总和,然后定义多个数组。
proc summary data=test;
var D:;
output out=sum(drop=_:) sum=/autoname;
run;
data want;
set test;
if _n_=1 then set sum;
array var1 D_201009--D_201103;
array var2 D_201009_sum--D_201103_sum;
array var3 _D_201009 _D_201010 _D_201011 _D_201012 _D_201101 _D_201102 _D_201103;
array temp (7) _temporary_;
retain temp;
do i=1 to dim(var1);
lag=lag(var1(i));
if bucket<2 then var3(i)=var2(i);
else var3(i)=sum(temp(i),-lag);
temp(i)=var3(i);
end;
drop D: lag i;
run;
如果我理解正确,您想对列求和,然后从总数中减去每个观察值?
获取总计很容易,只需使用 proc summary
.
然后将其与原始数据合并。 这是一种无需担心实际变量名称即可工作的方法。在这个程序中,它将对所有以d_
开头的变量求和,但您可以使用所需的任何变量列表。 如果变量超过 100 个,则更改临时数组的维度。
%let varlist=d_:;
* Get sums into variables with same names ;
proc summary data=have ;
var &varlist ;
output out=total sum= ;
run;
data want ;
set have(obs=0) /* Set variable order */
total(keep=&varlist) /* Get totals */
have(keep=&varlist) /* Get lagged variables */
;
array vars &varlist ;
array total (100) _temporary_;
set have (drop=&varlist); /* Get non-lagged variables */
do i=1 to dim(vars);
if _n_>1 then vars(i)=total(i)-vars(i);
total(i)=vars(i);
end;
drop i;
run;
如果您有缺失值,您可能希望在 DO 循环的开头添加以下代码行:
vars(i)=coalesce(vars(i),0);