@@ -7,6 +7,29 @@ kernelspec:
77 display_name : Python 3
88 language : python
99 name : python3
10+ translation :
11+ title : 随机回答的期望效用
12+ headings :
13+ Overview : 概述
14+ Privacy Measures : 隐私度量
15+ Zoo of Concepts : 概念集合
16+ Zoo of Concepts::Leysieffer and Warner(1976) : Leysieffer and Warner(1976)
17+ Zoo of Concepts::Lanke(1976) : Lanke(1976)
18+ Zoo of Concepts::2.3 Fligner, Policello, and Singh : 2.3 Fligner, Policello, and Singh
19+ Zoo of Concepts::2.4 Greenberg, Kuebler, Abernathy, and Horvitz (1977) : 2.4 Greenberg, Kuebler, Abernathy, and Horvitz (1977)
20+ Respondent's Expected Utility : 受访者的期望效用
21+ Respondent's Expected Utility::Truth Border : 真实边界
22+ Respondent's Expected Utility::Drawing a Truth Border : 绘制真话边界
23+ Utilitarian View of Survey Design : 调查设计的功利主义观点
24+ Utilitarian View of Survey Design::Iso-variance Curves : 等方差曲线
25+ Utilitarian View of Survey Design::Drawing Iso-variance Curves : 绘制等方差曲线
26+ Utilitarian View of Survey Design::Optimal Survey : 最优调查设计
27+ Criticisms of Proposed Privacy Measures : 对提议隐私措施的批评
28+ Criticisms of Proposed Privacy Measures::Analysis of Method of Lanke's (1976) : 对Lanke (1976)方法的分析
29+ Criticisms of Proposed Privacy Measures::Method of Leysieffer and Warner (1976) : Leysieffer and Warner (1976)的方法
30+ Criticisms of Proposed Privacy Measures::Analysis on the Method of Chaudhuri and Mukerjee's (1988) : 对Chaudhuri and Mukerjee's (1988)方法的分析
31+ Criticisms of Proposed Privacy Measures::Method of Greenberg et al. (1977) : Greenberg et al. (1977)的方法
32+ Concluding Remarks : 总结说明
1033---
1134
1235``` {code-cell} ipython3
@@ -54,7 +77,7 @@ $$ (eq:util-rand-one)
5477
5578在这里我们描述一些研究者提出的概念
5679
57- ### {cite:t}`leysieffer1976respondent`
80+ ### Leysieffer and Warner(1976)
5881
5982如果回答 $r$ 相对于 $A$ 或 $A^{'}$ 满足以下条件,则被视为具有危害性:
6083
@@ -96,7 +119,7 @@ Leysieffer和Warner证明,估计的方差只能通过增加这两个危害性
96119
97120因此,一个有效的随机回应模型应在保证受访者配合的前提下,达到所能承受的最大风险水平。
98121
99- 作为一个特例,Leysieffer和Warner考虑了一个“否” 的回答不具有危害性的问题;也就是说,$g(\text{no}|A^{'})$可以是无限大的。
122+ 作为一个特例,Leysieffer和Warner考虑了一个"否" 的回答不具有危害性的问题;也就是说,$g(\text{no}|A^{'})$可以是无限大的。
100123
101124显然,最优设计必须满足
102125
110133\text{Pr}(A|\text{no})=0
111134$$
112135
113- ### {cite:t}`lanke1976degree`
136+ ### Lanke(1976)
114137
115- {cite:t }`lanke1975choice` 认为"人们可能想要隐藏的是属于A组的身份,而不是属于补集A'组的身份。"
138+ Lanke (1975) {cite}`lanke1975choice` 认为"人们可能想要隐藏的是属于A组的身份,而不是属于补集A'组的身份。"
116139
117- 因此,{cite:t }`lanke1976degree` 认为一个合适的保护度量是最小化
140+ 因此,Lanke (1976) {cite}`lanke1976degree` 认为一个合适的保护度量是最小化
118141
119142$$
120143\max \left\{ \text{Pr}(A|\text{yes}), \text{Pr}(A|\text{no}) \right\}
121144$$ (eq:util-rand-five-a)
122145
123- 在保持这个度量不变的情况下,他解释了在什么条件下,使用无关问题模型或{cite:t}`warner1965randomized` 的原始模型可以获得最小方差估计。
146+ 在保持这个度量不变的情况下,他解释了在什么条件下,使用无关问题模型或Warner (1965) 的原始模型可以获得最小方差估计。
124147
125- ### {cite:t}`fligner1977comparison`
148+ ### 2.3 Fligner, Policello, and Singh
126149
127- {cite:t }`fligner1977comparison`得出了与{cite:t}`lanke1976degree`类似的结论。
150+ Fligner, Policello, and Singh得出了与Lanke (1976)类似的结论。 {cite}`fligner1977comparison`
128151
129152他们将"隐私保护"度量为
130153
131154$$
132155\frac{1-\max \left\{ \text{Pr}(A|\text{yes}) , \text{Pr}(A|\text{no}) \right\} }{1-\pi_A}
133156$$ (eq:util-rand-six)
134157
135- ### {cite:t}`greenberg1977respondent`
158+ ### 2.4 Greenberg, Kuebler, Abernathy, and Horvitz (1977)
136159
137- {cite:t }`greenberg1977respondent` 强调,不仅要考虑 $A$ 组成员的风险,还要考虑 $A'$ 组成员的风险。他们定义在 $A$ 组个体身上的风险为这一个体被认为属于A组的概率:
160+ {cite}`greenberg1977respondent`
138161
139- $$
162+ Greenberg, Kuebler, Abernathy, and Horvitz (1977) 强调,不仅要考虑 $A$ 组成员的风险,还要考虑不属于该敏感群体的个体的风险。他们定义在 $A$ 组个体身上的风险为这一个体被认为属于A组的概率:
140163
164+ $$
141165\text{Pr}(\text{yes}|A)\times \text{Pr}(A|\text{yes})+\text{Pr}(\text{no}|A)\times \text{Pr}(A|\text{no})
142166$$ (eq:util-rand-seven-a)
143167
147171\text{Pr}(\text{yes}|A^{'})\times \text{Pr}(A|\text{yes})+\text{Pr}(\text{no}|A^{'}) \times \text{Pr}(A|\text{no})
148172$$ (eq:util-rand-seven-b)
149173
150- {cite:t}`greenberg1977respondent` 还考虑了另一个相关的风险度量,"这可能更接近受访者实际感受到的担忧。"
174+ Greenberg等人(1977) 还考虑了另一个相关的风险度量,"这可能更接近受访者实际感受到的担忧。"
151175
152176对于在 $A$ 和 $A^{'}$ 中的个体,其"有限风险"分别为
153177
@@ -196,13 +220,13 @@ $r_i$ 只能取值"是"或"否"。
196220则存在一个 $r_i$ 使得
197221
198222$$
199- \frac{\partial U_i\left(\text{Pr}(A|r_i),\phi_i\right) }{\partial \text{Pr}(A|r_i)} <0, \quad \phi_i \in \left\{ \text{truth},\text{lie}\right\}
223+ \frac{\partial U_i\left(\text{Pr}(A|r_i),\phi_i\right) }{\partial \text{Pr}(A|r_i)} <0, \text{ for } \phi_i \in \left\{ \text{truth},\text{lie}\right\}
200224$$ (eq:util-rand-nine-a)
201225
202226且
203227
204228$$
205- U_i\left(\text{Pr}(A|r_i),\text{truth}\right)>U_i\left(\text{Pr}(A|r_i),\text{lie}\right) , \quad \text{Pr}(A|r_i) \in [ 0,1]
229+ U_i\left(\text{Pr}(A|r_i),\text{truth}\right)>U_i\left(\text{Pr}(A|r_i),\text{lie}\right) , \text{ for } \text{Pr}(A|r_i) \in [ 0,1]
206230$$ (eq:util-rand-nine-b)
207231
208232现在假设个体$i$的真实答案是"是"。
231255
232256因此,约束{eq}`eq:util-rand-ten-a`成为个体 $i$ 始终如实回答的唯一必要条件。
233257
234- 在等式情况下,约束{eq}`eq:util-rand-ten-a` 确定了当真实答案为"是"时,使个体在说真话和说谎之间无差异的条件概率:
258+ 在等式情况下,约束 $(10.\text{a})$ 确定了当真实答案为"是"时,使个体在说真话和说谎之间无差异的条件概率:
235259
236260$$
237261U_i\left(\text{Pr}(A|\text{yes}),\text{truth}\right)= U_i\left(\text{Pr}(A|\text{no}),\text{lie}\right)
@@ -257,7 +281,7 @@ $$ (eq:util-rand-twelve)
257281
258282- 真话边界将条件概率空间分为两个子集:"说真话"和"说谎"。因此,充分的隐私会引出真实答案,而不充分的隐私则会导致谎言。真话边界取决于受访者的效用函数。
259283
260- - {eq}`eq:util-rand-nine-a`中的假设仅足以保证真话边界的正斜率。真话边界可以是凹形或凸形。
284+ - {eq}`eq:util-rand-nine-a`和{eq}`eq:util-rand-nine-a` 中的假设仅足以保证真话边界的正斜率。真话边界可以是凹形或凸形。
261285
262286我们可以用以下Python代码绘制一些真话边界:
263287
@@ -279,8 +303,8 @@ plt.plot(x1, x1, ':', linewidth=2)
279303plt.xlim([0, 1])
280304plt.ylim([0, 1])
281305
282- plt.xlabel('Pr(A|yes )')
283- plt.ylabel('Pr(A|no )')
306+ plt.xlabel('Pr(A|是 )')
307+ plt.ylabel('Pr(A|否 )')
284308plt.text(0.42, 0.3, "说真话", fontdict={'size':28, 'style':'italic'})
285309plt.text(0.8, 0.1, "说谎", fontdict={'size':28, 'style':'italic'})
286310
@@ -363,13 +387,13 @@ $$ (eq:util-rand-fourteen-b)
363387
364388我们使用Python代码来绘制等方差曲线。
365389
366- 这些条件概率对可以使用{cite:t}`warner1965randomized` 的模型获得。
390+ 这些条件概率对可以使用Warner (1965) 的模型获得。
367391
368392注意:
369393
370394- 只要统计学家能完全控制模型设计,等方差曲线上的任何点都可以通过无关问题模型达到。
371395
372- - {cite:t}`warner1965randomized` 的原始随机化回应模型比无关问题模型灵活性较低。
396+ - Warner (1965) 的原始随机化回应模型比无关问题模型灵活性较低。
373397
374398```{code-cell} ipython3
375399class Iso_Variance:
@@ -463,9 +487,9 @@ var.plotting_iso_variance_curve()
463487
464488我们将使用Python代码来帮助我们。
465489
466- ### 对{cite:t}`lanke1976degree` 方法的分析
490+ ### 对Lanke (1976) 方法的分析
467491
468- {cite:t}`lanke1976degree` 建议一个隐私保护标准,即最小化:
492+ Lanke (1976) 建议一个隐私保护标准,即最小化:
469493
470494$$
471495\max \left\{ \text{Pr}(A|\text{yes}) , \text{Pr}(A|\text{no}) \right\}
@@ -513,9 +537,9 @@ plt.title('图3')
513537plt.show()
514538```
515539
516- ### {cite:t}`leysieffer1976respondent` 的方法
540+ ### Leysieffer and Warner (1976) 的方法
517541
518- 当"否"答案不存在风险时,{cite:t}`leysieffer1976respondent`建议使用的二维风险度量可简化为一维 ,这意味着
542+ Leysieffer and Warner (1976)建议使用二维风险度量, 当"否"答案不存在风险时,该度量可简化为一维 ,这意味着
519543
520544$$
521545\text{Pr}(\text{yes}|A)=1
529553
530554从功利主义的角度来看,这不是最优选择。
531555
532- ### 对{cite:t}`Chadhuri_Mukerjee_88` 方法的分析
556+ ### 对Chaudhuri and Mukerjee's (1988) 方法的分析
533557
534- {cite:t}`Chadhuri_Mukerjee_88`认为,由于"是"有时可能与敏感群体 $A$ 相关,聪明的受访者可能会倾向于总是安全但虚假地回答"否"。在这种情况下,真实边界使得个体在真实答案为"是"时选择说谎,且
558+ {cite}`Chadhuri_Mukerjee_88`
559+
560+ Chaudhuri and Mukerjee (1988)认为,由于"是"有时可能与敏感群体 $A$ 相关,聪明的受访者可能会倾向于总是安全但虚假地回答"否"。在这种情况下,真实边界使得个体在真实答案为"是"时选择说谎,且
535561
536562$$
537563\text{Pr}(A|\text{no})=0
553579
554580特别是,如果消除了说谎带来的相对优势,受访者将选择如实回答。
555581
556- 我们可以用Python来展示最优模型设计:
582+ 我们可以用Python来展示最优模型设计对应图4中的点Q:
557583
558584```{code-cell} ipython3
559585def f(x):
@@ -564,14 +590,6 @@ def f(x):
564590```
565591
566592```{code-cell} ipython3
567- ---
568- mystnb:
569- figure:
570- caption: |
571- Optimal survey design under utilitarian approach showing computed point $Q$
572- name: fig-optimal-design
573- ---
574-
575593pi = 0.3
576594n = 100
577595nv = [0.27, 0.34, 0.49, 0.74, 0.92, 1.1, 1.47, 2.94, 14.7]
@@ -595,11 +613,11 @@ plt.fill_between(x3, 0, y3,facecolor='green', alpha=0.05, label='说谎')
595613for i in range(len(nv)):
596614 y = pi - (pi**2 * (1 - pi)**2) / (n * (nv[i] / n) * (x0 - pi + 1e-8))
597615 plt.plot(x0, y, 'k--', alpha=1 - 0.07 * i, label=f'V{i+1}')
598- plt.scatter(0.61, 0.146, c='r', marker='*', label='Q ', s=150)
616+ plt.scatter(0.61, 0.146, c='r', marker='*', label='Z ', s=150)
599617plt.xlim([0, 1])
600618plt.ylim([0, 0.5])
601- plt.xlabel('Pr(A|是 )')
602- plt.ylabel('Pr(A|否 )')
619+ plt.xlabel('Pr(A|yes )')
620+ plt.ylabel('Pr(A|no )')
603621plt.text(0.45, 0.35, "说实话", fontdict={'size':28, 'style':'italic'})
604622plt.text(0.8, 0.1, "说谎", fontdict={'size':28, 'style':'italic'})
605623plt.text(0.63, 0.141, "最优设计", fontdict={'size':16,'color':'r'})
@@ -608,11 +626,11 @@ plt.title('图4')
608626plt.show()
609627```
610628
611- 最优模型设计对应图中的点 $Q$.
629+ ### Greenberg et al. (1977)的方法
612630
613- ### {cite:t }`greenberg1977respondent`的方法
631+ {cite}`greenberg1977respondent`
614632
615- {cite:t}`greenberg1977respondent` 将属于群体$A$的个体的风险定义为他/她被认为属于$A$的概率:
633+ Greenberg et al. (1977) 将属于群体$A$的个体的风险定义为他/她被认为属于$A$的概率:
616634
617635$$
618636\text{Pr}(\text{yes}|A)\times \text{Pr}(A|\text{yes})+\text{Pr}(\text{no}|A)\times \text{Pr}(A|\text{no})
638656\text{Pr}(\text{yes}|A^{'})\times \text{Pr}(A|\text{yes})
639657$$ (eq:util-rand-eight-bb)
640658
641- 根据{cite}`greenberg1977respondent` 的说法,受访者在随机选择要回答的问题**之前**,就已经承诺根据{eq}`eq:util-rand-seven-aa`或{eq}`eq:util-rand-eight-aa`中的概率如实回答。
659+ 根据Greenberg et al. (1977) 的说法,受访者在随机选择要回答的问题**之前**,就已经承诺根据{eq}`eq:util-rand-seven-aa`或{eq}`eq:util-rand-eight-aa`中的概率如实回答。
642660
643661假设适当的隐私度量由{eq}`eq:util-rand-eight-aa`和{eq}`eq:util-rand-eight-bb`中的"有限风险"概念来表示。
644662
645663考虑一个无关问题模型,其中无关问题被替换为指令"说'不'",这意味着
646664
647665$$
648-
649666\text{Pr}(A|\text{yes})=1
650667$$
651668
677694
678695在功利主义分析中:
679696
680-
681697- 真实边界将感知属于敏感群体的条件概率空间 $\text{Pr}(A|\text{yes})$ 和 $\text{Pr}(A|\text{no})$ 划分为说真话区域和说谎区域。
682698
683699- 最优模型设计是在真实边界接触到最低可能的等方差曲线的点上获得的。
684700
685- {cite:t }`ljungqvist1993unified`分析的一个实际含义是,可以通过**选择足够接近的 $\text{Pr}(A|\text{yes})$ 和 $\text{Pr}(A|\text{no})$**来承认对受访者隐私需求的不确定性。
701+ Ljungqvist {cite}`ljungqvist1993unified`分析的一个实际含义是,可以通过**选择足够接近的 $\text{Pr}(A|\text{yes})$ 和 $\text{Pr}(A|\text{no})$**来承认对受访者隐私需求的不确定性。
0 commit comments