Skip to content

Commit ca3c68e

Browse files
committed
Fix thainlp tokenize sent command line
1 parent c058102 commit ca3c68e

2 files changed

Lines changed: 7 additions & 4 deletions

File tree

docs/notes/command_line.rst

Lines changed: 5 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -21,8 +21,11 @@ You can use some thainlp functions directly from command line.
2121
$ thainlp tokenize word -a longest "แรงงานกะดึก: ฟันเฟืองที่ยังหมุนในคำ่คืนมีเคอร์ฟิว"
2222
แรงงาน|กะ|ดึก|:| |ฟันเฟือง|ที่|ยัง|หมุน|ใน|คำ่|คืน|มี|เคอร์ฟิว|
2323

24-
$ thainlp tokenize word -nw -s # "5 เหตุผล 'ไม่ควร' ต่อพ.ร.ก.ฉุกเฉิน"
25-
5#เหตุผล#'#ไม่#ควร#'#ต่อ#พ.ร.ก.#ฉุกเฉิน#
24+
$ thainlp tokenize word -nw -s "##" "5 เหตุผล 'ไม่ควร' ต่อพ.ร.ก.ฉุกเฉิน"
25+
5##เหตุผล##'##ไม่##ควร##'##ต่อ##พ.ร.ก.##ฉุกเฉิน##
26+
27+
$ thainlp tokenize sent "หลายปีที่ผ่านมา ชาวชุมชนโคกยาวหลายคนได้พากันย้ายออก บ้างก็เสียชีวิต บางคนถูกจำคุกในข้อบุกรุกป่าหรือแม้กระทั่งสูญหาย"
28+
หลายปีที่ผ่านมา @@ชาวชุมชนโคกยาวหลายคนได้พากันย้ายออก @@บ้างก็เสียชีวิต @@บางคนถูกจำคุกในข้อบุกรุกป่าหรือแม้กระทั่งสูญหาย@@
2629

2730
**Part-Of-Speech tagging**::
2831

pythainlp/cli/tokenize.py

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -16,7 +16,7 @@
1616
word_tokenize,
1717
)
1818

19-
DEFAULT_SENT_TOKEN_SEPARATOR = "^"
19+
DEFAULT_SENT_TOKEN_SEPARATOR = "@@"
2020
DEFAULT_SUBWORD_TOKEN_SEPARATOR = "/"
2121
DEFAULT_SYLLABLE_TOKEN_SEPARATOR = "~"
2222
DEFAULT_WORD_TOKEN_SEPARATOR = "|"
@@ -127,6 +127,6 @@ def __init__(self, argv):
127127
elif subcommand.startswith("su"):
128128
SubwordTokenizationApp("subword", argv)
129129
elif subcommand.startswith("se"):
130-
SubwordTokenizationApp("sent", argv)
130+
SentenceTokenizationApp("sent", argv)
131131
else:
132132
print(f"Subcommand not available: {subcommand}")

0 commit comments

Comments
 (0)