Wikikamus
mswiktionary
https://ms.wiktionary.org/wiki/Wikikamus:Laman_Utama
MediaWiki 1.47.0-wmf.20
case-sensitive
Media
Khas
Perbincangan
Pengguna
Perbincangan pengguna
Wikikamus
Perbincangan Wikikamus
Fail
Perbincangan fail
MediaWiki
Perbincangan MediaWiki
Templat
Perbincangan templat
Bantuan
Perbincangan bantuan
Kategori
Perbincangan kategori
Lampiran
Perbincangan lampiran
Rima
Perbincangan rima
Tesaurus
Perbincangan tesaurus
Indeks
Perbincangan indeks
Petikan
Perbincangan petikan
Rekonstruksi
Perbincangan rekonstruksi
Padanan isyarat
Perbincangan padanan isyarat
Konkordans
Perbincangan konkordans
TimedText
TimedText talk
Modul
Perbincangan modul
Acara
Perbincangan acara
Modul:languages
828
8666
375314
373536
2026-09-17T05:05:09Z
Hakimi97
2668
Kemas kini terjemahan, pastikan semua komen dibiarkan dalam bahasa Inggeris supaya senang dijejak
375314
Scribunto
text/plain
--[==[ intro:
This module implements fetching of language-specific information and processing text in a given language.
===Types of languages===
There are two types of languages: full languages and etymology-only languages. The essential difference is that only
full languages appear in L2 headings in vocabulary entries, and hence categories like [[:Category:French nouns]] exist
only for full languages. Etymology-only languages have either a full language or another etymology-only language as
their parent (in the parent-child inheritance sense), and for etymology-only languages with another etymology-only
language as their parent, a full language can always be derived by following the parent links upwards. For example,
"Canadian French", code `fr-CA`, is an etymology-only language whose parent is the full language "French", code `fr`.
An example of an etymology-only language with another etymology-only parent is "Northumbrian Old English", code
`ang-nor`, which has "Anglian Old English", code `ang-ang` as its parent; this is an etymology-only language whose
parent is "Old English", code `ang`, which is a full language. (This is because Northumbrian Old English is considered
a variety of Anglian Old English.) Sometimes the parent is the "Undetermined" language, code `und`; this is the case,
for example, for "substrate" languages such as "Pre-Greek", code `qsb-grc`, and "the BMAC substrate", code `qsb-bma`.
It is important to distinguish language ''parents'' from language ''ancestors''. The parent-child relationship is one
of containment, i.e. if X is a child of Y, X is considered a variety of Y. On the other hand, the ancestor-descendant
relationship is one of descent in time. For example, "Classical Latin", code `la-cla`, and "Late Latin", code `la-lat`,
are both etymology-only languages with "Latin", code `la`, as their parents, because both of the former are varieties
of Latin. However, Late Latin does *NOT* have Classical Latin as its parent because Late Latin is *not* a variety of
Classical Latin; rather, it is a descendant. There is in fact a separate `ancestors` field that is used to express the
ancestor-descendant relationship, and Late Latin's ancestor is given as Classical Latin. It is also important to note
that sometimes an etymology-only language is actually the conceptual ancestor of its parent language. This happens,
for example, with "Old Italian" (code `roa-oit`), which is an etymology-only variant of full language "Italian" (code
`it`), and with "Old Latin" (code `itc-ola`), which is an etymology-only variant of Latin. In both cases, the full
language has the etymology-only variant listed as an ancestor. This allows a Latin term to inherit from Old Latin
using the {{tl|inh}} template (where in this template, "inheritance" refers to ancestral inheritance, i.e. inheritance
in time, rather than in the parent-child sense); likewise for Italian and Old Italian.
Full languages come in three subtypes:
* {regular}: This indicates a full language that is attested according to [[WT:CFI]] and therefore permitted in the
main namespace. There may also be reconstructed terms for the language, which are placed in the
{Reconstruction} namespace and must be prefixed with * to indicate a reconstruction. Most full languages
are natural (not constructed) languages, but a few constructed languages (e.g. Esperanto and Volapük,
among others) are also allowed in the mainspace and considered regular languages.
* {reconstructed}: This language is not attested according to [[WT:CFI]], and therefore is allowed only in the
{Reconstruction} namespace. All terms in this language are reconstructed, and must be prefixed with
*. Languages such as Proto-Indo-European and Proto-Germanic are in this category.
* {appendix-constructed}: This language is attested but does not meet the additional requirements set out for
constructed languages ([[WT:CFI#Constructed languages]]). Its entries must therefore be in
the Appendix namespace, but they are not reconstructed and therefore should not have *
prefixed in links. Most constructed languages are of this subtype.
Both full languages and etymology-only languages have a {Language} object associated with them, which is fetched using
the {getByCode} function in [[Modul:languages]] to convert a language code to a {Language} object. Depending on the
options supplied to this function, etymology-only languages may or may not be accepted, and family codes may be
accepted (returning a {Family} object as described in [[Modul:families]]). There are also separate {getByCanonicalName}
functions in [[Modul:languages]] and [[Modul:etymology languages]] to convert a language's canonical name to a
{Language} object (depending on whether the canonical name refers to a full or etymology-only language).
===Textual representations===
Textual strings belonging to a given language come in several different ''text variants'':
# The ''input text'' is what the user supplies in wikitext, in the parameters to {{tl|m}}, {{tl|l}}, {{tl|ux}},
{{tl|t}}, {{tl|lang}} and the like.
# The ''corrected input text'' is the input text with some corrections and/or normalizations applied, such as
bad-character replacements for certain languages, like replacing `l` or `1` to [[palochka]] in some languages written
in Cyrillic. (FIXME: This currently goes under the name ''display text'' but that will be repurposed below. Also,
[[User:Surjection]] suggests renaming this to ''normalized input text'', but "normalized" is used in a different sense
in [[Modul:usex]].)
# The ''display text'' is the text in the form as it will be displayed to the user. This is what appears in headwords,
in usexes, in displayed internal links, etc. This can include accent marks that are removed to form the stripped
display text (see below), as well as embedded bracketed links that are variously processed further. The display text
is generated from the corrected input text by applying language-specific transformations; for most languages, there
will be no such transformations. The general reason for having a difference between input and display text is to allow
for extra information in the input text that is not displayed to the user but is sent to the transliteration module.
Note that having different display and input text is only supported currently through special-casing but will be
generalized. Examples of transformations are: (1) Removing the {{cd|^}} that is used in certain East Asian (and
possibly other unicameral) languages to indicate capitalization of the transliteration (which is currently
special-cased); (2) for Korean, removing or otherwise processing hyphens (which is currently special-cased); (3) for
Arabic, removing a ''sukūn'' diacritic placed over a ''tāʔ marbūṭa'' (like this: ةْ) to indicate that the
''tāʔ marbūṭa'' is pronounced and transliterated as /t/ instead of being silent [NOTE, NOT IMPLEMENTED YET]; (4) for
Thai and Khmer, converting space-separated words to bracketed words and resolving respelling substitutions such as
`[กรีน/กฺรีน]`, which indicate how to transliterate given words [NOTE, NOT IMPLEMENTED YET except in language-specific
templates like {{tl|th-usex}}].
## The ''right-resolved display text'' is the result of removing brackets around one-part embedded links and resolving
two-part embedded links into their right-hand components (i.e. converting two-part links into the displayed form).
The process of right-resolution is what happens when you call {{cd|remove_links()}} in [[Modul:links]] on some text.
When applied to the display text, it produces exactly what the user sees, without any link markup.
# The ''stripped display text'' is the result of applying diacritic-stripping to the display text.
## The ''left-resolved stripped display text'' [NEED BETTER NAME] is the result of applying left-resolution to the
stripped display text, i.e. similar to right-resolution but resolving two-part embedded links into their left-hand
components (i.e. the linked-to page). If the display text refers to a single page, the resulting of applying
diacritic stripping and left-resolution produces the ''logical pagename''.
# The ''physical pagename text'' is the result of converting the stripped display text into physical page links. If the
stripped display text contains embedded links, the left side of those links is converted into physical page links;
otherwise, the entire text is considered a pagename and converted in the same fashion. The conversion does three
things: (1) converts characters not allowed in pagenames into their "unsupported title" representation, e.g.
{{cd|Unsupported titles/`gt`}} in place of the logical name {{cd|>}}; (2) handles certain special-cased
unsupported-title logical pagenames, such as {{cd|Unsupported titles/Space}} in place of {{cd|[space]}} and
{{cd|Unsupported titles/Ancient Greek dish}} in place of a very long Greek name for a gourmet dish as found in
Aristophanes; (3) converts "mammoth" pagenames such as [[a]] into their appropriate split component, e.g.
[[a/languages A to L]].
# The ''source translit text'' is the text as supplied to the language-specific {{cd|transliterate()}} method. The form
of the source translit text may need to be language-specific, e.g Thai and Khmer will need the corrected input text,
whereas other languages may need to work off the display text. [FIXME: It's still unclear to me how embedded bracketed
links are handled in the existing code.] In general, embedded links need to be right-resolved (see above), but when
this happens is unclear to me [FIXME]. Some languages have a chop-up-and-paste-together scheme that sends parts of the
text through the transliterate mechanism, and for others (those listed with "cont" in {{cd|substitution}} in
[[Modul:languages/data]]) they receive the full input text, but preprocessed in certain ways. (The wisdom of this is
still unclear to me.)
# The ''transliterated text'' (or ''transliteration'') is the result of transliterating the source translit text. Unlike
for all the other text variants except the transcribed text, it is always in the Latin script.
# The ''transcribed text'' (or ''transcription'') is the result of transcribing the source translit text, where
"transcription" here means a close approximation to the phonetic form of the language in languages (e.g. Akkadian,
Sumerian, Ancient Egyptian, maybe Tibetan) that have a wide difference between the written letters and spoken form.
Unlike for all the other text variants other than the transliterated text, it is always in the Latin script.
Currently, the transcribed text is always supplied manually be the user; there is no such thing as a
{{cd|transcribe()}} method on language objects.
# The ''sort key'' is the text used in sort keys for determining the placing of pages in categories they belong to. The
sort key is generated from the pagename or a specified ''sort base'' by lowercasing, doing language-specific
transformations and then uppercasing the result. If the sort base is supplied and is generated from input text, it
needs to be converted to display text, have embedded links removed through right-resolution and have
diacritic-stripping applied.
# There are other text variants that occur in usexes (specifically, there are normalized variants of several of the
above text variants), but we can skip them for now.
The following methods exist on {Language} objects to convert between different text variants:
# {correctInputText} (currently called {makeDisplayText}): This converts input text to corrected input text.
# {stripDiacritics}: This converts to stripped display text. [FIXME: This needs some rethinking. In particular,
{stripDiacritics} is sometimes called on input text, corrected input text or display text (in various paths inside of
[[Modul:links]], and, in the case of input text, usually from other modules). We need to make sure we don't try to
convert input text to display text twice, but at the same time we need to support calling it directly on input text
since so many modules do this. This means we need to add a parameter indicating whether the passed-in text is input,
corrected input, or display text; if the former two, we call {correctInputText} ourselves.]
# {logicalToPhysical}: This converts logical pagenames to physical pagenames.
# {transliterate}: This appears to convert input text with embedded brackets removed into a transliteration.
[FIXME: This needs some rethinking. In particular, it calls {processDisplayText} on its input, which won't work
for Thai and Khmer, so we may need language-specific flags indicating whether to pass the input text directly to the
language transliterate method. In addition, I'm not sure how embedded links are handled in the existing translit code;
a lot of callers remove the links themselves before calling {transliterate()}, which I assume is wrong.]
# {makeSortKey}: This converts display text (?) to a sort key. [FIXME: Clarify this.]
]==]
local export = {}
local debug_track_module = "Modul:debug/track"
local etymology_languages_data_module = "Modul:etymology languages/data"
local families_module = "Modul:families"
local headword_page_module = "Modul:headword/page"
local json_module = "Modul:JSON"
local language_like_module = "Modul:language-like"
local languages_data_module = "Modul:languages/data"
local languages_data_patterns_module = "Modul:languages/data/patterns"
local links_data_module = "Modul:links/data"
local load_module = "Modul:load"
local scripts_module = "Modul:scripts"
local scripts_data_module = "Modul:scripts/data"
local string_encode_entities_module = "Modul:string/encode entities"
local string_pattern_escape_module = "Modul:string/patternEscape"
local string_replacement_escape_module = "Modul:string/replacementEscape"
local string_utilities_module = "Modul:string utilities"
local table_module = "Modul:table"
local utilities_module = "Modul:utilities"
local wikimedia_languages_module = "Modul:wikimedia languages"
local mw = mw
local string = string
local table = table
local char = string.char
local concat = table.concat
local find = string.find
local floor = math.floor
local get_by_code -- Defined below.
local get_data_module_name -- Defined below.
local get_extra_data_module_name -- Defined below.
local getmetatable = getmetatable
local gmatch = string.gmatch
local gsub = string.gsub
local insert = table.insert
local ipairs = ipairs
local is_known_language_tag = mw.language.isKnownLanguageTag
local make_object -- Defined below.
local match = string.match
local next = next
local pairs = pairs
local remove = table.remove
local require = require
local select = select
local setmetatable = setmetatable
local sub = string.sub
local type = type
local unstrip = mw.text.unstrip
-- Loaded as needed by findBestScript.
local Hans_chars
local Hant_chars
local function check_object(...)
check_object = require(utilities_module).check_object
return check_object(...)
end
local function debug_track(...)
debug_track = require(debug_track_module)
return debug_track(...)
end
local function decode_entities(...)
decode_entities = require(string_utilities_module).decode_entities
return decode_entities(...)
end
local function decode_uri(...)
decode_uri = require(string_utilities_module).decode_uri
return decode_uri(...)
end
local function deep_copy(...)
deep_copy = require(table_module).deepCopy
return deep_copy(...)
end
local function encode_entities(...)
encode_entities = require(string_encode_entities_module)
return encode_entities(...)
end
local function get_L2_sort_key(...)
get_L2_sort_key = require(headword_page_module).get_L2_sort_key
return get_L2_sort_key(...)
end
local function get_script(...)
get_script = require(scripts_module).getByCode
return get_script(...)
end
local function find_best_script_without_lang(...)
find_best_script_without_lang = require(scripts_module).findBestScriptWithoutLang
return find_best_script_without_lang(...)
end
local function get_family(...)
get_family = require(families_module).getByCode
return get_family(...)
end
local function get_plaintext(...)
get_plaintext = require(utilities_module).get_plaintext
return get_plaintext(...)
end
local function get_wikimedia_lang(...)
get_wikimedia_lang = require(wikimedia_languages_module).getByCode
return get_wikimedia_lang(...)
end
local function keys_to_list(...)
keys_to_list = require(table_module).keysToList
return keys_to_list(...)
end
local function list_to_set(...)
list_to_set = require(table_module).listToSet
return list_to_set(...)
end
local function load_data(...)
load_data = require(load_module).load_data
return load_data(...)
end
local function make_family_object(...)
make_family_object = require(families_module).makeObject
return make_family_object(...)
end
local function pattern_escape(...)
pattern_escape = require(string_pattern_escape_module)
return pattern_escape(...)
end
local function replacement_escape(...)
replacement_escape = require(string_replacement_escape_module)
return replacement_escape(...)
end
local function safe_require(...)
safe_require = require(load_module).safe_require
return safe_require(...)
end
local function shallow_copy(...)
shallow_copy = require(table_module).shallowCopy
return shallow_copy(...)
end
local function split(...)
split = require(string_utilities_module).split
return split(...)
end
local function to_json(...)
to_json = require(json_module).toJSON
return to_json(...)
end
local function u(...)
u = require(string_utilities_module).char
return u(...)
end
local function ugsub(...)
ugsub = require(string_utilities_module).gsub
return ugsub(...)
end
local function ulen(...)
ulen = require(string_utilities_module).len
return ulen(...)
end
local function ulower(...)
ulower = require(string_utilities_module).lower
return ulower(...)
end
local function umatch(...)
umatch = require(string_utilities_module).match
return umatch(...)
end
local function uupper(...)
uupper = require(string_utilities_module).upper
return uupper(...)
end
local function track(page)
debug_track("languages/" .. page)
return true
end
local function normalize_code(code)
return load_data(languages_data_module).aliases[code] or code
end
local function check_inputs(self, check, default, ...)
local n = select("#", ...)
if n == 0 then
return false
end
local ret = check(self, (...))
if ret ~= nil then
return ret
elseif n > 1 then
local inputs = {...}
for i = 2, n do
ret = check(self, inputs[i])
if ret ~= nil then
return ret
end
end
end
return default
end
local function make_link(self, target, display)
local prefix, main
if self:getFamilyCode() == "qfa-sub" then
prefix, main = display:match("^(the )(.*)")
if not prefix then
prefix, main = display:match("^(a )(.*)")
end
end
return (prefix or "") .. "[[" .. target .. "|" .. (main or display) .. "]]"
end
-- Convert risky characters to HTML entities, which minimizes interference once returned (e.g. for "sms:a", "<!-- -->" etc.).
local function escape_risky_characters(text)
-- Spacing characters in isolation generally need to be escaped in order to be properly processed by the MediaWiki
-- software.
if umatch(text, "^%s*$") then
return encode_entities(text, text)
end
return encode_entities(text, "!#%&*+/:;<=>?@[\\]_{|}")
end
-- Temporarily convert various formatting characters to PUA to prevent them from being disrupted by the substitution process.
local function doTempSubstitutions(text, subbedChars, keepCarets, noTrim)
-- Clone so that we don't insert any extra patterns into the table in package.loaded. For some reason, using require
-- seems to keep memory use down; probably because the table is always cloned.
local patterns = shallow_copy(require(languages_data_patterns_module))
if keepCarets then
insert(patterns, "((\\+)%^)")
insert(patterns, "((%^))")
end
-- Ensure any whitespace at the beginning and end is temp substituted, to prevent it from being accidentally
-- trimmed. We only want to trim any final spaces added during the substitution process (e.g. by a module), which
-- means we only do this during the first round of temp substitutions.
if not noTrim then
insert(patterns, "^([\128-\191\244]*(%s+))")
insert(patterns, "((%s+)[\128-\191\244]*)$")
end
-- Pre-substitution, of "[[" and "]]", which makes pattern matching more accurate.
text = gsub(text, "%f[%[]%[%[", "\1"):gsub("%f[%]]%]%]", "\2")
local i = #subbedChars
for _, pattern in ipairs(patterns) do
-- Patterns ending in \0 stand are for things like "[[" or "]]"), so the inserted PUA are treated as breaks
-- between terms by modules that scrape info from pages.
local term_divider
pattern = gsub(pattern, "%z$", function(divider)
term_divider = divider == "\0"
return ""
end)
text = gsub(text, pattern, function(...)
local m = {...}
local m1New = m[1]
for k = 2, #m do
local n = i + k - 1
subbedChars[n] = m[k]
local byte2 = floor(n / 4096) % 64 + (term_divider and 128 or 136)
local byte3 = floor(n / 64) % 64 + 128
local byte4 = n % 64 + 128
m1New = gsub(m1New, pattern_escape(m[k]), "\244" .. char(byte2) .. char(byte3) .. char(byte4), 1)
end
i = i + #m - 1
return m1New
end)
end
text = gsub(text, "\1", "%[%["):gsub("\2", "%]%]")
return text, subbedChars
end
-- Reinsert any formatting that was temporarily substituted.
local function undoTempSubstitutions(text, subbedChars)
for i = 1, #subbedChars do
local byte2 = floor(i / 4096) % 64 + 128
local byte3 = floor(i / 64) % 64 + 128
local byte4 = i % 64 + 128
text = gsub(text, "\244[" .. char(byte2) .. char(byte2+8) .. "]" .. char(byte3) .. char(byte4),
replacement_escape(subbedChars[i]))
end
text = gsub(text, "\1", "%[%["):gsub("\2", "%]%]")
return text
end
-- Check if the raw text is an unsupported title, and if so return that. Otherwise, remove HTML entities. We do the
-- pre-conversion to avoid loading the unsupported title list unnecessarily.
local function checkNoEntities(text)
local textNoEnc = decode_entities(text)
if textNoEnc ~= text and load_data(links_data_module).unsupported_titles[text] then
return text
else
return textNoEnc
end
end
-- If no script object is provided (or if it's invalid or None), get one.
local function checkScript(text, self, sc)
if not check_object("script", true, sc) or sc:getCode() == "None" then
return self:findBestScript(text)
end
return sc
end
local function normalize(text, sc)
text = sc:fixDiscouragedSequences(text)
return sc:toFixedNFD(text)
end
--[=[
Subfunction of iterateSectionSubstitutions(). Process an individual chunk of text according to the specifications in
`substitution_data`. The input parameters are all as in the documentation of iterateSectionSubstitutions() except for
`recursed`, which is set to true if we called ourselves recursively to process a script-specific setting or
script-wide fallback. Returns two values: the processed text and the actual substitution data used to do the
substitutions (same as the `actual_substitution_data` return value to iterateSectionSubstitutions()).
]=]
local function doSubstitutions(self, text, sc, substitution_data, data_field, function_name, recursed)
-- BE CAREFUL in this function because the value at any level can be `false`, which causes no processing to be done
-- and blocks any further fallback processing.
local actual_substitution_data = substitution_data
-- If there are language-specific substitutes given in the data module, use those.
if type(substitution_data) == "table" then
-- If a script is specified, run this function with the script-specific data before continuing.
local sc_code = sc:getCode()
local has_substitution_data = false
if substitution_data[sc_code] ~= nil then
has_substitution_data = true
if substitution_data[sc_code] then
text, actual_substitution_data = doSubstitutions(self, text, sc, substitution_data[sc_code], data_field,
function_name, true)
end
-- Hant, Hans and Hani are usually treated the same, so add a special case to avoid having to specify each one
-- separately.
elseif sc_code:match("^Han") and substitution_data.Hani ~= nil then
has_substitution_data = true
if substitution_data.Hani then
text, actual_substitution_data = doSubstitutions(self, text, sc, substitution_data.Hani, data_field,
function_name, true)
end
-- Substitution data with key 1 in the outer table may be given as a fallback.
elseif substitution_data[1] ~= nil then
has_substitution_data = true
if substitution_data[1] then
text, actual_substitution_data = doSubstitutions(self, text, sc, substitution_data[1], data_field,
function_name, true)
end
end
-- Iterate over all strings in the "from" subtable, and gsub with the corresponding string in "to". We work with
-- the NFD decomposed forms, as this simplifies many substitutions.
if substitution_data.from then
has_substitution_data = true
for i, from in ipairs(substitution_data.from) do
-- Normalize each loop, to ensure multi-stage substitutions work correctly.
text = sc:toFixedNFD(text)
text = ugsub(text, sc:toFixedNFD(from), substitution_data.to[i] or "")
end
end
if substitution_data.remove_diacritics then
has_substitution_data = true
text = sc:toFixedNFD(text)
-- Convert exceptions to PUA.
local remove_exceptions, substitutes = substitution_data.remove_exceptions
if remove_exceptions then
substitutes = {}
local i = 0
for _, exception in ipairs(remove_exceptions) do
exception = sc:toFixedNFD(exception)
text = ugsub(text, exception, function(m)
i = i + 1
local subst = u(0x80000 + i)
substitutes[subst] = m
return subst
end)
end
end
-- Strip diacritics.
text = ugsub(text, "[" .. substitution_data.remove_diacritics .. "]", "")
-- Convert exceptions back.
if remove_exceptions then
text = text:gsub("\242[\128-\191]*", substitutes)
end
end
if not has_substitution_data and sc._data[data_field] then
-- If language-specific sort key (etc.) is nil, fall back to script-wide sort key (etc.).
text, actual_substitution_data = doSubstitutions(self, text, sc, sc._data[data_field], data_field,
function_name, true)
end
elseif type(substitution_data) == "string" then
-- If there is a dedicated function module, use that.
local module = safe_require("Modul:" .. substitution_data)
if module then
-- TODO: translit functions should take objects, not codes.
-- TODO: translit functions should be called with form NFD.
if function_name == "tr" then
if not module[function_name] then
error(("Internal error: Module [[%s]] has no function named 'tr'"):format(substitution_data))
end
text = module[function_name](text, self._code, sc:getCode())
elseif function_name == "stripDiacritics" then
-- FIXME, get rid of this arm after renaming makeEntryName -> stripDiacritics.
if module[function_name] then
text = module[function_name](sc:toFixedNFD(text), self, sc)
elseif module.makeEntryName then
text = module.makeEntryName(sc:toFixedNFD(text), self, sc)
else
error(("Internal error: Module [[%s]] has no function named 'stripDiacritics' or 'makeEntryName'"
):format(substitution_data))
end
else
if not module[function_name] then
error(("Internal error: Module [[%s]] has no function named '%s'"):format(
substitution_data, function_name))
end
text = module[function_name](sc:toFixedNFD(text), self, sc)
end
else
error("Substitution data '" .. substitution_data .. "' does not match an existing module.")
end
elseif substitution_data == nil and sc._data[data_field] then
-- If language-specific sort key (etc.) is nil, fall back to script-wide sort key (etc.).
text, actual_substitution_data = doSubstitutions(self, text, sc, sc._data[data_field], data_field,
function_name, true)
end
-- Don't normalize to NFC if this is the inner loop or if a module returned nil.
if recursed or not text then
return text, actual_substitution_data
end
-- Fix any discouraged sequences created during the substitution process, and normalize into the final form.
return sc:toFixedNFC(sc:fixDiscouragedSequences(text)), actual_substitution_data
end
--[=[
Split the text into sections, based on the presence of temporarily substituted formatting characters, then iterate over
each section to apply substitutions (e.g. transliteration or diacritic stripping). This avoids putting PUA (Private Use
Area) characters through language-specific modules, which may be unequipped for them. This function is passed the
following values:
* `self` (the Language object);
* `text` (the text to process);
* `sc` (the script of the text, which must be specified; callers should call checkScript() as needed to autodetect the
script of the text if not given explicitly by the user);
* `subbedChars` (an array of the same length as the text, indicating which characters have been substituted and by
what, or {nil} if no substitutions are to happen);
* `keepCarets` (DOCUMENT ME);
* `substitution_data` (the data indicating which substitutions to apply, taken directly from `data_field` in the
language's data structure in a submodule of [[Modul:languages/data]]);
* `data_field` (the field from which `substitution_data` was fetched, such as {"sort_key"} or {"strip_diacritics"});
* `function_name` (the name of the function to call to do the substitution, in case `substitution_data` specifies a
module to do the substitution);
* `notrim` (don't trim whitespace at the edges of `text`; set when computing the sort key, because whitespace at the
beginning of a sort key is significant and causes the resulting page to be sorted at the beginning of the category
it's in).
Return three values:
# the processed text;
# the value of `subbedChars` that was passed in, possibly modified with additional character substitutions; will be
{nil} if {nil} was passed in;
# the actual substitution data that was used to apply substitutions to `text`; this may be different from the value
of `substitution_data` passed in if that value recursively specified script-specific substitutions or if no
substitution data could be found in the language-specific data (e.g. {nil} was passed in or a structure was passed
in that had no setting for the script given in `sc`), but a script-wide fallback value was set; currently it is
only used by {makeSortKey()}.
]=]
local function iterateSectionSubstitutions(self, text, sc, subbedChars, keepCarets, substitution_data, data_field,
function_name, notrim)
local sections
-- See [[Modul:languages/data]].
if not find(text, "\244") or load_data(languages_data_module).substitution[self._code] == "cont" then
sections = {text}
else
sections = split(text, "\244[\128-\143][\128-\191]*", true)
end
local actual_substitution_data
for _, section in ipairs(sections) do
-- Don't bother processing empty strings or whitespace (which may also not be handled well by dedicated
-- modules).
if gsub(section, "%s+", "") ~= "" then
local sub, this_actual_substitution_data = doSubstitutions(self, section, sc, substitution_data, data_field,
function_name)
actual_substitution_data = this_actual_substitution_data
-- Second round of temporary substitutions, in case any formatting was added by the main substitution
-- process. However, don't do this if the section contains formatting already (as it would have had to have
-- been escaped to reach this stage, and therefore should be given as raw text).
if sub and subbedChars then
local noSub
for _, pattern in ipairs(require(languages_data_patterns_module)) do
if match(section, pattern .. "%z?") then
noSub = true
end
end
if not noSub then
sub, subbedChars = doTempSubstitutions(sub, subbedChars, keepCarets, true)
end
end
if not sub then
text = sub
break
end
text = sub and gsub(text, pattern_escape(section), replacement_escape(sub), 1) or text
end
end
if not notrim then
-- Trim, unless there are only spacing characters, while ignoring any final formatting characters.
-- Do not trim sort keys because spaces at the beginning are significant.
text = text and text:gsub("^([\128-\191\244]*)%s+(%S)", "%1%2"):gsub("(%S)%s+([\128-\191\244]*)$", "%1%2") or
nil
end
return text, subbedChars, actual_substitution_data
end
-- Process carets (and any escapes). Default to simple removal, if no pattern/replacement is given.
local function processCarets(text, pattern, repl)
local rep
repeat
text, rep = gsub(text, "\\\\(\\*^)", "\3%1")
until rep == 0
return (text:gsub("\\^", "\4")
:gsub(pattern or "%^", repl or "")
:gsub("\3", "\\")
:gsub("\4", "^"))
end
-- Remove carets if they are used to capitalize parts of transliterations (unless they have been escaped).
local function removeCarets(text, sc)
if not sc:hasCapitalization() and sc:isTransliterated() and text:find("^", 1, true) then
return processCarets(text)
else
return text
end
end
local Language = {}
--[==[
Return the language code of the language. Example: {fr"} for French.
]==]
function Language:getCode()
return self._code
end
--[==[
Return the canonical name of the language. This is the name used to represent that language on Wiktionary, and is
guaranteed to be unique to that language alone. Example: {"French"} for French.
]==]
function Language:getCanonicalName()
local name = self._name
if name == nil then
name = self._data[1]
self._name = name
end
return name
end
--[==[
Return the display form of the language. The display form of a language, family or script is the form it takes when
appearing as the <code><var>source</var></code> in categories such as <code>English terms derived from
<var>source</var></code> or <code>English given names from <var>source</var></code>, and is also the displayed text
in `##makeCategoryLink()` links. For full and etymology-only languages, this is the same as the canonical name, but
for families, it reads <code>"<var>name</var> languages"</code> (e.g. {"Indo-Iranian languages"}), and for scripts,
it reads <code>"<var>name</var> script"</code> (e.g. {"Arabic script"}).
]==]
function Language:getDisplayForm()
local form = self._displayForm
if form == nil then
form = self:getCanonicalName()
-- Add article and " substrate" to substrates that lack them.
if self:getFamilyCode() == "qfa-sub" then
if not (sub(form, 1, 4) == "the " or sub(form, 1, 2) == "a ") then
form = "a " .. form
end
if not match(form, " [Ss]ubstrate") then
form = form .. " substrate"
end
end
self._displayForm = form
end
return form
end
--[==[
Return the value which should be used in the HTML `lang=` attribute for tagged text in the language.
]==]
function Language:getHTMLAttribute(sc, region)
local code = self._code
if not find(code, "-", 1, true) then
return code .. "-" .. sc:getCode() .. (region and "-" .. region or "")
end
local parent = self:getParent()
region = region or match(code, "%f[%u][%u-]+%f[%U]")
if parent then
return parent:getHTMLAttribute(sc, region)
end
-- TODO: ISO family codes can also be used.
return "mis-" .. sc:getCode() .. (region and "-" .. region or "")
end
--[==[
Return a list of the aliases that the language is known by, excluding the canonical name. Aliases are synonyms for the
language in question. The names are not guaranteed to be unique, in that sometimes more than one language is known by
the same name. Example: { {"High German", "New High German", "Deutsch"}} for {{lnl|de}}.
]==]
function Language:getAliases()
self:loadInExtraData()
return require(language_like_module).getAliases(self)
end
--[==[
Return a list of the known subvarieties of a given language, excluding subvarieties that have been given explicit
etymology-only language codes. The names are not guaranteed to be unique, in that sometimes a given name refers to a
subvariety of more than one language. Example: { {"Southern Aymara", "Central Aymara"}} for {{lnl|ay}}. Note that the
returned value can have nested tables in it, when a subvariety goes by more than one name. Example:
{ {"North Azerbaijani", "South Azerbaijani", {"Afshar", "Afshari", "Afshar Azerbaijani", "Afchar"}, {"Qashqa'i", "Qashqai", "Kashkay"}, "Sonqor"}}
for {{lnl|az}}. Here, for example, Afshar, Afshari, Afshar Azerbaijani and Afchar all refer to the same subvariety,
whose preferred name is Afshar (the one listed first). To avoid a return value with nested tables in it, specify a
non-{nil} value for the `flatten` parameter; in that case, the return value would be
{ {"North Azerbaijani", "South Azerbaijani", "Afshar", "Afshari", "Afshar Azerbaijani", "Afchar", "Qashqa'i", "Qashqai", "Kashkay", "Sonqor"}}.
]==]
function Language:getVarieties(flatten)
self:loadInExtraData()
return require(language_like_module).getVarieties(self, flatten)
end
--[==[
Return a table of the "other names" that the language is known by, which are listed in the `other_names` field in the
language's extra-data module. It should be noted that the `other_names` field itself is deprecated, and entries listed
there should eventually be moved to either `aliases` or `varieties`, or removed if they refer to larger entities which
the language in question is actually a part of.
]==]
function Language:getOtherNames() -- To be eventually removed, once there are no more uses of the `other_names` field.
self:loadInExtraData()
return require(language_like_module).getOtherNames(self)
end
--[==[
Return a combined table of the canonical name, aliases, varieties and other names of a given language.
]==]
function Language:getAllNames()
self:loadInExtraData()
return require(language_like_module).getAllNames(self)
end
--[==[
Return a table of types as a set (with the types as keys). The possible types are
* {language}: This is a language, either full or etymology-only.
* {full}: This is a "full" (not etymology-only) language, i.e. the union of {regular}, {reconstructed} and
{appendix-constructed}. Note that the types {full} and {etymology-only} also exist for families, so if you want to
check specifically for a full language and you have an object that might be a family, you should use
{hasType("language", "full")} and not simply {hasType("full")}.
* {etymology-only}: This is an etymology-only (not full) language, whose parent is another etymology-only language or a
full language. Note that the types {full} and {etymology-only} also exist for families, so if you want to check
specifically for an etymology-only language and you have an object that might be a family, you should use
{hasType("language", "etymology-only")} and not simply {hasType("etymology-only")}.
* {regular}: This indicates a full language that is attested according to [[WT:CFI]] and therefore permitted in the main
namespace. There may also be reconstructed terms for the language, which are placed in the {Reconstruction}
namespace and must be prefixed with `*` to indicate a reconstruction. Most full languages are natural
(not constructed) languages, but a few constructed languages (e.g. Esperanto and Volapük, among others) are also
allowed in the mainspace and considered regular languages.
* {reconstructed}: This language is not attested according to [[WT:CFI]], and therefore is allowed only in the
{Reconstruction} namespace. All terms in this language are reconstructed, and must be prefixed with `*`. Languages
such as Proto-Indo-European and Proto-Germanic are in this category. '''Exception:''' Reconstructed languages can
have entries in the mainspace using the ''anti-asterisk'' feature. This requires that both the headword for the
mainspace term (as specified using {{para|head}}) and links to the term are prefixed with the anti-asterisk
indicator `!!`.
* {appendix-constructed}: This language is attested but does not meet the additional requirements set out for
constructed languages ([[WT:CFI#Constructed languages]]). Its entries must therefore be in the Appendix namespace,
but they are not reconstructed and therefore should not have * prefixed in links.
]==]
function Language:getTypes()
local types = self._types
if types == nil then
types = {language = true}
if self:getFullCode() == self._code then
types.full = true
else
types["etymology-only"] = true
end
for t in gmatch(self._data.type, "[^,]+") do
types[t] = true
end
self._types = types
end
return types
end
--[==[
Given a list of types as strings, return {true} if the language has all of them.
]==]
function Language:hasType(...)
Language.hasType = require(language_like_module).hasType
return self:hasType(...)
end
--[==[
Return a list containing `WikimediaLanguage` objects (see [[Modul:wikimedia languages]]), which represent languages
and their codes as they are used in Wikimedia projects for interwiki linking and such. More than one object may be
returned, as a single Wiktionary language may correspond to multiple Wikimedia languages. For example, Wiktionary's
single code `sh` (Serbo-Croatian) maps to four Wikimedia codes: `sh` (Serbo-Croatian), `bs` (Bosnian), `hr` (Croatian)
and `sr` (Serbian). The code for the Wikimedia language is retrieved from the `wikimedia_codes` property in the data
modules. If that property is not present, the code of the current language is used. If none of the available codes is
actually a valid Wikimedia code, an empty list is returned.
]==]
function Language:getWikimediaLanguages()
local wm_langs = self._wikimediaLanguageObjects
if wm_langs == nil then
local codes = self:getWikimediaLanguageCodes()
wm_langs = {}
for i = 1, #codes do
wm_langs[i] = get_wikimedia_lang(codes[i])
end
self._wikimediaLanguageObjects = wm_langs
end
return wm_langs
end
function Language:getWikimediaLanguageCodes()
local wm_langs = self._wikimediaLanguageCodes
if wm_langs == nil then
wm_langs = self._data.wikimedia_codes
if wm_langs then
wm_langs = split(wm_langs, ",", true, true)
else
local code = self._code
if is_known_language_tag(code) then
wm_langs = {code}
else
-- Inherit, but only if no codes are specified in the data *and*
-- the language code isn't a valid Wikimedia language code.
local parent = self:getParent()
wm_langs = parent and parent:getWikimediaLanguageCodes() or {}
end
end
self._wikimediaLanguageCodes = wm_langs
end
return wm_langs
end
--[==[
Return the name of the Wikipedia article for the language. `project` specifies the language and project to retrieve
the article from, defaulting to {"enwiki"} for the English Wikipedia. Normally if specified it should be the project
code for a specific-language Wikipedia e.g. "zhwiki" for the Chinese Wikipedia, but it can be any project, including
non-Wikipedia ones. If the project is the English Wikipedia and the property {wikipedia_article} is present in the data
module it will be used first. In all other cases, a sitelink will be generated from {:getWikidataItem} (if set). The
resulting value (or lack of value) is cached so that subsequent calls are fast. If no value could be determined, and
`noCategoryFallback` is {false}, `##Language:getCategoryName` is used as fallback; otherwise, {nil} is returned. Note
that if `noCategoryFallback` is {nil} or omitted, it defaults to {false} if the project is the English Wikipedia,
otherwise to {true}. In other words, under normal circumstances, if the English Wikipedia article couldn't be retrieved,
the return value will fall back to a link to the language's category, but this won't normally happen for any other
project.
]==]
function Language:getWikipediaArticle(noCategoryFallback, project)
Language.getWikipediaArticle = require(language_like_module).getWikipediaArticle
return self:getWikipediaArticle(noCategoryFallback, project)
end
function Language:makeWikipediaLink()
return make_link(self, "w:" .. self:getWikipediaArticle(), self:getCanonicalName())
end
--[==[
Return the name of the Wikimedia Commons category page for the language.
]==]
function Language:getCommonsCategory()
Language.getCommonsCategory = require(language_like_module).getCommonsCategory
return self:getCommonsCategory()
end
--[==[
Return the Wikidata item ID for the language or {nil}. This corresponds to the the second field in the data modules.
]==]
function Language:getWikidataItem()
Language.getWikidataItem = require(language_like_module).getWikidataItem
return self:getWikidataItem()
end
--[==[
Return a list of `Script` objects for all scripts that the language is written in. See [[Modul:scripts]].
]==]
function Language:getScripts()
local scripts = self._scriptObjects
if scripts == nil then
local codes = self:getScriptCodes()
if codes[1] == "All" then
scripts = load_data(scripts_data_module)
else
scripts = {}
for i = 1, #codes do
scripts[i] = get_script(codes[i])
end
end
self._scriptObjects = scripts
end
return scripts
end
--[==[
Return the list of script codes in the language's data file.
]==]
function Language:getScriptCodes()
local scripts = self._scriptCodes
if scripts == nil then
scripts = self._data[4]
if scripts then
local codes, n = {}, 0
for code in gmatch(scripts, "[^,]+") do
n = n + 1
-- Special handling of "Hants", which represents "Hani", "Hant" and "Hans" collectively.
if code == "Hants" then
codes[n] = "Hani"
codes[n + 1] = "Hant"
codes[n + 2] = "Hans"
n = n + 2
else
codes[n] = code
end
end
scripts = codes
else
scripts = {"None"}
end
self._scriptCodes = scripts
end
return scripts
end
--[==[
Given some text, iterate through the scripts of a given language trying to find the script that best matches the text.
Return a {Script} object representing the script. If no match is found at all, it returns the {None} script object.
]==]
function Language:findBestScript(text, forceDetect)
if not text or text == "" or text == "-" then
return get_script("None")
end
-- Differs from table returned by getScriptCodes, as Hants is not normalized into its constituents.
local codes = self._bestScriptCodes
if codes == nil then
codes = self._data[4]
codes = codes and split(codes, ",", true, true) or {"None"}
self._bestScriptCodes = codes
end
local first_sc = codes[1]
if first_sc == "All" then
return find_best_script_without_lang(text)
end
local codes_len = #codes
if not (forceDetect or first_sc == "Hants" or codes_len > 1) then
first_sc = get_script(first_sc)
local charset = first_sc.characters
return charset and umatch(text, "[" .. charset .. "]") and first_sc or get_script("None")
end
-- Remove all formatting characters.
text = get_plaintext(text)
-- Remove all spaces and any ASCII punctuation. Some non-ASCII punctuation is script-specific, so can't be removed.
text = ugsub(text, "[%s!\"#%%&'()*,%-./:;?@[\\%]_{}]+", "")
if #text == 0 then
return get_script("None")
end
-- Try to match every script against the text,
-- and return the one with the most matching characters.
local bestcount, bestscript, length = 0
for i = 1, codes_len do
local sc = codes[i]
-- Special case for "Hants", which is a special code that represents whichever of "Hant" or "Hans" best matches,
-- or "Hani" if they match equally. This avoids having to list all three. In addition, "Hants" will be treated
-- as the best match if there is at least one matching character, under the assumption that a Han script is
-- desirable in terms that contain a mix of Han and other scripts (not counting those which use Jpan or Kore).
if sc == "Hants" then
local Hani = get_script("Hani")
if not Hant_chars then
Hant_chars = load_data("Modul:zh/data/ts")
Hans_chars = load_data("Modul:zh/data/st")
end
local t, s, found = 0, 0
-- This is faster than using mw.ustring.gmatch directly.
for ch in gmatch((ugsub(text, "[" .. Hani.characters .. "]", "\255%0")), "\255(.[\128-\191]*)") do
found = true
if Hant_chars[ch] then
t = t + 1
if Hans_chars[ch] then
s = s + 1
end
elseif Hans_chars[ch] then
s = s + 1
else
t, s = t + 1, s + 1
end
end
if found then
if t == s then
return Hani
end
return get_script(t > s and "Hant" or "Hans")
end
else
sc = get_script(sc)
if not length then
length = ulen(text)
end
-- Count characters by removing everything in the script's charset and comparing to the original length.
local charset = sc.characters
local count = charset and length - ulen((ugsub(text, "[" .. charset .. "]+", ""))) or 0
if count >= length then
return sc
elseif count > bestcount then
bestcount = count
bestscript = sc
end
end
end
-- Return best matching script, or otherwise None.
return bestscript or get_script("None")
end
--[==[
Return a `Family` object for the language family that the language belongs to. See [[Modul:families]].
]==]
function Language:getFamily()
local family = self._familyObject
if family == nil then
family = self:getFamilyCode()
-- If the value is nil, it's cached as false.
family = family and get_family(family) or false
self._familyObject = family
end
return family or nil
end
--[==[
Return the family code in the language's data file.
]==]
function Language:getFamilyCode()
local family = self._familyCode
if family == nil then
-- If the value is nil, it's cached as false.
family = self._data[3] or false
self._familyCode = family
end
return family or nil
end
function Language:getFamilyName()
local family = self._familyName
if family == nil then
family = self:getFamily()
-- If the value is nil, it's cached as false.
family = family and family:getCanonicalName() or false
self._familyName = family
end
return family or nil
end
do
local function check_family(self, family)
if type(family) == "table" then
family = family:getCode()
end
if self:getFamilyCode() == family then
return true
end
local self_family = self:getFamily()
if self_family:inFamily(family) then
return true
-- If the family isn't a real family (e.g. creoles) check any ancestors.
elseif self_family:inFamily("qfa-not") then
local ancestors = self:getAncestors()
for _, ancestor in ipairs(ancestors) do
if ancestor:inFamily(family) then
return true
end
end
end
end
--[==[
Check whether the language belongs to `family` (which can be a family code or object). A list of objects can be given in
place of `family`; in that case, return true if the language belongs to any of the specified families. Note that some
languages (in particular, certain creoles) can have multiple immediate ancestors potentially belonging to different
families; in that case, return true if the language belongs to any of the specified families.
]==]
function Language:inFamily(...)
if self:getFamilyCode() == nil then
return false
end
return check_inputs(self, check_family, false, ...)
end
end
function Language:getParent()
local parent = self._parentObject
if parent == nil then
parent = self:getParentCode()
-- If the value is nil, it's cached as false.
parent = parent and get_by_code(parent, nil, true, true) or false
self._parentObject = parent
end
return parent or nil
end
function Language:getParentCode()
local parent = self._parentCode
if parent == nil then
-- If the value is nil, it's cached as false.
parent = self._data.parent or false
self._parentCode = parent
end
return parent or nil
end
function Language:getParentName()
local parent = self._parentName
if parent == nil then
parent = self:getParent()
-- If the value is nil, it's cached as false.
parent = parent and parent:getCanonicalName() or false
self._parentName = parent
end
return parent or nil
end
function Language:getParentChain()
local chain = self._parentChain
if chain == nil then
chain = {}
local parent, n = self:getParent(), 0
while parent do
n = n + 1
chain[n] = parent
parent = parent:getParent()
end
self._parentChain = chain
end
return chain
end
do
local function check_lang(self, lang)
for _, parent in ipairs(self:getParentChain()) do
if (type(lang) == "string" and lang or lang:getCode()) == parent:getCode() then
return true
end
end
end
function Language:hasParent(...)
return check_inputs(self, check_lang, false, ...)
end
end
--[==[
If the language is etymology-only, iterate through parents until a full language or family is found, and the
corresponding object is returned. If the language is a full language, return that language.
]==]
function Language:getFull()
local full = self._fullObject
if full == nil then
full = self:getFullCode()
full = full == self._code and self or get_by_code(full)
self._fullObject = full
end
return full
end
--[==[
If the language is an etymology-only language, iterate through parents until a full language or family is found, and
the corresponding code is returned. If the language is a full language, return that language's code.
]==]
function Language:getFullCode()
return self._fullCode or self._code
end
--[==[
If the language is an etymology-only language, iterate through parents until a full language or family is found, and the
corresponding canonical name is returned. If the language is a full language, return that language's canonical name.
]==]
function Language:getFullName()
local full = self._fullName
if full == nil then
full = self:getFull():getCanonicalName()
self._fullName = full
end
return full
end
--[==[
Return a list of {Language} objects for all languages that this language is directly descended from. Generally this is
only a single language, but creoles, pidgins and mixed languages can have multiple ancestors.
]==]
function Language:getAncestors()
local ancestors = self._ancestorObjects
if ancestors == nil then
ancestors = {}
local ancestor_codes = self:getAncestorCodes()
if #ancestor_codes > 0 then
for _, ancestor in ipairs(ancestor_codes) do
insert(ancestors, get_by_code(ancestor, nil, true))
end
else
local fam = self:getFamily()
local protoLang = fam and fam:getProtoLanguage() or nil
-- For the cases where the current language is the proto-language
-- of its family, or an etymology-only language that is ancestral to that
-- proto-language, we need to step up a level higher right from the
-- start.
if protoLang and (
protoLang:getCode() == self._code or
(self:hasType("etymology-only") and protoLang:hasAncestor(self))
) then
fam = fam:getFamily()
protoLang = fam and fam:getProtoLanguage() or nil
end
while not protoLang and not (not fam or fam:getCode() == "qfa-not") do
fam = fam:getFamily()
protoLang = fam and fam:getProtoLanguage() or nil
end
insert(ancestors, protoLang)
end
self._ancestorObjects = ancestors
end
return ancestors
end
do
-- Avoid a language being its own ancestor via class inheritance. We only need to check for this if the language has
-- inherited an ancestor table from its parent, because we never want to drop ancestors that have been explicitly
-- set in the data. Recursively iterate over ancestors until we either find self or run out. If self is found,
-- return true.
local function check_ancestor(self, lang)
local codes = lang:getAncestorCodes()
if not codes then
return nil
end
for i = 1, #codes do
local code = codes[i]
if code == self._code then
return true
end
local anc = get_by_code(code, nil, true)
if check_ancestor(self, anc) then
return true
end
end
end
--[==[
Return a list of `Language` codes for all languages that this language is directly descended from. Generally this is
only a single language, but creoles, pidgins and mixed languages can have multiple ancestors.
]==]
function Language:getAncestorCodes()
if self._ancestorCodes then
return self._ancestorCodes
end
local data = self._data
local codes = data.ancestors
if codes == nil then
codes = {}
self._ancestorCodes = codes
return codes
end
codes = split(codes, ",", true, true)
self._ancestorCodes = codes
-- If there are no codes or the ancestors weren't inherited data, there's nothing left to check.
if #codes == 0 or self:getData(false, "raw").ancestors ~= nil then
return codes
end
local i = 1
while i <= #codes do
if check_ancestor(self, self) then
remove(codes, i)
else
i = i + 1
end
end
return codes
end
end
--[==[
Given a list of language objects or codes, return true if at least one of them is an ancestor. This includes any
etymology-only children of that ancestor. If the language's ancestor(s) are etymology-only languages, it will also
return true for those language parent(s) (e.g. if Vulgar Latin is the ancestor, it will also return true for its parent,
Latin). However, a parent is excluded from this if the ancestor is also ancestral to that parent (e.g. if Classical
Persian is the ancestor, Persian would return {false}, because Classical Persian is also ancestral to Persian).
]==]
function Language:hasAncestor(...)
local function iterateOverAncestorTree(node, func, parent_check)
local ancestors = node:getAncestors()
local ancestorsParents = {}
for _, ancestor in ipairs(ancestors) do
-- When checking the parents of the other language, and the ancestor is also a parent, skip to the next
-- ancestor, so that we exclude any etymology-only children of that parent that are not directly related
-- (see below).
local ret = (parent_check or not node:hasParent(ancestor)) and
func(ancestor) or iterateOverAncestorTree(ancestor, func, parent_check)
if ret then
return ret
end
end
-- Check the parents of any ancestors. We don't do this if checking the parents of the other language, so that
-- we exclude any etymology-only children of those parents that are not directly related (e.g. if the ancestor
-- is Vulgar Latin and we are checking New Latin, we want it to return false because they are on different
-- ancestral branches. As such, if we're already checking the parent of New Latin (Latin) we don't want to
-- compare it to the parent of the ancestor (Latin), as this would be a false positive; it should be one or the
-- other).
if not parent_check then
return nil
end
for _, ancestor in ipairs(ancestors) do
local ancestorParents = ancestor:getParentChain()
for _, ancestorParent in ipairs(ancestorParents) do
if ancestorParent:getCode() == self._code or ancestorParent:hasAncestor(ancestor) then
break
else
insert(ancestorsParents, ancestorParent)
end
end
end
for _, ancestorParent in ipairs(ancestorsParents) do
local ret = func(ancestorParent)
if ret then
return ret
end
end
end
local function do_iteration(otherlang, parent_check)
-- otherlang can't be self
if (type(otherlang) == "string" and otherlang or otherlang:getCode()) == self._code then
return false
end
repeat
if iterateOverAncestorTree(
self,
function(ancestor)
return ancestor:getCode() == (type(otherlang) == "string" and otherlang or otherlang:getCode())
end,
parent_check
) then
return true
elseif type(otherlang) == "string" then
otherlang = get_by_code(otherlang, nil, true)
end
otherlang = otherlang:getParent()
parent_check = false
until not otherlang
end
local parent_check = true
for _, otherlang in ipairs{...} do
local ret = do_iteration(otherlang, parent_check)
if ret then
return true
end
end
return false
end
do
local function construct_node(lang, memo)
local branch, ancestors = {lang = lang:getCode()}
memo[lang:getCode()] = branch
for _, ancestor in ipairs(lang:getAncestors()) do
if ancestors == nil then
ancestors = {}
end
insert(ancestors, memo[ancestor:getCode()] or construct_node(ancestor, memo))
end
branch.ancestors = ancestors
return branch
end
function Language:getAncestorChain()
local chain = self._ancestorChain
if chain == nil then
chain = construct_node(self, {})
self._ancestorChain = chain
end
return chain
end
end
function Language:getAncestorChainOld()
local chain = self._ancestorChain
if chain == nil then
chain = {}
local step = self
while true do
local ancestors = step:getAncestors()
step = #ancestors == 1 and ancestors[1] or nil
if not step then
break
end
insert(chain, step)
end
self._ancestorChain = chain
end
return chain
end
local function fetch_descendants(self, fmt)
local descendants, family = {}, self:getFamily()
-- Iterate over all three datasets.
for _, data in ipairs{
require("Modul:languages/code to canonical name"),
require("Modul:etymology languages/code to canonical name"),
require("Modul:families/code to canonical name"),
} do
for code in pairs(data) do
local lang = get_by_code(code, nil, true, true)
if not lang then
error(("Internal error: code '%s' can't be fetched"):format(code))
end
-- Test for a descendant. Earlier tests weed out most candidates, while the more intensive tests are only used sparingly.
if (
code ~= self._code and -- Not self.
lang:inFamily(family) and -- In the same family.
(
family:getProtoLanguageCode() == self._code or -- Self is the protolanguage.
self:hasDescendant(lang) or -- Full hasDescendant check.
(lang:getFullCode() == self._code and not self:hasAncestor(lang)) -- Etymology-only child which isn't an ancestor.
)
) then
if fmt == "object" then
insert(descendants, lang)
elseif fmt == "code" then
insert(descendants, code)
elseif fmt == "name" then
insert(descendants, lang:getCanonicalName())
end
end
end
end
return descendants
end
function Language:getDescendants()
local descendants = self._descendantObjects
if descendants == nil then
descendants = fetch_descendants(self, "object")
self._descendantObjects = descendants
end
return descendants
end
function Language:getDescendantCodes()
local descendants = self._descendantCodes
if descendants == nil then
descendants = fetch_descendants(self, "code")
self._descendantCodes = descendants
end
return descendants
end
function Language:getDescendantNames()
local descendants = self._descendantNames
if descendants == nil then
descendants = fetch_descendants(self, "name")
self._descendantNames = descendants
end
return descendants
end
do
local function check_lang(self, lang)
if type(lang) == "string" then
lang = get_by_code(lang, nil, true)
end
if lang:hasAncestor(self) then
return true
end
end
function Language:hasDescendant(...)
return check_inputs(self, check_lang, false, ...)
end
end
local function fetch_children(self, fmt)
local m_etym_data = require(etymology_languages_data_module)
local self_code, children = self._code, {}
for code, lang in pairs(m_etym_data) do
local _lang = lang
repeat
local parent = _lang.parent
if parent == self_code then
if fmt == "object" then
insert(children, get_by_code(code, nil, true))
elseif fmt == "code" then
insert(children, code)
elseif fmt == "name" then
insert(children, lang[1])
end
break
end
_lang = m_etym_data[parent]
until not _lang
end
return children
end
function Language:getChildren()
local children = self._childObjects
if children == nil then
children = fetch_children(self, "object")
self._childObjects = children
end
return children
end
function Language:getChildrenCodes()
local children = self._childCodes
if children == nil then
children = fetch_children(self, "code")
self._childCodes = children
end
return children
end
function Language:getChildrenNames()
local children = self._childNames
if children == nil then
children = fetch_children(self, "name")
self._childNames = children
end
return children
end
function Language:hasChild(...)
local lang = ...
if not lang then
return false
elseif type(lang) == "string" then
lang = get_by_code(lang, nil, true)
end
if lang:hasParent(self) then
return true
end
return self:hasChild(select(2, ...))
end
--[==[
Return the name of the main category of that language. Example: {French language"} for French, whose category is at
[[:Category:French language]]. Unless optional argument `nocap` is given, the language name at the beginning of the
returned value will be capitalized. This capitalization is correct for category names, but not if the language name is
lowercase and the returned value of this function is used in the middle of a sentence.
]==]
function Language:getCategoryName(nocap)
local name = self._categoryName
if name == nil then
name = self:getCanonicalName()
-- If a substrate, omit any leading article.
if self:getFamilyCode() == "qfa-sub" then
name = name:gsub("^sebuah ", ""):gsub("^suatu ", "")
end
-- Only add " language" if a full language.
if self:hasType("full") then
-- Unless the canonical name already ends with "language", "lect" or their derivatives, add " language".
if not (match(name, "^[Bb]ahasa") or match(name, "^[Ll]ek")) then
name = "Bahasa " .. name
end
end
self._categoryName = name
end
if nocap then
return name
end
return mw.getContentLanguage():ucfirst(name)
end
--[==[
Create a link to the category; the link text is the canonical name.
]==]
function Language:makeCategoryLink()
return make_link(self, ":Kategori:" .. self:getCategoryName(), self:getDisplayForm())
end
function Language:getStandardCharacters(sc)
local standard_chars = self._data.standard_chars
if type(standard_chars) ~= "table" then
return standard_chars
elseif sc and type(sc) ~= "string" then
check_object("script", nil, sc)
sc = sc:getCode()
end
if (not sc) or sc == "None" then
local scripts = {}
for _, script in pairs(standard_chars) do
insert(scripts, script)
end
return concat(scripts)
end
if standard_chars[sc] then
return standard_chars[sc] .. (standard_chars[1] or "")
end
end
--[==[
Strip diacritics from display text `text` (in a language-specific fashion), which is in the script `sc`. If `sc` is
omitted or {nil}, the script is autodetected. This also strips certain punctuation characters from the end and (in the
case of Spanish upside-down question mark and exclamation points) from the beginning; strips any whitespace at the
end of the text or between the text and final stripped punctuation characters; and applies some language-specific
Unicode normalizations to replace discouraged characters with their prescribed alternatives. Return the stripped text.
]==]
function Language:stripDiacritics(text, sc)
if (not text) or text == "" then
return text
end
sc = checkScript(text, self, sc)
text = normalize(text, sc)
-- FIXME, rename makeEntryName to stripDiacritics and get rid of second and third return values
-- everywhere
local _
text, _, _ = iterateSectionSubstitutions(self, text, sc, nil, nil,
self._data.strip_diacritics or self._data.entry_name, "strip_diacritics", "stripDiacritics")
text = umatch(text, "^[¿¡]?(.-[^%s%p].-)%s*[؟?!;՛՜ ՞ ՟?!︖︕।॥။၊་།]?$") or text
return text
end
--[==[
Convert a ''logical'' pagename (the pagename as it appears to the user, after diacritics and punctuation have been
stripped) to a ''physical'' pagename (the pagename as it appears in the MediaWiki database). Reasons for a difference
between the two are (a) unsupported titles such as `[ ]` (with square brackets in them), `#` (pound/hash sign) and
`¯\_(ツ)_/¯` (with underscores), as well as overly long titles of various sorts; (b) "mammoth" pages that are split into
parts (e.g. `a`, which is split into physical pagenames `a/languages A to L` and `a/languages M to Z`). For almost all
purposes, you should work with logical and not physical pagenames. But there are certain use cases that require physical
pagenames, such as checking the existence of a page or retrieving a page's contents.
`pagename` is the logical pagename to be converted. `is_reconstructed_or_appendix` indicates whether the page is in the
`Reconstruction` or `Appendix` namespaces. If it is omitted or has the value {nil}, the pagename is checked for an
initial asterisk, and if found, the page is assumed to be a `Reconstruction` page. Setting a value of `false` or `true`
to `is_reconstructed_or_appendix` disables this check and allows for mainspace pagenames that begin with an asterisk.
]==]
function Language:logicalToPhysical(pagename, is_reconstructed_or_appendix)
-- FIXME: This probably shouldn't happen but it happens when makeEntryName() receives nil.
if pagename == nil then
track("nil-passed-to-logicalToPhysical")
return nil
end
local initial_asterisk
if is_reconstructed_or_appendix == nil then
local pagename_minus_initial_asterisk
initial_asterisk, pagename_minus_initial_asterisk = pagename:match("^(%*)(.*)$")
if pagename_minus_initial_asterisk then
is_reconstructed_or_appendix = true
pagename = pagename_minus_initial_asterisk
elseif self:hasType("appendix-constructed") then
is_reconstructed_or_appendix = true
end
end
if not is_reconstructed_or_appendix then
-- Check if the pagename is a listed unsupported title.
local unsupportedTitles = load_data(links_data_module).unsupported_titles
if unsupportedTitles[pagename] then
return "Tajuk tidak disokong/" .. unsupportedTitles[pagename]
end
end
-- Set `unsupported` as true if certain conditions are met.
local unsupported
-- Check if there's an unsupported character. \239\191\189 is the replacement character U+FFFD, which can't be typed
-- directly here due to an abuse filter. Unix-style dot-slash notation is also unsupported, as it is used for
-- relative paths in links, as are 3 or more consecutive tildes. Note: match is faster with magic
-- characters/charsets; find is faster with plaintext.
if (
match(pagename, "[#<>%[%]_{|}]") or
find(pagename, "\239\191\189") or
match(pagename, "%f[^%z/]%.%.?%f[%z/]") or
find(pagename, "~~~")
) then
unsupported = true
-- If it looks like an interwiki link.
elseif find(pagename, ":") then
local prefix = gsub(pagename, "^:*(.-):.*", ulower)
if (
load_data("Modul:data/namespaces")[prefix] or
load_data("Modul:data/interwikis")[prefix]
) then
unsupported = true
end
end
-- Escape unsupported characters so they can be used in titles. ` is used as a delimiter for this, so a raw use of
-- it in an unsupported title is also escaped here to prevent interference; this is only done with unsupported
-- titles, though, so inclusion won't in itself mean a title is treated as unsupported (which is why it's excluded
-- from the earlier test).
if unsupported then
-- FIXME: This conversion needs to be different for reconstructed pages with unsupported characters. There
-- aren't any currently, but if there ever are, we need to fix this e.g. to put them in something like
-- Reconstruction:Proto-Indo-European/Unsupported titles/`lowbar``num`.
local unsupported_characters = load_data(links_data_module).unsupported_characters
pagename = pagename:gsub("[#<>%[%]_`{|}\239]\191?\189?", unsupported_characters)
:gsub("%f[^%z/]%.%.?%f[%z/]", function(m)
return (gsub(m, "%.", "`period`"))
end)
:gsub("~~~+", function(m)
return (gsub(m, "~", "`tilde`"))
end)
pagename = "Tajuk tidak disokong/" .. pagename
elseif not is_reconstructed_or_appendix then
-- Check if this is a mammoth page. If so, which subpage should we link to?
local m_links_data = load_data(links_data_module)
local mammoth_page_type = m_links_data.mammoth_pages[pagename]
if mammoth_page_type then
local canonical_name = self:getFullName()
if canonical_name ~= "Rentas bahasa" and canonical_name ~= "Bahasa Melayu" then
local this_subpage
local L2_sort_key = get_L2_sort_key(canonical_name)
for _, subpage_spec in ipairs(m_links_data.mammoth_page_subpage_types[mammoth_page_type]) do
-- unpack() fails utterly on data loaded using mw.loadData() even if offsets are given
local subpage, pattern = subpage_spec[1], subpage_spec[2]
if pattern == true or L2_sort_key:match(pattern) then
this_subpage = subpage
break
end
end
if not this_subpage then
error(("Internal error: Bad data in mammoth_page_subpage_pages in [[Modul:links/data]] for mammoth page %s, type %s; last entry didn't have 'true' in it"):format(
pagename, mammoth_page_type))
end
pagename = pagename .. "/" .. this_subpage
end
end
end
return (initial_asterisk or "") .. pagename
end
--[==[
Strip the diacritics from a display pagename and convert the resulting logical pagename into a physical pagename.
This allows you, for example, to retrieve the contents of the page or check its existence. WARNING: This is deprecated
and will be going away. It is a simple composition of `##Language:stripDiacritics` and `##Language:logicalToPhysical`;
most callers only want the former, and if you need both, call them both yourself.
`text` and `sc` are as in `##Language:stripDiacritics`, and `is_reconstructed_or_appendix` is as in
`##Language:logicalToPhysical`.
]==]
function Language:makeEntryName(text, sc, is_reconstructed_or_appendix)
track("makeEntryName called")
return self:logicalToPhysical(self:stripDiacritics(text, sc), is_reconstructed_or_appendix)
end
--[==[
Generate term alternants (e.g. simplified versions of traditional Chinese terms) using a language-specific method, and
return them as a table. If the language provides no method for generating alternants, return a table containing only the
input term.
]==]
function Language:generateAlternants(text, sc)
local generate_alternants = self._data.generate_alternants
if generate_alternants == nil then
return {text}
end
sc = checkScript(text, self, sc)
return require("Modul:" .. generate_alternants).generateAlternants(text, self, sc)
end
--[==[
Create a sort key for the given stripped text, following the rules appropriate for the language. This removes
diacritical marks from the stripped text if they are not considered significant for sorting, and may perform some other
changes. Any initial hyphen is also removed, and anything in parentheses is removed as well. The `sort_key` setting for
each language in the data modules defines the replacements made by this function, or it gives the name of the module
that takes the stripped text and returns a sortkey.
]==]
function Language:makeSortKey(text, sc)
if (not text) or text == "" then
return text
end
if match(text, "<[^<>]+>") then
track("track HTML tag")
end
-- Remove directionality/control characters, bold, italics, soft hyphens, strip markers and HTML tags.
-- FIXME: Partly duplicated with remove_formatting() in [[Modul:links]].
text = ugsub(text, "[\194\173\216\156\226\128\142\226\128\143\226\128\170-\226\128\174\226\129\166-\226\129\175]", "")
text = text:gsub("('*)'''(.-'*)'''", "%1%2"):gsub("('*)''(.-'*)''", "%1%2")
text = gsub(unstrip(text), "<[^<>]+>", "")
text = decode_uri(text, "PATH")
text = checkNoEntities(text)
-- Remove initial hyphens and * unless the term only consists of spacing + punctuation characters.
text = ugsub(text, "^([-]*)[-־ـ᠊*]+([-]*)(.*[^%s%p].*)", "%1%2%3")
sc = checkScript(text, self, sc)
text = normalize(text, sc)
text = removeCarets(text, sc)
-- For languages with dotted dotless i, ensure that "İ" is sorted as "i", and "I" is sorted as "ı".
if self:hasDottedDotlessI() then
text = gsub(text, "I\204\135", "i") -- decomposed "İ"
:gsub("I", "ı")
text = sc:toFixedNFD(text)
end
-- Convert to lowercase, make the sortkey, then convert to uppercase. Where the language has dotted dotless i, it is
-- usually not necessary to convert "i" to "İ" and "ı" to "I" first, because "I" will always be interpreted as
-- conventional "I" (not dotless "İ") by any sorting algorithms, which will have been taken into account by the
-- sortkey substitutions themselves. However, if no sortkey substitutions have been specified, then conversion is
-- necessary so as to prevent "i" and "ı" both being sorted as "I".
--
-- An exception is made for scripts that (sometimes) sort by scraping page content, as that means they are sensitive
-- to changes in capitalization (as it changes the target page).
if not sc:sortByScraping() then
text = ulower(text)
end
local actual_substitution_data, _
-- Don't trim whitespace here because it's significant at the beginning of a sort key or sort base.
text, _, actual_substitution_data = iterateSectionSubstitutions(self, text, sc, nil, nil,
self._data.sort_key, "sort_key", "makeSortKey", "notrim")
if not sc:sortByScraping() then
if self:hasDottedDotlessI() and not actual_substitution_data then
text = text:gsub("ı", "I"):gsub("i", "İ")
text = sc:toFixedNFC(text)
end
text = uupper(text)
end
-- Remove parentheses, as long as they are either preceded or followed by something.
text = gsub(text, "(.)[()]+", "%1"):gsub("[()]+(.)", "%1")
text = escape_risky_characters(text)
return text
end
--[==[
Create the form used as as a basis for display text and transliteration. FIXME: Rename to correctInputText().
]==]
local function processDisplayText(text, self, sc, keepCarets, keepPrefixes)
local subbedChars = {}
text, subbedChars = doTempSubstitutions(text, subbedChars, keepCarets)
text = decode_uri(text, "PATH")
text = checkNoEntities(text)
sc = checkScript(text, self, sc)
text = normalize(text, sc)
text, subbedChars = iterateSectionSubstitutions(self, text, sc, subbedChars, keepCarets, self._data.display_text,
"display_text", "makeDisplayText")
text = removeCarets(text, sc)
-- Remove any interwiki link prefixes (unless they have been escaped or this has been disabled).
if find(text, ":") and not keepPrefixes then
local rep
repeat
text, rep = gsub(text, "\\\\(\\*:)", "\3%1")
until rep == 0
text = gsub(text, "\\:", "\4")
while true do
local prefix = gsub(text, "^(.-):.+", function(m1)
return (gsub(m1, "\244[\128-\191]*", ""))
end)
-- Check if the prefix is an interwiki, though ignore capitalised Wiktionary:, which is a namespace.
if not prefix or prefix == text or prefix == "Wikikamus"
or not (load_data("Modul:data/interwikis")[ulower(prefix)] or prefix == "") then
break
end
text = gsub(text, "^(.-):(.*)", function(m1, m2)
local ret = {}
for subbedChar in gmatch(m1, "\244[\128-\191]*") do
insert(ret, subbedChar)
end
return concat(ret) .. m2
end)
end
text = gsub(text, "\3", "\\"):gsub("\4", ":")
end
return text, subbedChars
end
--[==[
Make the display text (i.e. what is displayed on the page).
]==]
function Language:makeDisplayText(text, sc, keepPrefixes)
if not text or text == "" then
return text
end
local subbedChars
text, subbedChars = processDisplayText(text, self, sc, nil, keepPrefixes)
text = escape_risky_characters(text)
return undoTempSubstitutions(text, subbedChars)
end
--[==[
Transliterate the text from the given script into Latin script (see [[Wiktionary:Transliteration and romanization]]).
The language must have the `translit` property for this to work; if it is not present, {nil} is returned.
The `sc` parameter is handled by the transliteration module, and how it is handled is specific to that module. Some
transliteration modules may tolerate {nil} as the script, others require it to be one of the possible scripts that the
module can transliterate, and will throw an error if it's not one of them. For this reason, the `sc` parameter should
always be provided when writing non-language-specific code.
The `module_override` parameter is used to override the default module that is used to provide the transliteration.
This is useful in cases where you need to demonstrate a particular module in use, but there is no default module yet,
or you want to demonstrate an alternative version of a transliteration module before making it official. It should not
be used in real modules or templates, only for testing. All uses of this parameter are tracked by
[[Wiktionary:Tracking/languages/module_override]].
'''Known bugs''':
* This function assumes {tr(s1) .. tr(s2) == tr(s1 .. s2)}. When this assertion fails, wikitext markups like
<nowiki>'''</nowiki> can cause wrong transliterations.
* HTML entities like `&apos;`, often used to escape wikitext markups, do not work.
]==]
function Language:transliterate(text, sc, module_override)
-- If there is no text, or the language doesn't have transliteration data and there's no override, return nil.
if not text or text == "" or text == "-" then
return text
end
-- If the script is not transliteratable (and no override is given), return nil.
sc = checkScript(text, self, sc)
if not (sc:isTransliterated() or module_override) then
-- temporary tracking to see if/when this gets triggered
track("non-transliterable")
track("non-transliterable/" .. self._code)
track("non-transliterable/" .. sc:getCode())
track("non-transliterable/" .. sc:getCode() .. "/" .. self._code)
return nil
end
-- Remove any strip markers.
text = unstrip(text)
-- Do not process the formatting into PUA characters for certain languages.
local processed = load_data(languages_data_module).substitution[self._code] ~= "none"
-- Get the display text with the keepCarets flag set.
local subbedChars
if processed then
text, subbedChars = processDisplayText(text, self, sc, true)
end
-- Transliterate (using the module override if applicable).
text, subbedChars = iterateSectionSubstitutions(self, text, sc, subbedChars, true, module_override or
self._data.translit, "translit", "tr")
if not text then
return nil
end
-- Incomplete transliterations return nil.
local charset = sc.characters
if charset and umatch(text, "[" .. charset .. "]") then
-- Remove any characters in Latin, which includes Latin characters also included in other scripts (as these are
-- false positives), as well as any PUA substitutions. Anything remaining should only be script code "None"
-- (e.g. numerals).
local check_text = ugsub(text, "[" .. get_script("Latn").characters .. "-]+", "")
-- Set none_is_last_resort_only flag, so that any non-None chars will cause a script other than "None" to be
-- returned.
if find_best_script_without_lang(check_text, true):getCode() ~= "None" then
return nil
end
end
if processed then
text = escape_risky_characters(text)
text = undoTempSubstitutions(text, subbedChars)
end
-- If the script does not use capitalization, then capitalize any letters of the transliteration which are
-- immediately preceded by a caret (and remove the caret).
if text and not sc:hasCapitalization() and text:find("^", 1, true) then
text = processCarets(text, "%^([\128-\191\244]*%*?)([^\128-\191\244][\128-\191]*)", function(m1, m2)
return m1 .. uupper(m2)
end)
end
-- Track module overrides.
if module_override ~= nil then
track("module_override")
end
return text
end
do
local function handle_language_spec(self, spec, sc)
local ret = self["_" .. spec]
if ret == nil then
ret = self._data[spec]
if type(ret) == "string" then
ret = list_to_set(split(ret, ",", true, true))
end
self["_" .. spec] = ret
end
if type(ret) == "table" then
ret = ret[sc:getCode()]
end
return not not ret
end
function Language:overrideManualTranslit(sc)
return handle_language_spec(self, "override_translit", sc)
end
function Language:link_tr(sc)
return handle_language_spec(self, "link_tr", sc)
end
end
--[==[
Return {true} if the language has a transliteration module, or {false} if it doesn't.
]==]
function Language:hasTranslit()
return not not self._data.translit
end
--[==[
Return {true} if the language uses the letters I/ı and İ/i, or {false} if it doesn't.]==]
function Language:hasDottedDotlessI()
return not not self._data.dotted_dotless_i
end
function Language:toJSON(opts)
local strip_diacritics, strip_diacritics_patterns, strip_diacritics_remove_diacritics = self._data.strip_diacritics
if strip_diacritics then
if strip_diacritics.from then
strip_diacritics_patterns = {}
for i, from in ipairs(strip_diacritics.from) do
insert(strip_diacritics_patterns, {from = from, to = strip_diacritics.to[i] or ""})
end
end
strip_diacritics_remove_diacritics = strip_diacritics.remove_diacritics
end
-- mainCode should only end up non-nil if dontCanonicalizeAliases is passed to make_object().
-- props should either contain zero-argument functions to compute the value, or the value itself.
local props = {
ancestors = function() return self:getAncestorCodes() end,
canonicalName = function() return self:getCanonicalName() end,
categoryName = function() return self:getCategoryName("nocap") end,
code = self._code,
mainCode = self._mainCode,
parent = function() return self:getParentCode() end,
full = function() return self:getFullCode() end,
stripDiacriticsPatterns = strip_diacritics_patterns,
stripDiacriticsRemoveDiacritics = strip_diacritics_remove_diacritics,
family = function() return self:getFamilyCode() end,
aliases = function() return self:getAliases() end,
varieties = function() return self:getVarieties() end,
otherNames = function() return self:getOtherNames() end,
scripts = function() return self:getScriptCodes() end,
type = function() return keys_to_list(self:getTypes()) end,
wikimediaLanguages = function() return self:getWikimediaLanguageCodes() end,
wikidataItem = function() return self:getWikidataItem() end,
wikipediaArticle = function() return self:getWikipediaArticle(true) end,
}
local ret = {}
for prop, val in pairs(props) do
if not opts.skip_fields or not opts.skip_fields[prop] then
if type(val) == "function" then
ret[prop] = val()
else
ret[prop] = val
end
end
end
-- Use `deep_copy` when returning a table, so that there are no editing restrictions imposed by `mw.loadData`.
return opts and opts.lua_table and deep_copy(ret) or to_json(ret, opts)
end
function export.getDataModuleName(code)
local letter = match(code, "^(%l)%l%l?$")
return "Modul:" .. (
letter == nil and "languages/data/exceptional" or
#code == 2 and "languages/data/2" or
"languages/data/3/" .. letter
)
end
get_data_module_name = export.getDataModuleName
function export.getExtraDataModuleName(code)
return get_data_module_name(code) .. "/extra"
end
get_extra_data_module_name = export.getExtraDataModuleName
do
local function make_stack(data)
local key_types = {
[2] = "unique",
aliases = "unique",
otherNames = "unique",
type = "append",
varieties = "unique",
wikipedia_article = "unique",
wikimedia_codes = "unique"
}
local function __index(self, k)
local stack, key_type = getmetatable(self), key_types[k]
-- Data that isn't inherited from the parent.
if key_type == "unique" then
local v = stack[stack[make_stack]][k]
if v == nil then
local layer = stack[0]
if layer then -- Could be false if there's no extra data.
v = layer[k]
end
end
return v
-- Data that is appended by each generation.
elseif key_type == "append" then
local parts, offset, n = {}, 0, stack[make_stack]
for i = 1, n do
local part = stack[i][k]
if part == nil then
offset = offset + 1
else
parts[i - offset] = part
end
end
return offset ~= n and concat(parts, ",") or nil
end
local n = stack[make_stack]
while true do
local layer = stack[n]
if not layer then -- Could be false if there's no extra data.
return nil
end
local v = layer[k]
if v ~= nil then
return v
end
n = n - 1
end
end
local function __newindex()
error("table is read-only")
end
local function __pairs(self)
-- Iterate down the stack, caching keys to avoid duplicate returns.
local stack, seen = getmetatable(self), {}
local n = stack[make_stack]
local iter, state, k, v = pairs(stack[n])
return function()
repeat
repeat
k = iter(state, k)
if k == nil then
n = n - 1
local layer = stack[n]
if not layer then -- Could be false if there's no extra data.
return nil
end
iter, state, k = pairs(layer)
end
until not (k == nil or seen[k])
-- Get the value via a lookup, as the one returned by the
-- iterator will be the raw value from the current layer,
-- which may not be the one __index will return for that
-- key. Also memoize the key in `seen` (even if the lookup
-- returns nil) so that it doesn't get looked up again.
-- TODO: store values in `self`, avoiding the need to create
-- the `seen` table. The iterator will need to iterate over
-- `self` with `next` first to find these on future loops.
v, seen[k] = self[k], true
until v ~= nil
return k, v
end
end
local __ipairs = require(table_module).indexIpairs
function make_stack(data)
local stack = {
data,
[make_stack] = 1, -- stores the length and acts as a sentinel to confirm a given metatable is a stack.
__index = __index,
__newindex = __newindex,
__pairs = __pairs,
__ipairs = __ipairs,
}
stack.__metatable = stack
return setmetatable({}, stack), stack
end
return make_stack(data)
end
local function get_stack(data)
local stack = getmetatable(data)
return stack and type(stack) == "table" and stack[make_stack] and stack or nil
end
--[==[
<span style="color: var(--wikt-palette-red,#BA0000)">This function is not for use in entries or other content pages.</span>
Return a blob of data about the language. The format of this blob is undocumented, and perhaps unstable; it's intended
for things like the module's own unit-tests, which are "close friends" with the module and will be kept up-to-date as
the format changes. If `extra` is set, any extra data in the relevant `/extra` module will be included. (Note that it
will be included anyway if it has already been loaded into the language object.) If `raw` is set, then the returned data
will not contain any data inherited from parent objects.
-- Do NOT use these methods!
-- All uses should be pre-approved on the talk page!
]==]
function Language:getData(extra, raw)
if extra then
self:loadInExtraData()
end
local data = self._data
-- If raw is not set, just return the data.
if not raw then
return data
end
local stack = get_stack(data)
-- If there isn't a stack or its length is 1, return the data. Extra data (if any) will be included, as it's
-- stored at key 0 and doesn't affect the reported length.
if stack == nil then
return data
end
local n = stack[make_stack]
if n == 1 then
return data
end
extra = stack[0]
-- If there isn't any extra data, return the top layer of the stack.
if extra == nil then
return stack[n]
end
-- If there is, return a new stack which has the top layer at key 1 and the extra data at key 0.
data, stack = make_stack(stack[n])
stack[0] = extra
return data
end
function Language:loadInExtraData()
-- Only full languages have extra data.
if not self:hasType("language", "full") then
return
end
local data = self._data
-- If there's no stack, create one.
local stack = get_stack(self._data)
if stack == nil then
data, stack = make_stack(data)
-- If already loaded, return.
elseif stack[0] ~= nil then
return
end
self._data = data
-- Load extra data from the relevant module and add it to the stack at key 0, so that the __index and __pairs
-- metamethods will pick it up, since they iterate down the stack until they run out of layers.
local code = self._code
local modulename = get_extra_data_module_name(code)
-- No data cached as false.
stack[0] = modulename and load_data(modulename)[code] or false
end
--[==[
Return the name of the module containing the language's data, e.g. [[Modul:languages/data/3/k]] for three-letter codes
beginning with `k`.
]==]
function Language:getDataModuleName()
local name = self._dataModuleName
if name == nil then
name = self:hasType("etymology-only") and etymology_languages_data_module or
get_data_module_name(self._mainCode or self._code)
self._dataModuleName = name
end
return name
end
--[==[
Return the name of the module containing the language's extra data, e.g. [[Modul:languages/data/3/k/extra]] for
three-letter codes beginning with `k`.
]==]
function Language:getExtraDataModuleName()
local name = self._extraDataModuleName
if name == nil then
name = not self:hasType("etymology-only") and get_extra_data_module_name(self._mainCode or self._code) or false
self._extraDataModuleName = name
end
return name or nil
end
function export.makeObject(code, data, dontCanonicalizeAliases)
local data_type = type(data)
if data_type ~= "table" then
error(("bad argument #2 to 'makeObject' (table expected, got %s)"):format(data_type))
end
-- Convert any aliases.
local input_code = code
code = normalize_code(code)
input_code = dontCanonicalizeAliases and input_code or code
local parent
if data.parent then
parent = get_by_code(data.parent, nil, true, true)
else
parent = Language
end
parent.__index = parent
local lang = {_code = input_code}
-- This can only happen if dontCanonicalizeAliases is passed to make_object().
if code ~= input_code then
lang._mainCode = code
end
local parent_data = parent._data
if parent_data == nil then
-- Full code is the same as the code.
lang._fullCode = parent._code or code
else
-- Copy full code.
lang._fullCode = parent._fullCode
local stack = get_stack(parent_data)
if stack == nil then
parent_data, stack = make_stack(parent_data)
end
-- Insert the input data as the new top layer of the stack.
local n = stack[make_stack] + 1
data, stack[n], stack[make_stack] = parent_data, data, n
end
lang._data = data
return setmetatable(lang, parent)
end
make_object = export.makeObject
end
--[==[
Find the language whose code matches the one provided. If it exists, return a `Language` object representing the
language. Otherwise, return {nil}, unless `paramForError` is given, in which case an error is generated. If
`paramForError` is {true}, a generic error message mentioning the bad code is generated; otherwise `paramForError`
should be a string or number specifying the parameter that the code came from, and this parameter will be mentioned
in the error message along with the bad code. If `allowEtymLang` is specified, etymology-only language codes are allowed
and looked up along with full language codes. If `allowFamily` is specified, language family codes are allowed and
looked up along with normal language codes.
]==]
function export.getByCode(code, paramForError, allowEtymLang, allowFamily)
-- [[ Track uses of paramForError, ultimately so it can be removed, as error-handling should be done by
-- [[Modul:parameters]], not here. ]] -- I (Benwing) disagree; that is an idealistic goal unlikely to be achievable
-- realistically.
if paramForError ~= nil then
track("paramForError")
end
if type(code) ~= "string" then
local typ
if not code then
typ = "nil"
elseif check_object("language", true, code) then
typ = "sebuah objek bahasa"
elseif check_object("family", true, code) then
typ = "sebuah objek keluarga"
else
typ = "sebuah " .. type(code)
end
error("The function getByCode expects a string as its first argument, but received " .. typ .. ".")
end
local m_data = load_data(languages_data_module)
if m_data.aliases[code] or m_data.track[code] then
track(code)
end
local norm_code = normalize_code(code)
-- Get the data, checking for etymology-only languages if allowEtymLang is set.
local data = load_data(get_data_module_name(norm_code))[norm_code] or
allowEtymLang and load_data(etymology_languages_data_module)[norm_code]
-- If no data was found and allowFamily is set, check the family data. If the main family data was found, make the
-- object with [[Modul:families]] instead, as family objects have different methods. However, if it's an
-- etymology-only family, use make_object in this module (which handles object inheritance), and the
-- family-specific methods will be inherited from the parent object.
if data == nil and allowFamily then
data = load_data("Modul:families/data")[norm_code]
if data ~= nil then
if data.parent == nil then
return make_family_object(norm_code, data)
elseif not allowEtymLang then
data = nil
end
end
end
local retval = code and data and make_object(code, data)
if not retval and paramForError then
require("Modul:languages/errorGetBy").code(code, paramForError, allowEtymLang, allowFamily)
end
return retval
end
get_by_code = export.getByCode
--[==[
Find the language whose canonical name (the name used to represent that language on Wiktionary) or other name matches
the one provided. If it exists, return a `Language` object representing the language. Otherwise, return {nil}, unless
`paramForError` is given, in which case an error is generated. If `allowEtymLang` is specified, etymology-only language
codes are allowed and looked up along with full language codes. If `allowFamily` is specified, language family codes are
allowed and looked up along with normal language codes. The canonical name of languages should always be unique (it is
an error for two languages on Wiktionary to share the same canonical name), so this is guaranteed to give at most one
result. This function is powered by [[Modul:languages/canonical names]], which contains a pre-generated mapping of
full-language canonical names to codes. It is generated by going through the [[:Category:Language data modules]] for
full languages. When `allowEtymLang` is specified for the above function, [[Modul:etymology languages/canonical names]]
may also be used, and when `allowFamily` is specified for the above function, [[Modul:families/canonical names]] may
also be used.
]==]
function export.getByCanonicalName(name, errorIfInvalid, allowEtymLang, allowFamily)
local byName = load_data("Modul:languages/canonical names")
local code = byName and byName[name]
if not code and allowEtymLang then
byName = load_data("Modul:etymology languages/canonical names")
code = byName and byName[name] or
byName[gsub(name, "^[Ss]ubstratum", "")] or
byName[gsub(name, "^sebuah ", "")] or
byName[gsub(name, "^sebuah [Ss]ubstratum ", ""):gsub("", "")] or
-- For etymology families like "ira-pro".
-- FIXME: This is not ideal, as it allows " languages" to be appended to any etymology-only language, too.
byName[match(name, "^[Bb]ahasa%-bahasa (.*)$")]
end
if not code and allowFamily then
byName = load_data("Modul:families/canonical names")
code = byName[name] or byName[match(name, "^^[Bb]ahasa%-bahasa (.*)$")]
end
local retval = code and get_by_code(code, errorIfInvalid, allowEtymLang, allowFamily)
if not retval and errorIfInvalid then
require("Modul:languages/errorGetBy").canonicalName(name, allowEtymLang, allowFamily)
end
return retval
end
--[==[
Used by [[Modul:languages/data/2]] (et al.) and [[Modul:etymology languages/data]], [[Modul:families/data]],
[[Modul:scripts/data]] and [[Modul:writing systems/data]] to finalize the data into the format that is actually returned.
]==]
function export.finalizeData(data, main_type, variety)
local fields = {"type"}
if main_type == "language" then
insert(fields, 4) -- script codes
insert(fields, "ancestors")
insert(fields, "link_tr")
insert(fields, "override_translit")
insert(fields, "wikimedia_codes")
elseif main_type == "script" then
insert(fields, 3) -- writing system codes
end -- Families and writing systems have no extra fields to process.
local fields_len = #fields
for _, entity in next, data do
if variety then
-- Move parent from 3 to "parent" and family from "family" to 3. These are different for the sake of
-- convenience, since very few varieties have the family specified, whereas all of them have a parent.
entity.parent, entity[3] = entity[3], entity.family
entity.family = nil
-- Give the type "regular" iff not a variety and no other types are assigned.
elseif not (entity.type or entity.parent) then
entity.type = "regular"
end
for i = 1, fields_len do
local key = fields[i]
local field = entity[key]
if field and type(field) == "string" then
entity[key] = gsub(field, "%s*,%s*", ",")
end
end
end
return data
end
--[==[
For backwards compatibility only; modules should require the error themselves.
]==]
function export.err(lang_code, param, code_desc, template_tag, not_real_lang)
return require("Modul:languages/error")(lang_code, param, code_desc, template_tag, not_real_lang)
end
return export
dbicznkmimzt0t4bckchxj0kvhhiklz
375316
375314
2026-09-17T05:21:29Z
Hakimi97
2668
Membatalkan semakan [[Special:Diff/375314|375314]] oleh [[Special:Contributions/Hakimi97|Hakimi97]] ([[User talk:Hakimi97|bincang]]), module bahasa di Wikikamus Bahasa Inggeris masih sedang kemas kini, tunggu sehingga selesai dahulu baru kemas sekali gus
375316
Scribunto
text/plain
--[==[ intro:
Modul ini melaksanakan pengambilan maklumat khusus bahasa dan pemprosesan teks dalam bahasa yang diberikan.
===Jenis-jenis bahasa===
Terdapat dua jenis bahasa: bahasa penuh dan bahasa khusus etimologi. Perbezaan ketara ialah hanya bahasa penuh
yang muncul dalam tajuk L2 pada entri kosa kata, justeru kategori seperti [[:Kategori:Kata nama bahasa Perancis]] hanya
wujud untuk bahasa penuh. Bahasa khusus etimologi mempunyai sama ada bahasa penuh atau bahasa khusus etimologi yang
lain sebagai induknya (dalam erti pewarisan induk-anak), dan bagi bahasa khusus etimologi yang berindukkan bahasa
khusus etimologi yang lain, bahasa penuh sentiasa dapat diterbitkan dengan menuruti pautan induk ke atas. Contohnya,
"Perancis Kanada", kod `fr-CA`, ialah bahasa khusus etimologi yang berindukkan bahasa penuh "Perancis", kod `fr`.
Contoh bahasa khusus etimologi dengan induk khusus etimologi yang lain ialah "Inggeris Kuno Northumbria", kod `ang-nor`,
yang mempunyai "Inggeris Kuno Anglian", kod `ang-ang` sebagai induknya; ini ialah bahasa khusus etimologi yang induknya
ialah "Inggeris Kuno", kod `ang`, iaitu bahasa penuh. (Ini adalah kerana Inggeris Kuno Northumbria dianggap sebagai satu
variasi bagi Inggeris Kuno Anglian.) Kadangkala induknya ialah bahasa "Tidak Ditentukan", kod `und`; hal ini berlaku,
sebagai contoh, bagi bahasa-bahasa "substrat" seperti "Pra-Yunani", kod `qsb-grc`, dan "substrat BMAC", kod `qsb-bma`.
Adalah penting untuk membezakan ''induk'' bahasa daripada ''leluhur'' bahasa. Hubungan induk-anak ialah hubungan
pembendungan, iaitu jika X ialah anak kepada Y, X dianggap sebagai satu variasi bagi Y. Sebaliknya, hubungan
leluhur-keturunan ialah hubungan penurunan mengikut masa. Sebagai contoh, "Latin Klasik", kod `la-cla`, dan "Latin Akhir",
kod `la-lat`, kedua-duanya adalah bahasa khusus etimologi yang mempunyai "Latin", kod `la`, sebagai induknya, kerana
kedua-dua bahasa terdahulu merupakan variasi bagi bahasa Latin. Walau bagaimanapun, Latin Akhir *TIDAK* mempunyai
Latin Klasik sebagai induknya kerana Latin Akhir *bukan* variasi bagi Latin Klasik; sebaliknya, ia adalah keturunannya.
Sebenarnya terdapat medan `ancestors` berasingan yang digunakan untuk menyatakan hubungan leluhur-keturunan, dan
leluhur bagi Latin Akhir diberikan sebagai Latin Klasik. Perlu diambil perhatian juga bahawa kadangkala bahasa khusus
etimologi sebenarnya merupakan leluhur konseptual kepada bahasa induknya sendiri. Ini berlaku, misalnya, dengan
"Itali Kuno" (kod `roa-oit`), yang merupakan varian khusus etimologi bagi bahasa penuh "Itali" (kod `it`), dan dengan
"Latin Kuno" (kod `itc-ola`), yang merupakan varian khusus etimologi bagi Latin. Dalam kedua-dua kes, bahasa penuh
menyenaraikan varian khusus etimologi sebagai leluhur. Ini membolehkan sesuatu istilah Latin mewarisi daripada Latin Kuno
menggunakan templat {{tl|inh}} (di mana dalam templat ini, "pewarisan" merujuk kepada pewarisan keturunan/leluhur,
iaitu pewarisan mengikut garis masa, bukannya dalam erti induk-anak); begitu juga bagi bahasa Itali dan Itali Kuno.
Bahasa penuh terbahagi kepada tiga subjenis:
* {regular}: Ini menunjukkan bahasa penuh yang diperakui mengikut [[WT:CFI]] dan oleh itu dibenarkan dalam ruang nama
utama. Mungkin terdapat juga istilah yang direkonstruksi untuk bahasa tersebut, yang diletakkan dalam ruang
nama {Rekonstruksi} dan mesti diawali dengan tanda * untuk menunjukkan rekonstruksi. Kebanyakan bahasa penuh
ialah bahasa semula jadi (bukan bahasa buatan), namun beberapa bahasa buatan (cth. Esperanto dan Volapük,
antara lain) juga dibenarkan dalam ruang nama utama dan dianggap sebagai bahasa biasa.
* {reconstructed}: Bahasa ini tidak diperakui mengikut [[WT:CFI]], dan oleh itu hanya dibenarkan dalam ruang nama
{Rekonstruksi}. Semua istilah dalam bahasa ini adalah yang direkonstruksi, dan mesti diawali dengan
tanda *. Bahasa seperti Proto-Indo-Eropah dan Proto-Jermanik berada dalam kategori ini.
* {appendix-constructed}: Bahasa ini diperakui tetapi tidak memenuhi syarat tambahan yang ditetapkan untuk bahasa
buatan ([[WT:CFI#Constructed languages]]). Entrinya mestilah berada dalam ruang nama Lampiran,
tetapi ia tidak direkonstruksi dan oleh itu tidak sepatutnya diawali dengan tanda * dalam pautan.
Kebanyakan bahasa buatan tergolong dalam subjenis ini.
Kedua-dua bahasa penuh dan bahasa khusus etimologi mempunyai objek {Language} yang dikaitkan dengannya, yang diambil
menggunakan fungsi {getByCode} dalam [[Module:languages]] untuk menukar kod bahasa kepada objek {Language}. Bergantung
pada pilihan yang dibekalkan kepada fungsi ini, bahasa khusus etimologi mungkin diterima atau tidak, dan kod keluarga
mungkin diterima (mengembalikan objek {Family} seperti yang diterangkan dalam [[Module:families]]). Terdapat juga fungsi
{getByCanonicalName} yang berasingan dalam [[Module:languages]] dan [[Module:etymology languages]] untuk menukar nama
kanonik sesuatu bahasa kepada objek {Language} (bergantung pada sama ada nama kanonik merujuk kepada bahasa penuh atau
bahasa khusus etimologi).
===Perwakilan teks===
Rentetan teks yang tergolong dalam sesuatu bahasa hadir dalam beberapa ''varian teks'' yang berbeza:
# ''Teks input'' ialah teks yang dibekalkan oleh pengguna dalam teks wiki, dalam parameter kepada {{tl|m}}, {{tl|l}},
{{tl|ux}}, {{tl|t}}, {{tl|lang}} dan seumpamanya.
# ''Teks input yang diperbetul'' ialah teks input yang telah diterapkan beberapa pembetulan dan/atau penormalan,
seperti penggantian aksara lapuk atau salah bagi sesetengah bahasa, contohnya menggantikan `l` atau `1` kepada
[[palochka]] dalam beberapa bahasa yang ditulis dalam abjad Cyril. (AMARAN: Ini kini berjalan di bawah nama
''display text'' tetapi ia akan diubah peranannya di bawah. Selain itu, [[User:Surjection]] mencadangkan menamakan
semula ini sebagai ''normalized input text'', tetapi "normalized" digunakan dalam pengertian berbeza dalam [[Module:usex]].)
# ''Teks paparan'' ialah teks dalam bentuk sebagaimana yang akan dipaparkan kepada pengguna. Inilah yang muncul dalam
kata kepala, dalam contoh penggunaan (usex), dalam pautan dalaman yang dipaparkan, dsb. Ini boleh merangkumi tanda diakritik
yang dialih keluar untuk membentuk teks paparan jalur (lihat di bawah), serta pautan dalam kurungan bertanam yang
diproses selanjutnya melalui pelbagai kaedah. Teks paparan dijana daripada teks input yang diperbetul dengan menerapkan
penjelmaan khusus bahasa; untuk kebanyakan bahasa, tiada penjelmaan sedemikian. Sebab utama perbezaan antara teks input
dan teks paparan adalah untuk membolehkan maklumat tambahan dalam teks input yang tidak dipaparkan kepada pengguna tetapi
dihantar ke modul transliterasi. Ambil perhatian bahawa perbezaan paparan dan teks input buat masa ini hanya disokong
melalui pengendalian khas tetapi akan digeneralisasikan. Contoh transformasi ialah: (1) Mengalih keluar {{cd|^}} yang
digunakan dalam sesetengah bahasa Asia Timur (dan mungkin bahasa unikameral lain) untuk menandakan penulisan huruf besar
bagi transliterasi (yang pada masa ini dikendalikan secara khas); (2) untuk bahasa Korea, mengalih keluar atau memproses
tanda sempang (yang kini dikendalikan secara khas); (3) untuk bahasa Arab, mengalih keluar tanda diakritik ''sukun''
yang diletakkan di atas ''ta marbutah'' (seperti ini: ةْ) untuk menandakan bahawa ''ta marbutah'' dibunyikan dan
ditransliterasikan sebagai /t/ dan bukannya senyap [NOTA, BELUM DILAKSANAKAN]; (4) untuk bahasa Thai dan Khmer,
menukar perkataan yang dipisahkan ruang kepada perkataan berpasangan kurungan dan meleraikan penggantian ejaan semula
seperti `[กรีน/กฺรีน]`, yang menunjukkan cara mentransliterasikan perkataan yang diberikan [NOTA, BELUM DILAKSANAKAN
kecuali dalam templat khusus bahasa seperti {{tl|th-usex}}].
## ''Teks paparan leraian kanan'' ialah hasil daripada mengalih keluar tanda kurung pada pautan bertanam satu bahagian
dan meleraikan pautan bertanam dua bahagian kepada komponen sebelah kanannya (iaitu menukar pautan dua bahagian ke dalam
bentuk yang dipaparkan). Proses leraian kanan berlaku apabila anda memanggil fungsi {{cd|remove_links()}} dalam
[[Module:links]] pada sesuatu teks. Apabila diterapkan pada teks paparan, ia menghasilkan apa yang dilihat oleh
pengguna dengan tepat, tanpa sebarang penanda pautan.
# ''Teks paparan jalur'' ialah hasil daripada penerapan penanggalan tanda diakritik pada teks paparan.
## ''Teks paparan jalur leraian kiri'' [PERLU NAMA LEBIH BAIK] ialah hasil daripada penerapan leraian kiri pada teks
paparan jalur, iaitu serupa dengan leraian kanan tetapi meleraikan pautan bertanam dua bahagian kepada komponen
sebelah kirinya (iaitu halaman sasaran pautan). Jika teks paparan merujuk kepada satu halaman sahaja, hasil daripada
menerapkan penanggalan tanda diakritik dan leraian kiri akan menghasilkan ''nama halaman logik''.
# ''Teks nama halaman fizikal'' ialah hasil daripada penukaran teks paparan jalur kepada pautan halaman fizikal. Jika teks
paparan jalur mengandungi pautan bertanam, sebelah kiri pautan tersebut ditukar menjadi pautan halaman fizikal; jika
tidak, keseluruhan teks dianggap sebagai nama halaman dan ditukar dengan cara yang sama. Penukaran melakukan tiga perkara:
(1) menukar aksara yang tidak dibenarkan dalam nama halaman kepada perwakilan "tajuk tidak disokong", cth.
{{cd|Unsupported titles/`gt`}} menggantikan nama logik {{cd|>}}; (2) mengendalikan nama halaman logik tajuk tidak
disokong yang dikendalikan khas, seperti {{cd|Unsupported titles/Space}} menggantikan {{cd|[space]}} dan
{{cd|Unsupported titles/Ancient Greek dish}} menggantikan nama Yunani yang sangat panjang untuk hidangan gourmet
seperti yang terdapat dalam Aristophanes; (3) menukar nama halaman "gergasi" seperti [[a]] kepada komponen pisahan yang
sesuai, cth. [[a/languages A to L]].
# ''Teks transliterasi sumber'' ialah teks seperti yang dibekalkan kepada kaedah {{cd|transliterate()}} khusus bahasa. Bentuk
teks transliterasi sumber mungkin perlu khusus mengikut bahasa, cth. bahasa Thai dan Khmer memerlukan teks input yang
diperbetul, manakala bahasa lain mungkin perlu beroperasi daripada teks paparan. [AMARAN: Masih belum jelas bagaimana
pautan bertanam dalam tanda kurung dikendalikan dalam kod sedia ada.] Secara umumnya, pautan bertanam perlu dileraikan ke kanan
(lihat di atas), namun waktu proses ini berlaku masih belum jelas [AMARAN]. Sesetengah bahasa mempunyai skim potong-dan-cantum
yang menghantar bahagian teks melalui mekanisme transliterasi, dan untuk bahasa lain (yang disenaraikan dengan "cont"
dalam {{cd|substitution}} dalam [[Module:languages/data]]) ia menerima keseluruhan teks input tetapi telah dipraproses
melalui cara tertentu. (Kesesuaian kaedah ini masih belum jelas.)
# ''Teks transliterasi'' (atau ''transliterasi'') ialah hasil daripada mentransliterasikan teks transliterasi sumber.
Tidak seperti semua varian teks yang lain kecuali teks transkripsi, ia sentiasa berada dalam skrip Rumi (Latin).
# ''Teks transkripsi'' (atau ''transkripsi'') ialah hasil daripada mentranskripsikan teks transliterasi sumber, di mana
"transkripsi" di sini bermaksud anggaran yang hampir dengan bentuk fonetik bahasa dalam bahasa-bahasa (cth. Akkadia,
Sumeria, Mesir Purba, barangkali Tibet) yang mempunyai perbezaan ketara antara huruf bertulis dan bentuk pertuturan.
Tidak seperti semua varian teks lain selain teks transliterasi, ia sentiasa berada dalam skrip Rumi (Latin). Pada masa
ini, teks transkripsi sentiasa dibekalkan secara manual oleh pengguna; tiada kaedah {{cd|transcribe()}} pada objek bahasa.
# ''Kunci isih'' ialah teks yang digunakan dalam kunci isihan untuk menentukan kedudukan susunan halaman dalam kategori
yang disertainya. Kunci isih dijana daripada nama halaman atau ''asas isih'' tertentu dengan menukarkannya kepada huruf
kecil, melakukan penjelmaan khusus bahasa dan kemudian menukarkan hasilnya kepada huruf besar. Sekiranya asas isih
dibekalkan dan dijana daripada teks input, ia perlu ditukar kepada teks paparan, pautan bertanam dialih keluar melalui
leraian kanan dan penanggalan tanda diakritik diterapkan.
# Terdapat varian teks lain yang berlaku dalam contoh penggunaan / usex (khususnya, terdapat varian ternormal bagi
beberapa varian teks di atas), tetapi kita boleh melangkau bahagian tersebut buat masa ini.
Kaedah-kaedah berikut wujud pada objek {Language} untuk menukar antara varian teks yang berbeza:
# {correctInputText} (kini dipanggil {makeDisplayText}): Ini menukar teks input kepada teks input yang diperbetul.
# {stripDiacritics}: Ini menukar kepada teks paparan jalur. [AMARAN: Ini memerlukan penelitian semula. Khususnya,
{stripDiacritics} kadangkala dipanggil pada teks input, teks input yang diperbetul atau teks paparan (dalam pelbagai
laluan di dalam [[Module:links]], dan, dalam kes teks input, biasanya daripada modul lain). Kita perlu memastikan kita
tidak cuba menukar teks input kepada teks paparan sebanyak dua kali, namun pada masa yang sama kita perlu menyokong
panggilan terus padanya bagi teks input memandangkan banyak modul berbuat demikian. Ini bermakna kita perlu menambah
parameter yang menandakan sama ada teks yang dimasukkan ialah teks input, teks input yang diperbetul, atau teks paparan;
jika dua yang pertama, kita memanggil {correctInputText} secara automatik.]
# {logicalToPhysical}: Ini menukar nama halaman logik kepada nama halaman fizikal.
# {transliterate}: Ini berfungsi menukar teks input dengan tanda kurung bertanam yang dialih keluar kepada transliterasi.
[AMARAN: Ini memerlukan penelitian semula. Khususnya, ia memanggil {processDisplayText} pada inputnya, yang tidak akan
berfungsi untuk bahasa Thai dan Khmer, jadi kita mungkin memerlukan bendera khusus bahasa yang menandakan sama ada
untuk menghantar teks input secara terus kepada kaedah transliterasi bahasa. Selain itu, saya tidak pasti bagaimana
pautan bertanam dikendalikan dalam kod transliterasi sedia ada; banyak pemanggil mengalih keluar pautan sendiri sebelum
memanggil {transliterate()}, yang saya anggap kurang tepat.]
# {makeSortKey}: Ini menukar teks paparan (?) kepada kunci isih. [AMARAN: Perlu perjelasan.]
]==]
local export = {}
local debug_track_module = "Modul:debug/track"
local etymology_languages_data_module = "Modul:etymology languages/data"
local families_module = "Modul:families"
local headword_page_module = "Modul:headword/page"
local json_module = "Modul:JSON"
local language_like_module = "Modul:language-like"
local languages_data_module = "Modul:languages/data"
local languages_data_patterns_module = "Modul:languages/data/patterns"
local links_data_module = "Modul:links/data"
local load_module = "Modul:load"
local scripts_module = "Modul:scripts"
local scripts_data_module = "Modul:scripts/data"
local string_encode_entities_module = "Modul:string/encode entities"
local string_pattern_escape_module = "Modul:string/patternEscape"
local string_replacement_escape_module = "Modul:string/replacementEscape"
local string_utilities_module = "Modul:string utilities"
local table_module = "Modul:table"
local utilities_module = "Modul:utilities"
local wikimedia_languages_module = "Modul:wikimedia languages"
local mw = mw
local string = string
local table = table
local char = string.char
local concat = table.concat
local find = string.find
local floor = math.floor
local get_by_code -- Ditakrifkan di bawah.
local get_data_module_name -- Ditakrifkan di bawah.
local get_extra_data_module_name -- Ditakrifkan di bawah.
local getmetatable = getmetatable
local gmatch = string.gmatch
local gsub = string.gsub
local insert = table.insert
local ipairs = ipairs
local is_known_language_tag = mw.language.isKnownLanguageTag
local make_object -- Ditakrifkan di bawah.
local match = string.match
local next = next
local pairs = pairs
local remove = table.remove
local require = require
local select = select
local setmetatable = setmetatable
local sub = string.sub
local type = type
local unstrip = mw.text.unstrip
-- Dimuatkan mengikut keperluan oleh findBestScript.
local Hans_chars
local Hant_chars
local function check_object(...)
check_object = require(utilities_module).check_object
return check_object(...)
end
local function debug_track(...)
debug_track = require(debug_track_module)
return debug_track(...)
end
local function decode_entities(...)
decode_entities = require(string_utilities_module).decode_entities
return decode_entities(...)
end
local function decode_uri(...)
decode_uri = require(string_utilities_module).decode_uri
return decode_uri(...)
end
local function deep_copy(...)
deep_copy = require(table_module).deepCopy
return deep_copy(...)
end
local function encode_entities(...)
encode_entities = require(string_encode_entities_module)
return encode_entities(...)
end
local function get_L2_sort_key(...)
get_L2_sort_key = require(headword_page_module).get_L2_sort_key
return get_L2_sort_key(...)
end
local function get_script(...)
get_script = require(scripts_module).getByCode
return get_script(...)
end
local function find_best_script_without_lang(...)
find_best_script_without_lang = require(scripts_module).findBestScriptWithoutLang
return find_best_script_without_lang(...)
end
local function get_family(...)
get_family = require(families_module).getByCode
return get_family(...)
end
local function get_plaintext(...)
get_plaintext = require(utilities_module).get_plaintext
return get_plaintext(...)
end
local function get_wikimedia_lang(...)
get_wikimedia_lang = require(wikimedia_languages_module).getByCode
return get_wikimedia_lang(...)
end
local function keys_to_list(...)
keys_to_list = require(table_module).keysToList
return keys_to_list(...)
end
local function list_to_set(...)
list_to_set = require(table_module).listToSet
return list_to_set(...)
end
local function load_data(...)
load_data = require(load_module).load_data
return load_data(...)
end
local function make_family_object(...)
make_family_object = require(families_module).makeObject
return make_family_object(...)
end
local function pattern_escape(...)
pattern_escape = require(string_pattern_escape_module)
return pattern_escape(...)
end
local function replacement_escape(...)
replacement_escape = require(string_replacement_escape_module)
return replacement_escape(...)
end
local function safe_require(...)
safe_require = require(load_module).safe_require
return safe_require(...)
end
local function shallow_copy(...)
shallow_copy = require(table_module).shallowCopy
return shallow_copy(...)
end
local function split(...)
split = require(string_utilities_module).split
return split(...)
end
local function to_json(...)
to_json = require(json_module).toJSON
return to_json(...)
end
local function u(...)
u = require(string_utilities_module).char
return u(...)
end
local function ugsub(...)
ugsub = require(string_utilities_module).gsub
return ugsub(...)
end
local function ulen(...)
ulen = require(string_utilities_module).len
return ulen(...)
end
local function ulower(...)
ulower = require(string_utilities_module).lower
return ulower(...)
end
local function umatch(...)
umatch = require(string_utilities_module).match
return umatch(...)
end
local function uupper(...)
uupper = require(string_utilities_module).upper
return uupper(...)
end
local function track(page)
debug_track("languages/" .. page)
return true
end
local function normalize_code(code)
return load_data(languages_data_module).aliases[code] or code
end
local function check_inputs(self, check, default, ...)
local n = select("#", ...)
if n == 0 then
return false
end
local ret = check(self, (...))
if ret ~= nil then
return ret
elseif n > 1 then
local inputs = {...}
for i = 2, n do
ret = check(self, inputs[i])
if ret ~= nil then
return ret
end
end
end
return default
end
local function make_link(self, target, display)
local prefix, main
if self:getFamilyCode() == "qfa-sub" then
prefix, main = display:match("^(the )(.*)")
if not prefix then
prefix, main = display:match("^(a )(.*)")
end
end
return (prefix or "") .. "[[" .. target .. "|" .. (main or display) .. "]]"
end
-- Menukar aksara berisiko kepada entiti HTML, yang meminimumkan gangguan setelah dikembalikan (cth. untuk "sms:a", "<!-- -->" dsb.).
local function escape_risky_characters(text)
-- Aksara penjarakan secara berasingan secara amnya perlu dilepaskan untuk diproses dengan betul oleh perisian MediaWiki.
if umatch(text, "^%s*$") then
return encode_entities(text, text)
end
return encode_entities(text, "!#%&*+/:;<=>?@[\\]_{|}")
end
-- Menukar pelbagai aksara pemformatan kepada PUA buat sementara waktu bagi mengelakkannya terganggu oleh proses penggantian.
local function doTempSubstitutions(text, subbedChars, keepCarets, noTrim)
-- Klon supaya kita tidak menyelitkan sebarang corak tambahan ke dalam jadual dalam package.loaded. Atas sebab tertentu, penggunaan require dilihat dapat mengekalkan penggunaan memori yang rendah; mungkin kerana jadual sentiasa diklon.
local patterns = shallow_copy(require(languages_data_patterns_module))
if keepCarets then
insert(patterns, "((\\+)%^)")
insert(patterns, "((%^))")
end
-- Memastikan sebarang ruang putih pada permulaan dan penghujung digantikan sementara, untuk mengelakkannya daripada dipangkas secara tidak sengaja. Kita hanya mahu memangkas sebarang ruang akhir yang ditambah semasa proses penggantian (cth. oleh modul), yang bermaksud kita hanya melakukan ini semasa pusingan pertama penggantian sementara.
if not noTrim then
insert(patterns, "^([\128-\191\244]*(%s+))")
insert(patterns, "((%s+)[\128-\191\244]*)$")
end
-- Pra-penggantian bagi "[[" dan "]]", yang menjadikan pemadanan corak lebih tepat.
text = gsub(text, "%f[%[]%[%[", "\1"):gsub("%f[%]]%]%]", "\2")
local i = #subbedChars
for _, pattern in ipairs(patterns) do
-- Corak yang berakhir dengan \0 adalah untuk perkara seperti "[[" atau "]]"), jadi PUA yang diselitkan dianggap sebagai pemisah antara istilah oleh modul yang mengikis maklumat daripada halaman.
local term_divider
pattern = gsub(pattern, "%z$", function(divider)
term_divider = divider == "\0"
return ""
end)
text = gsub(text, pattern, function(...)
local m = {...}
local m1New = m[1]
for k = 2, #m do
local n = i + k - 1
subbedChars[n] = m[k]
local byte2 = floor(n / 4096) % 64 + (term_divider and 128 or 136)
local byte3 = floor(n / 64) % 64 + 128
local byte4 = n % 64 + 128
m1New = gsub(m1New, pattern_escape(m[k]), "\244" .. char(byte2) .. char(byte3) .. char(byte4), 1)
end
i = i + #m - 1
return m1New
end)
end
text = gsub(text, "\1", "%[%["):gsub("\2", "%]%]")
return text, subbedChars
end
-- Menyisip semula sebarang pemformatan yang digantikan buat sementara waktu.
local function undoTempSubstitutions(text, subbedChars)
for i = 1, #subbedChars do
local byte2 = floor(i / 4096) % 64 + 128
local byte3 = floor(i / 64) % 64 + 128
local byte4 = i % 64 + 128
text = gsub(text, "\244[" .. char(byte2) .. char(byte2+8) .. "]" .. char(byte3) .. char(byte4),
replacement_escape(subbedChars[i]))
end
text = gsub(text, "\1", "%[%["):gsub("\2", "%]%]")
return text
end
-- Menyemak sama ada teks mentah ialah tajuk yang tidak disokong, dan jika ya kembalikannya. Jika tidak, alih keluar entiti HTML. Kita melakukan pra-penukaran untuk mengelakkan pemuatan senarai tajuk tidak disokong tanpa keperluan.
local function checkNoEntities(self, text)
local textNoEnc = decode_entities(text)
if textNoEnc ~= text and load_data(links_data_module).unsupported_titles[text] then
return text
else
return textNoEnc
end
end
-- Jika tiada objek skrip disediakan (atau jika tidak sah atau None), dapatkan satu.
local function checkScript(text, self, sc)
if not check_object("script", true, sc) or sc:getCode() == "None" then
return self:findBestScript(text)
end
return sc
end
local function normalize(text, sc)
text = sc:fixDiscouragedSequences(text)
return sc:toFixedNFD(text)
end
-- Subfungsi bagi iterateSectionSubstitutions(). Memproses bahagian teks individu mengikut spesifikasi dalam
-- `substitution_data`. Parameter input adalah seperti dalam dokumentasi iterateSectionSubstitutions() kecuali untuk
-- `recursed`, yang ditetapkan kepada true jika kita memanggil diri sendiri secara rekursif untuk memproses tetapan
-- khusus skrip atau sandaran seluruh skrip. Mengembalikan dua nilai: teks yang diproses dan data penggantian sebenar yang digunakan untuk melakukan penggantian (sama seperti nilai pulangan `actual_substitution_data` kepada iterateSectionSubstitutions()).
local function doSubstitutions(self, text, sc, substitution_data, data_field, function_name, recursed)
-- BERHATI-HATI dalam fungsi ini kerana nilai pada mana-mana peringkat boleh bernilai `false`, yang menyebabkan tiada pemprosesan dilakukan
-- dan menyekat sebarang pemprosesan sandaran selanjutnya.
local actual_substitution_data = substitution_data
-- Jika terdapat pengganti khusus bahasa yang diberikan dalam modul data, gunakannya.
if type(substitution_data) == "table" then
-- Jika skrip dinyatakan, jalankan fungsi ini dengan data khusus skrip sebelum meneruskan.
local sc_code = sc:getCode()
local has_substitution_data = false
if substitution_data[sc_code] ~= nil then
has_substitution_data = true
if substitution_data[sc_code] then
text, actual_substitution_data = doSubstitutions(self, text, sc, substitution_data[sc_code], data_field,
function_name, true)
end
-- Hant, Hans dan Hani biasanya dilayan sama, jadi tambah kes khas untuk mengelakkan daripada menyatakan setiap satu
-- secara berasingan.
elseif sc_code:match("^Han") and substitution_data.Hani ~= nil then
has_substitution_data = true
if substitution_data.Hani then
text, actual_substitution_data = doSubstitutions(self, text, sc, substitution_data.Hani, data_field,
function_name, true)
end
-- Data penggantian dengan kunci 1 dalam jadual luar boleh diberikan sebagai sandaran.
elseif substitution_data[1] ~= nil then
has_substitution_data = true
if substitution_data[1] then
text, actual_substitution_data = doSubstitutions(self, text, sc, substitution_data[1], data_field,
function_name, true)
end
end
-- Mengulangi semua rentetan dalam subjadual "from", dan lakukan gsub dengan rentetan sepadan dalam "to". Kita bekerja dengan
-- bentuk terurai NFD, kerana ini memudahkan banyak penggantian.
if substitution_data.from then
has_substitution_data = true
for i, from in ipairs(substitution_data.from) do
-- Menormalkan setiap gelung, untuk memastikan penggantian pelbagai peringkat berfungsi dengan betul.
text = sc:toFixedNFD(text)
text = ugsub(text, sc:toFixedNFD(from), substitution_data.to[i] or "")
end
end
if substitution_data.remove_diacritics then
has_substitution_data = true
text = sc:toFixedNFD(text)
-- Menukar pengecualian kepada PUA.
local remove_exceptions, substitutes = substitution_data.remove_exceptions
if remove_exceptions then
substitutes = {}
local i = 0
for _, exception in ipairs(remove_exceptions) do
exception = sc:toFixedNFD(exception)
text = ugsub(text, exception, function(m)
i = i + 1
local subst = u(0x80000 + i)
substitutes[subst] = m
return subst
end)
end
end
-- Menanggalkan tanda diakritik.
text = ugsub(text, "[" .. substitution_data.remove_diacritics .. "]", "")
-- Menukar pengecualian kembali.
if remove_exceptions then
text = text:gsub("\242[\128-\191]*", substitutes)
end
end
if not has_substitution_data and sc._data[data_field] then
-- Jika kunci isih khusus bahasa (dsb.) adalah nil, kembali kepada kunci isih seluruh skrip (dsb.).
text, actual_substitution_data = doSubstitutions(self, text, sc, sc._data[data_field], data_field,
function_name, true)
end
elseif type(substitution_data) == "string" then
-- Jika terdapat modul fungsi khusus, gunakannya.
local module = safe_require("Modul:" .. substitution_data)
if module then
-- TODO: fungsi translit sepatutnya menerima objek, bukan kod.
-- TODO: fungsi translit sepatutnya dipanggil dengan bentuk NFD.
if function_name == "tr" then
if not module[function_name] then
error(("Ralat dalaman: Modul [[%s]] tidak mempunyai fungsi bernama 'tr'"):format(substitution_data))
end
text = module[function_name](text, self._code, sc:getCode())
elseif function_name == "stripDiacritics" then
-- AMARAN: buang cabang ini selepas menamakan semula makeEntryName -> stripDiacritics.
if module[function_name] then
text = module[function_name](sc:toFixedNFD(text), self, sc)
elseif module.makeEntryName then
text = module.makeEntryName(sc:toFixedNFD(text), self, sc)
else
error(("Ralat dalaman: Modul [[%s]] tidak mempunyai fungsi bernama 'stripDiacritics' atau 'makeEntryName'"
):format(substitution_data))
end
else
if not module[function_name] then
error(("Ralat dalaman: Modul [[%s]] tidak mempunyai fungsi bernama '%s'"):format(
substitution_data, function_name))
end
text = module[function_name](sc:toFixedNFD(text), self, sc)
end
else
error("Data penggantian '" .. substitution_data .. "' tidak sepadan dengan modul sedia ada.")
end
elseif substitution_data == nil and sc._data[data_field] then
-- Jika kunci isih khusus bahasa (dsb.) adalah nil, kembali kepada kunci isih seluruh skrip (dsb.).
text, actual_substitution_data = doSubstitutions(self, text, sc, sc._data[data_field], data_field,
function_name, true)
end
-- Jangan normalkan kepada NFC jika ini ialah gelung dalaman atau jika modul mengembalikan nil.
if recursed or not text then
return text, actual_substitution_data
end
-- Memperbetul sebarang urutan yang tidak digalakkan yang terhasil semasa proses penggantian, dan normalkan ke dalam bentuk akhir.
return sc:toFixedNFC(sc:fixDiscouragedSequences(text)), actual_substitution_data
end
-- Memecahkan teks kepada beberapa bahagian berdasarkan kehadiran aksara pemformatan yang digantikan sementara, kemudian mengulangi
-- setiap bahagian untuk menerapkan penggantian (cth. transliterasi atau penanggalan tanda diakritik). Ini mengelakkan aksara PUA
-- daripada melalui modul khusus bahasa yang mungkin tidak dilengkapi untuk mengendalikannya. Fungsi ini menerima nilai-nilai berikut:
-- * `self` (objek Language);
-- * `text` (teks untuk diproses);
-- * `sc` (skrip teks, yang mesti dinyatakan; pemanggil perlu memanggil checkScript() mengikut keperluan untuk mengesan secara automatik
-- skrip teks jika tidak diberikan secara jelas oleh pengguna);
-- * `subbedChars` (tatasusunan yang sama panjang dengan teks, menunjukkan aksara mana yang telah digantikan dan dengan apa,
-- atau {nil} jika tiada penggantian dilakukan);
-- * `keepCarets` (DOKUMENKAN SAYA);
-- * `substitution_data` (data yang menunjukkan penggantian mana yang perlu diterapkan, diambil terus daripada `data_field` dalam
-- struktur data bahasa dalam submodul [[Module:languages/data]]);
-- * `data_field` (medan data tempat `substitution_data` diambil, seperti "sort_key" atau "strip_diacritics");
-- * `function_name` (nama fungsi yang perlu dipanggil untuk melakukan penggantian, sekiranya `substitution_data` menyatakan
-- modul untuk melakukan penggantian);
-- * `notrim` (jangan pangkas ruang putih pada tepi `text`; ditetapkan semasa mengira kunci isih, kerana ruang putih pada
-- permulaan kunci isih adalah bermakna dan menyebabkan halaman yang terhasil disusun di bahagian awal kategori yang disertainya).
-- Mengembalikan tiga nilai:
-- (1) teks yang diproses;
-- (2) nilai `subbedChars` yang dimasukkan, mungkin diubah suai dengan penggantian aksara tambahan; akan bernilai {nil}
-- jika {nil} dimasukkan;
-- (3) data penggantian sebenar yang digunakan untuk menerapkan penggantian pada `text`; ini mungkin berbeza daripada nilai
-- `substitution_data` yang dimasukkan jika nilai itu secara rekursif menyatakan penggantian khusus skrip atau jika tiada
-- data penggantian ditemui dalam data khusus bahasa (cth. {nil} dimasukkan atau struktur dimasukkan yang tidak mempunyai
-- tetapan untuk skrip yang diberikan dalam `sc`), tetapi nilai sandaran seluruh skrip ditetapkan; buat masa ini ia
-- hanya digunakan oleh makeSortKey().
local function iterateSectionSubstitutions(self, text, sc, subbedChars, keepCarets, substitution_data, data_field,
function_name, notrim)
local sections
-- Lihat [[Module:languages/data]].
if not find(text, "\244") or load_data(languages_data_module).substitution[self._code] == "cont" then
sections = {text}
else
sections = split(text, "\244[\128-\143][\128-\191]*", true)
end
local actual_substitution_data
for _, section in ipairs(sections) do
-- Abaikan rentetan kosong atau ruang putih (yang mungkin juga tidak dikendalikan dengan baik oleh modul khusus).
if gsub(section, "%s+", "") ~= "" then
local sub, this_actual_substitution_data = doSubstitutions(self, section, sc, substitution_data, data_field,
function_name)
actual_substitution_data = this_actual_substitution_data
-- Pusingan kedua penggantian sementara, sekiranya terdapat sebarang pemformatan yang ditambah oleh proses penggantian
-- utama. Walau bagaimanapun, jangan lakukan ini jika bahagian tersebut sudah mengandungi pemformatan (kerana ia sepatutnya
-- telah dilepaskan untuk sampai ke peringkat ini, dan oleh itu harus diberikan sebagai teks mentah).
if sub and subbedChars then
local noSub
for _, pattern in ipairs(require(languages_data_patterns_module)) do
if match(section, pattern .. "%z?") then
noSub = true
end
end
if not noSub then
sub, subbedChars = doTempSubstitutions(sub, subbedChars, keepCarets, true)
end
end
if not sub then
text = sub
break
end
text = sub and gsub(text, pattern_escape(section), replacement_escape(sub), 1) or text
end
end
if not notrim then
-- Pangkas, melainkan hanya terdapat aksara ruang, sambil mengabaikan sebarang aksara pemformatan akhir.
-- Jangan pangkas kunci isih kerana ruang pada permulaan adalah bermakna.
text = text and text:gsub("^([\128-\191\244]*)%s+(%S)", "%1%2"):gsub("(%S)%s+([\128-\191\244]*)$", "%1%2") or
nil
end
return text, subbedChars, actual_substitution_data
end
-- Memproses tanda sisip (caret) (dan sebarang pelepasan). Lalai kepada penyingkiran mudah, jika tiada corak/penggantian diberikan.
local function processCarets(text, pattern, repl)
local rep
repeat
text, rep = gsub(text, "\\\\(\\*^)", "\3%1")
until rep == 0
return (text:gsub("\\^", "\4")
:gsub(pattern or "%^", repl or "")
:gsub("\3", "\\")
:gsub("\4", "^"))
end
-- Mengalih keluar tanda sisip jika ia digunakan untuk menulis huruf besar pada bahagian transliterasi (melainkan ia telah dilepaskan).
local function removeCarets(text, sc)
if not sc:hasCapitalization() and sc:isTransliterated() and text:find("^", 1, true) then
return processCarets(text)
else
return text
end
end
local Language = {}
--[==[Mengembalikan kod bahasa bagi sesuatu bahasa. Contoh: {{code|lua|"fr"}} untuk bahasa Perancis.]==]
function Language:getCode()
return self._code
end
--[==[Mengembalikan nama kanonik bahasa. Ini ialah nama yang digunakan untuk mewakili bahasa tersebut di Wiktionary, dan dijamin unik untuk bahasa itu sahaja. Contoh: {{code|lua|"French"}} untuk bahasa Perancis.]==]
function Language:getCanonicalName()
local name = self._name
if name == nil then
name = self._data[1]
self._name = name
end
return name
end
--[==[
Mengembalikan bentuk paparan bagi bahasa. Bentuk paparan bahasa, keluarga atau skrip ialah bentuk yang diambil apabila
muncul sebagai <code><var>source</var></code> dalam kategori seperti <code>Istilah bahasa Inggeris yang diterbitkan daripada
<var>source</var></code> atau <code>Nama khas bahasa Inggeris daripada <var>source</var></code>, dan juga merupakan teks paparan
dalam pautan {makeCategoryLink()}. Bagi bahasa penuh dan bahasa khusus etimologi, bentuk ini adalah sama seperti nama kanonik, tetapi
bagi keluarga bahasa, ia ditulis sebagai <code>"bahasa-bahasa <var>nama</var>"</code> (cth. {"bahasa-bahasa Indo-Iran"}), dan bagi skrip,
ia ditulis sebagai <code>"skrip <var>nama</var>"</code> (cth. {"skrip Arab"}).
]==]
function Language:getDisplayForm()
local form = self._displayForm
if form == nil then
form = self:getCanonicalName()
-- Tambah kata sandang dan " substrat" pada substrat yang memerlukannya.
if self:getFamilyCode() == "qfa-sub" then
if not (sub(form, 1, 4) == "the " or sub(form, 1, 2) == "a ") then
form = "a " .. form
end
if not match(form, " [Ss]ubstrate") then
form = form .. " substrate"
end
end
self._displayForm = form
end
return form
end
--[==[Mengembalikan nilai yang sepatutnya digunakan dalam atribut lang= HTML untuk teks bertag dalam bahasa berkenaan.]==]
function Language:getHTMLAttribute(sc, region)
local code = self._code
if not find(code, "-", 1, true) then
return code .. "-" .. sc:getCode() .. (region and "-" .. region or "")
end
local parent = self:getParent()
region = region or match(code, "%f[%u][%u-]+%f[%U]")
if parent then
return parent:getHTMLAttribute(sc, region)
end
-- TODO: Kod keluarga ISO juga boleh digunakan.
return "mis-" .. sc:getCode() .. (region and "-" .. region or "")
end
--[==[Mengembalikan jadual alias yang diketahui untuk bahasa tersebut, tidak termasuk nama kanonik. Alias ialah sinonim bagi bahasa yang dipersoalkan. Nama tidak dijamin unik, di mana kadangkala lebih daripada satu bahasa dikenali dengan nama yang sama. Contoh: {{code|lua|{"High German", "New High German", "Deutsch"} }} untuk [[:Kategori:Bahasa Jerman|Bahasa Jerman]].]==]
function Language:getAliases()
self:loadInExtraData()
return require(language_like_module).getAliases(self)
end
--[==[
Mengembalikan jadual subvariasi yang diketahui bagi sesuatu bahasa, tidak termasuk subvariasi yang telah diberikan
kod bahasa khusus etimologi yang jelas. Nama tidak dijamin unik, di mana kadangkala nama tertentu merujuk kepada
subvariasi lebih daripada satu bahasa. Contoh: {{code|lua|{"Aymara Selatan", "Aymara Tengah"} }} untuk
[[:Kategori:Bahasa Aymara|Bahasa Aymara]]. Ambil perhatian bahawa nilai yang dikembalikan boleh mengandungi jadual bersarang,
apabila subvariasi dikenali dengan lebih daripada satu nama. Contoh: {{code|lua|{"Azerbaijan Utara", "Azerbaijan Selatan",
{"Afshar", "Afshari", "Azerbaijan Afshar", "Afchar"}, {"Qashqa'i", "Qashqai", "Kashkay"}, "Sonqor"} }} untuk
[[:Kategori:Bahasa Azerbaijan|Bahasa Azerbaijan]]. Di sini, contohnya, Afshar, Afshari, Azerbaijan Afshar dan Afchar
kesemuanya merujuk kepada subvariasi yang sama, dengan nama pilihan ialah Afshar (yang disenaraikan pertama). Untuk mengelakkan
nilai pulangan yang mengandungi jadual bersarang, nyatakan nilai bukan {{code|lua|nil}} untuk parameter <code>flatten</code>;
dalam kes tersebut, nilai yang dikembalikan adalah {{code|lua|{"Azerbaijan Utara", "Azerbaijan Selatan", "Afshar", "Afshari",
"Azerbaijan Afshar", "Afchar", "Qashqa'i", "Qashqai", "Kashkay", "Sonqor"} }}.
]==]
function Language:getVarieties(flatten)
self:loadInExtraData()
return require(language_like_module).getVarieties(self, flatten)
end
--[==[Mengembalikan jadual "nama lain" yang diketahui bagi bahasa tersebut, yang disenaraikan dalam medan <code>otherNames</code>. Perlu dinyatakan bahawa medan <code>otherNames</code> itu sendiri telah lapuk, dan entri yang disenaraikan di situ akhirnya perlu dipindahkan ke sama ada <code>aliases</code> atau <code>varieties</code>.]==]
function Language:getOtherNames() -- Akan dialih keluar akhirnya, setelah tiada lagi penggunaan medan `otherNames`.
self:loadInExtraData()
return require(language_like_module).getOtherNames(self)
end
--[==[
Mengembalikan gabungan jadual bagi nama kanonik, alias, variasi dan nama lain bagi bahasa yang diberikan.]==]
function Language:getAllNames()
self:loadInExtraData()
return require(language_like_module).getAllNames(self)
end
--[==[Mengembalikan jadual jenis sebagai jadual carian (dengan jenis sebagai kunci).
Jenis-jenis yang mungkin ialah:
* {language}: Ini ialah bahasa, sama ada penuh atau khusus etimologi.
* {full}: Ini ialah bahasa "penuh" (bukan khusus etimologi), iaitu gabungan {regular}, {reconstructed} dan
{appendix-constructed}. Ambil perhatian bahawa jenis {full} dan {etymology-only} juga wujud untuk keluarga bahasa,
jadi jika anda ingin menyemak secara khusus bagi bahasa penuh dan anda mempunyai objek yang mungkin merupakan keluarga,
anda harus menggunakan {{lua|hasType("language", "full")}} dan bukan sekadar {{lua|hasType("full")}}.
* {etymology-only}: Ini ialah bahasa khusus etimologi (bukan penuh), yang induknya merupakan bahasa khusus etimologi lain
atau bahasa penuh. Ambil perhatian bahawa jenis {full} dan {etymology-only} juga wujud untuk keluarga bahasa,
jadi jika anda ingin menyemak secara khusus bagi bahasa khusus etimologi dan anda mempunyai objek yang mungkin
merupakan keluarga, anda harus menggunakan {{lua|hasType("language", "etymology-only")}} dan bukan sekadar
{{lua|hasType("etymology-only")}}.
* {regular}: Ini menunjukkan bahasa penuh yang diperakui mengikut [[WT:CFI]] dan oleh itu dibenarkan dalam ruang nama
utama. Mungkin terdapat juga istilah yang direkonstruksi untuk bahasa tersebut, yang diletakkan dalam ruang nama
{Rekonstruksi} dan mesti diawali dengan tanda * untuk menunjukkan rekonstruksi. Kebanyakan bahasa penuh ialah
bahasa semula jadi (bukan bahasa buatan), namun beberapa bahasa buatan (cth. Esperanto dan Volapük, antara lain)
juga dibenarkan dalam ruang nama utama dan dianggap sebagai bahasa biasa.
* {reconstructed}: Bahasa ini tidak diperakui mengikut [[WT:CFI]], dan oleh itu hanya dibenarkan dalam ruang nama
{Rekonstruksi}. Semua istilah dalam bahasa ini adalah yang direkonstruksi, dan mesti diawali dengan
tanda *. Bahasa seperti Proto-Indo-Eropah dan Proto-Jermanik berada dalam kategori ini.
* {appendix-constructed}: Bahasa ini diperakui tetapi tidak memenuhi syarat tambahan yang ditetapkan untuk bahasa
buatan ([[WT:CFI#Constructed languages]]). Entrinya mestilah berada dalam ruang nama Lampiran,
tetapi ia tidak direkonstruksi dan oleh itu tidak sepatutnya diawali dengan tanda * dalam pautan.
]==]
function Language:getTypes()
local types = self._types
if types == nil then
types = {language = true}
if self:getFullCode() == self._code then
types.full = true
else
types["etymology-only"] = true
end
for t in gmatch(self._data.type, "[^,]+") do
types[t] = true
end
self._types = types
end
return types
end
--[==[Diberikan senarai jenis sebagai rentetan, mengembalikan nilai true jika bahasa tersebut memiliki kesemuanya.]==]
function Language:hasType(...)
Language.hasType = require(language_like_module).hasType
return self:hasType(...)
end
--[==[Mengembalikan jadual yang mengandungi objek <code>WikimediaLanguage</code> (lihat [[Module:wikimedia languages]]), yang mewakili bahasa dan kodnya seperti yang digunakan dalam projek Wikimedia untuk pautan antara wiki dan sebagainya. Lebih daripada satu objek boleh dikembalikan, kerana satu bahasa Wiktionary boleh sepadan dengan beberapa bahasa Wikimedia. Contohnya, kod tunggal Wiktionary <code>sh</code> (Serbo-Croatia) dipetakan kepada empat kod Wikimedia: <code>sh</code> (Serbo-Croatia), <code>bs</code> (Bosnia), <code>hr</code> (Croatia) dan <code>sr</code> (Serbia).
Kod untuk bahasa Wikimedia diambil daripada sifat <code>wikimedia_codes</code> dalam modul data. Jika sifat tersebut tiada, kod bahasa semasa akan digunakan. Jika tiada kod yang tersedia merupakan kod Wikimedia yang sah, jadual kosong akan dikembalikan.]==]
function Language:getWikimediaLanguages()
local wm_langs = self._wikimediaLanguageObjects
if wm_langs == nil then
local codes = self:getWikimediaLanguageCodes()
wm_langs = {}
for i = 1, #codes do
wm_langs[i] = get_wikimedia_lang(codes[i])
end
self._wikimediaLanguageObjects = wm_langs
end
return wm_langs
end
function Language:getWikimediaLanguageCodes()
local wm_langs = self._wikimediaLanguageCodes
if wm_langs == nil then
wm_langs = self._data.wikimedia_codes
if wm_langs then
wm_langs = split(wm_langs, ",", true, true)
else
local code = self._code
if is_known_language_tag(code) then
wm_langs = {code}
else
-- Mewarisi, tetapi hanya jika tiada kod dinyatakan dalam data *dan*
-- kod bahasa tersebut bukan kod bahasa Wikimedia yang sah.
local parent = self:getParent()
wm_langs = parent and parent:getWikimediaLanguageCodes() or {}
end
end
self._wikimediaLanguageCodes = wm_langs
end
return wm_langs
end
--[==[
Mengembalikan nama rencana Wikipedia bagi bahasa tersebut. `project` menyatakan bahasa dan projek untuk mendapatkan rencana,
lalai kepada {"enwiki"} untuk Wikipedia Bahasa Inggeris. Biasanya jika dinyatakan ia sepatutnya menjadi kod projek bagi
Wikipedia bahasa tertentu cth. "mswiki" untuk Wikipedia Bahasa Melayu atau "zhwiki" untuk Wikipedia Bahasa Cina, tetapi ia
boleh menjadi mana-mana projek, termasuk yang bukan Wikipedia. Jika projek itu ialah Wikipedia Bahasa Inggeris dan sifat
{wikipedia_article} hadir dalam modul data, ia akan digunakan terlebih dahulu. Dalam semua kes lain, pautan laman (sitelink)
akan dijana daripada {:getWikidataItem} (jika ditetapkan). Nilai terhasil (atau ketiadaan nilai) dicache supaya panggilan
seterusnya lebih pantas. Jika tiada nilai dapat ditentukan, dan `noCategoryFallback` ialah {false}, {:getCategoryName} digunakan
sebagai sandaran; jika tidak, {nil} dikembalikan. Ambil perhatian bahawa jika `noCategoryFallback` bernilai {nil} atau diabaikan,
ia lalai kepada {false} jika projek ialah Wikipedia Bahasa Inggeris, selainnya kepada {true}. Dalam erti kata lain, dalam keadaan
biasa, jika rencana Wikipedia Bahasa Inggeris tidak dapat diperoleh, nilai pulangan akan kembali kepada pautan kategori bahasa,
tetapi ini biasanya tidak akan berlaku untuk mana-mana projek lain.
]==]
function Language:getWikipediaArticle(noCategoryFallback, project)
Language.getWikipediaArticle = require(language_like_module).getWikipediaArticle
return self:getWikipediaArticle(noCategoryFallback, project)
end
function Language:makeWikipediaLink()
return make_link(self, "w:" .. self:getWikipediaArticle(), self:getCanonicalName())
end
--[==[Mengembalikan nama halaman kategori Wikimedia Commons bagi bahasa tersebut.]==]
function Language:getCommonsCategory()
Language.getCommonsCategory = require(language_like_module).getCommonsCategory
return self:getCommonsCategory()
end
--[==[Mengembalikan id item Wikidata untuk bahasa atau <code>nil</code>. Ini sepadan dengan medan kedua dalam modul data.]==]
function Language:getWikidataItem()
Language.getWikidataItem = require(language_like_module).getWikidataItem
return self:getWikidataItem()
end
--[==[Mengembalikan jadual objek <code>Script</code> untuk semua skrip yang digunakan untuk menulis bahasa tersebut. Lihat [[Module:scripts]].]==]
function Language:getScripts()
local scripts = self._scriptObjects
if scripts == nil then
local codes = self:getScriptCodes()
if codes[1] == "All" then
scripts = load_data(scripts_data_module)
else
scripts = {}
for i = 1, #codes do
scripts[i] = get_script(codes[i])
end
end
self._scriptObjects = scripts
end
return scripts
end
--[==[Mengembalikan jadual kod skrip dalam fail data bahasa.]==]
function Language:getScriptCodes()
local scripts = self._scriptCodes
if scripts == nil then
scripts = self._data[4]
if scripts then
local codes, n = {}, 0
for code in gmatch(scripts, "[^,]+") do
n = n + 1
-- Pengendalian khas untuk "Hants", yang mewakili "Hani", "Hant" dan "Hans" secara kolektif.
if code == "Hants" then
codes[n] = "Hani"
codes[n + 1] = "Hant"
codes[n + 2] = "Hans"
n = n + 2
else
codes[n] = code
end
end
scripts = codes
else
scripts = {"None"}
end
self._scriptCodes = scripts
end
return scripts
end
--[==[Diberikan sesuatu teks, fungsi ini mengulangi skrip-skrip bagi bahasa yang ditentukan dan cuba mencari skrip yang paling sepadan dengan teks tersebut. Ia mengembalikan objek {{code|lua|Script}} yang mewakili skrip berkenaan. Jika tiada padanan ditemui langsung, ia mengembalikan objek skrip {{code|lua|None}}.]==]
function Language:findBestScript(text, forceDetect)
if not text or text == "" or text == "-" then
return get_script("None")
end
-- Berbeza daripada jadual yang dikembalikan oleh getScriptCodes, kerana Hants tidak dinormalkan kepada juzuk-juzuknya.
local codes = self._bestScriptCodes
if codes == nil then
codes = self._data[4]
codes = codes and split(codes, ",", true, true) or {"None"}
self._bestScriptCodes = codes
end
local first_sc = codes[1]
if first_sc == "All" then
return find_best_script_without_lang(text)
end
local codes_len = #codes
if not (forceDetect or first_sc == "Hants" or codes_len > 1) then
first_sc = get_script(first_sc)
local charset = first_sc.characters
return charset and umatch(text, "[" .. charset .. "]") and first_sc or get_script("None")
end
-- Mengalih keluar semua aksara pemformatan.
text = get_plaintext(text)
-- Mengalih keluar semua ruang dan sebarang tanda baca ASCII. Sesetengah tanda baca bukan ASCII adalah khusus skrip, jadi tidak boleh dialih keluar.
text = ugsub(text, "[%s!\"#%%&'()*,%-./:;?@[\\%]_{}]+", "")
if #text == 0 then
return get_script("None")
end
-- Cuba memadankan setiap skrip dengan teks,
-- dan kembalikan skrip yang mempunyai aksara sepadan paling banyak.
local bestcount, bestscript, length = 0
for i = 1, codes_len do
local sc = codes[i]
-- Kes khas untuk "Hants", iaitu kod khas yang mewakili mana-mana antara "Hant" atau "Hans" yang paling sepadan, atau "Hani" jika ia sepadan sama rata. Ini mengelakkan keperluan untuk menyenaraikan ketiga-tiganya. Selain itu, "Hants" akan dilayan sebagai padanan terbaik jika terdapat sekurang-kurangnya satu aksara yang sepadan, di bawah andaian bahawa skrip Han dikehendaki bagi istilah yang mengandungi campuran skrip Han dan skrip lain (tidak termasuk yang menggunakan Jpan atau Kore).
if sc == "Hants" then
local Hani = get_script("Hani")
if not Hant_chars then
Hant_chars = load_data("Modul:zh/data/ts")
Hans_chars = load_data("Modul:zh/data/st")
end
local t, s, found = 0, 0
-- Ini lebih pantas berbanding menggunakan mw.ustring.gmatch secara terus.
for ch in gmatch((ugsub(text, "[" .. Hani.characters .. "]", "\255%0")), "\255(.[\128-\191]*)") do
found = true
if Hant_chars[ch] then
t = t + 1
if Hans_chars[ch] then
s = s + 1
end
elseif Hans_chars[ch] then
s = s + 1
else
t, s = t + 1, s + 1
end
end
if found then
if t == s then
return Hani
end
return get_script(t > s and "Hant" or "Hans")
end
else
sc = get_script(sc)
if not length then
length = ulen(text)
end
-- Mengira aksara dengan menyingkirkan semua yang ada dalam set aksara skrip dan membandingkannya dengan panjang asal.
local charset = sc.characters
local count = charset and length - ulen((ugsub(text, "[" .. charset .. "]+", ""))) or 0
if count >= length then
return sc
elseif count > bestcount then
bestcount = count
bestscript = sc
end
end
end
-- Kembalikan skrip padanan terbaik, atau sebaliknya None.
return bestscript or get_script("None")
end
--[==[Mengembalikan objek <code>Family</code> bagi keluarga bahasa tempat tergolongnya bahasa ini. Lihat [[Module:families]].]==]
function Language:getFamily()
local family = self._familyObject
if family == nil then
family = self:getFamilyCode()
-- Jika nilainya nil, ia dicache sebagai false.
family = family and get_family(family) or false
self._familyObject = family
end
return family or nil
end
--[==[Mengembalikan kod keluarga dalam fail data bahasa.]==]
function Language:getFamilyCode()
local family = self._familyCode
if family == nil then
-- Jika nilainya nil, ia dicache sebagai false.
family = self._data[3] or false
self._familyCode = family
end
return family or nil
end
function Language:getFamilyName()
local family = self._familyName
if family == nil then
family = self:getFamily()
-- Jika nilainya nil, ia dicache sebagai false.
family = family and family:getCanonicalName() or false
self._familyName = family
end
return family or nil
end
do
local function check_family(self, family)
if type(family) == "table" then
family = family:getCode()
end
if self:getFamilyCode() == family then
return true
end
local self_family = self:getFamily()
if self_family:inFamily(family) then
return true
-- Jika keluarga tersebut bukan keluarga sebenar (cth. kreol), semak sebarang leluhur.
elseif self_family:inFamily("qfa-not") then
local ancestors = self:getAncestors()
for _, ancestor in ipairs(ancestors) do
if ancestor:inFamily(family) then
return true
end
end
end
end
--[==[Menyemak sama ada bahasa tergolong dalam `family` (yang boleh berupa kod keluarga atau objek). Senarai objek boleh diberikan sebagai ganti `family`; dalam kes tersebut, kembalikan true jika bahasa tergolong dalam mana-mana keluarga yang dinyatakan. Perhatikan bahawa sesetengah bahasa (khususnya, kreol tertentu) boleh mempunyai beberapa leluhur langsung yang berpotensi tergolong dalam keluarga berbeza; dalam kes tersebut, kembalikan true jika bahasa tergolong dalam mana-mana keluarga yang dinyatakan.]==]
function Language:inFamily(...)
if self:getFamilyCode() == nil then
return false
end
return check_inputs(self, check_family, false, ...)
end
end
function Language:getParent()
local parent = self._parentObject
if parent == nil then
parent = self:getParentCode()
-- Jika nilainya nil, ia dicache sebagai false.
parent = parent and get_by_code(parent, nil, true, true) or false
self._parentObject = parent
end
return parent or nil
end
function Language:getParentCode()
local parent = self._parentCode
if parent == nil then
-- Jika nilainya nil, ia dicache sebagai false.
parent = self._data.parent or false
self._parentCode = parent
end
return parent or nil
end
function Language:getParentName()
local parent = self._parentName
if parent == nil then
parent = self:getParent()
-- Jika nilainya nil, ia dicache sebagai false.
parent = parent and parent:getCanonicalName() or false
self._parentName = parent
end
return parent or nil
end
function Language:getParentChain()
local chain = self._parentChain
if chain == nil then
chain = {}
local parent, n = self:getParent(), 0
while parent do
n = n + 1
chain[n] = parent
parent = parent:getParent()
end
self._parentChain = chain
end
return chain
end
do
local function check_lang(self, lang)
for _, parent in ipairs(self:getParentChain()) do
if (type(lang) == "string" and lang or lang:getCode()) == parent:getCode() then
return true
end
end
end
function Language:hasParent(...)
return check_inputs(self, check_lang, false, ...)
end
end
--[==[
Jika bahasa tersebut merupakan bahasa khusus etimologi, fungsi ini mengulangi rantaian induk sehingga bahasa penuh atau keluarga ditemui, dan objek yang sepadan dikembalikan. Jika bahasa tersebut merupakan bahasa penuh, ia hanya mengembalikan dirinya sendiri.
]==]
function Language:getFull()
local full = self._fullObject
if full == nil then
full = self:getFullCode()
full = full == self._code and self or get_by_code(full)
self._fullObject = full
end
return full
end
--[==[
Jika bahasa tersebut merupakan bahasa khusus etimologi, fungsi ini mengulangi rantaian induk sehingga bahasa penuh atau keluarga ditemui, dan kod yang sepadan dikembalikan. Jika bahasa tersebut merupakan bahasa penuh, ia hanya mengembalikan kod bahasa tersebut.
]==]
function Language:getFullCode()
return self._fullCode or self._code
end
--[==[
Jika bahasa tersebut merupakan bahasa khusus etimologi, fungsi ini mengulangi rantaian induk sehingga bahasa penuh atau keluarga ditemui, dan nama kanonik yang sepadan dikembalikan. Jika bahasa tersebut merupakan bahasa penuh, ia hanya mengembalikan nama kanonik bahasa tersebut.
]==]
function Language:getFullName()
local full = self._fullName
if full == nil then
full = self:getFull():getCanonicalName()
self._fullName = full
end
return full
end
--[==[Mengembalikan jadual objek <code class="nf">Language</code> bagi semua bahasa yang diturunkan secara langsung daripada bahasa ini. Umumnya ini hanya melibatkan bahasa tunggal, tetapi kreol, pidgin dan bahasa campuran boleh mempunyai banyak leluhur.]==]
function Language:getAncestors()
local ancestors = self._ancestorObjects
if ancestors == nil then
ancestors = {}
local ancestor_codes = self:getAncestorCodes()
if #ancestor_codes > 0 then
for _, ancestor in ipairs(ancestor_codes) do
insert(ancestors, get_by_code(ancestor, nil, true))
end
else
local fam = self:getFamily()
local protoLang = fam and fam:getProtoLanguage() or nil
-- Bagi kes di mana bahasa semasa ialah bahasa proto bagi
-- keluarganya, atau bahasa khusus etimologi yang merupakan leluhur kepada bahasa
-- proto tersebut, kita perlu melangkah setingkat lebih tinggi sejak
-- permulaan lagi.
if protoLang and (
protoLang:getCode() == self._code or
(self:hasType("etymology-only") and protoLang:hasAncestor(self))
) then
fam = fam:getFamily()
protoLang = fam and fam:getProtoLanguage() or nil
end
while not protoLang and not (not fam or fam:getCode() == "qfa-not") do
fam = fam:getFamily()
protoLang = fam and fam:getProtoLanguage() or nil
end
insert(ancestors, protoLang)
end
self._ancestorObjects = ancestors
end
return ancestors
end
do
-- Elakkan bahasa menjadi leluhur kepada dirinya sendiri melalui pewarisan kelas. Kita hanya perlu menyemak ini jika bahasa mewarisi jadual leluhur daripada induknya, kerana kita tidak mahu menggugurkan leluhur yang telah ditetapkan secara jelas dalam data.
-- Ulangi proses secara rekursif merentasi leluhur sehingga sama ada menemui diri sendiri atau kehabisan rekod. Jika diri sendiri ditemui, kembalikan true.
local function check_ancestor(self, lang)
local codes = lang:getAncestorCodes()
if not codes then
return nil
end
for i = 1, #codes do
local code = codes[i]
if code == self._code then
return true
end
local anc = get_by_code(code, nil, true)
if check_ancestor(self, anc) then
return true
end
end
end
--[==[Mengembalikan jadual kod <code class="nf">Language</code> bagi semua bahasa yang diturunkan secara langsung daripada bahasa ini. Umumnya ini hanya melibatkan bahasa tunggal, tetapi kreol, pidgin dan bahasa campuran boleh mempunyai banyak leluhur.]==]
function Language:getAncestorCodes()
if self._ancestorCodes then
return self._ancestorCodes
end
local data = self._data
local codes = data.ancestors
if codes == nil then
codes = {}
self._ancestorCodes = codes
return codes
end
codes = split(codes, ",", true, true)
self._ancestorCodes = codes
-- Jika tiada kod atau leluhur tersebut bukan data yang diwarisi, tiada apa lagi untuk disemak.
if #codes == 0 or self:getData(false, "raw").ancestors ~= nil then
return codes
end
local i, code = 1
while i <= #codes do
code = codes[i]
if check_ancestor(self, self) then
remove(codes, i)
else
i = i + 1
end
end
return codes
end
end
--[==[Diberikan senarai objek atau kod bahasa, mengembalikan true jika sekurang-kurangnya satu daripadanya ialah leluhur. Ini merangkumi sebarang anak khusus etimologi bagi leluhur tersebut. Jika leluhur bahasa tersebut ialah bahasa khusus etimologi, ia juga akan mengembalikan true bagi induk bahasa berkenaan (cth. jika Latin Vulgar ialah leluhur, ia juga akan mengembalikan true bagi induknya, Latin). Walau bagaimanapun, induk dikecualikan daripada ini jika leluhur tersebut juga merupakan leluhur kepada induk berkenaan (cth. jika Parsi Klasik ialah leluhur, Parsi akan mengembalikan false, kerana Parsi Klasik juga merupakan leluhur kepada Parsi).]==]
function Language:hasAncestor(...)
local function iterateOverAncestorTree(node, func, parent_check)
local ancestors = node:getAncestors()
local ancestorsParents = {}
for _, ancestor in ipairs(ancestors) do
-- Semasa menyemak induk bahasa lain, dan leluhur juga merupakan induk, langkau ke leluhur seterusnya, supaya kita mengecualikan sebarang anak khusus etimologi bagi induk tersebut yang tidak berkaitan secara langsung (lihat di bawah).
local ret = (parent_check or not node:hasParent(ancestor)) and
func(ancestor) or iterateOverAncestorTree(ancestor, func, parent_check)
if ret then
return ret
end
end
-- Semak induk bagi mana-mana leluhur. Kita tidak melakukan ini jika menyemak induk bahasa lain, supaya kita mengecualikan sebarang anak khusus etimologi bagi induk tersebut yang tidak berkaitan secara langsung (cth. jika leluhur ialah Latin Vulgar dan kita menyemak Latin Baharu, kita mahu ia mengembalikan false kerana kedua-duanya berada pada cabang leluhur berbeza. Oleh itu, jika kita sudah menyemak induk Latin Baharu (Latin) kita tidak mahu membandingkannya dengan induk leluhur (Latin), kerana ini menghasilkan positif palsu; ia sepatutnya salah satu daripadanya).
if not parent_check then
return nil
end
for _, ancestor in ipairs(ancestors) do
local ancestorParents = ancestor:getParentChain()
for _, ancestorParent in ipairs(ancestorParents) do
if ancestorParent:getCode() == self._code or ancestorParent:hasAncestor(ancestor) then
break
else
insert(ancestorsParents, ancestorParent)
end
end
end
for _, ancestorParent in ipairs(ancestorsParents) do
local ret = func(ancestorParent)
if ret then
return ret
end
end
end
local function do_iteration(otherlang, parent_check)
-- otherlang tidak boleh merujuk kepada diri sendiri
if (type(otherlang) == "string" and otherlang or otherlang:getCode()) == self._code then
return false
end
repeat
if iterateOverAncestorTree(
self,
function(ancestor)
return ancestor:getCode() == (type(otherlang) == "string" and otherlang or otherlang:getCode())
end,
parent_check
) then
return true
elseif type(otherlang) == "string" then
otherlang = get_by_code(otherlang, nil, true)
end
otherlang = otherlang:getParent()
parent_check = false
until not otherlang
end
local parent_check = true
for _, otherlang in ipairs{...} do
local ret = do_iteration(otherlang, parent_check)
if ret then
return true
end
end
return false
end
do
local function construct_node(lang, memo)
local branch, ancestors = {lang = lang:getCode()}
memo[lang:getCode()] = branch
for _, ancestor in ipairs(lang:getAncestors()) do
if ancestors == nil then
ancestors = {}
end
insert(ancestors, memo[ancestor:getCode()] or construct_node(ancestor, memo))
end
branch.ancestors = ancestors
return branch
end
function Language:getAncestorChain()
local chain = self._ancestorChain
if chain == nil then
chain = construct_node(self, {})
self._ancestorChain = chain
end
return chain
end
end
function Language:getAncestorChainOld()
local chain = self._ancestorChain
if chain == nil then
chain = {}
local step = self
while true do
local ancestors = step:getAncestors()
step = #ancestors == 1 and ancestors[1] or nil
if not step then
break
end
insert(chain, step)
end
self._ancestorChain = chain
end
return chain
end
local function fetch_descendants(self, fmt)
local descendants, family = {}, self:getFamily()
-- Ulangi ke atas ketiga-tiga set data.
for _, data in ipairs{
require("Modul:languages/code to canonical name"),
require("Modul:etymology languages/code to canonical name"),
require("Modul:families/code to canonical name"),
} do
for code in pairs(data) do
local lang = get_by_code(code, nil, true, true)
if not lang then
error(("Ralat dalaman: kod '%s' tidak dapat diambil"):format(code))
end
-- Uji untuk keturunan. Ujian awal menyingkirkan kebanyakan calon, manakala ujian yang lebih intensif hanya digunakan secara berhemat.
if (
code ~= self._code and -- Bukan diri sendiri.
lang:inFamily(family) and -- Dalam keluarga yang sama.
(
family:getProtoLanguageCode() == self._code or -- Diri sendiri ialah bahasa proto.
self:hasDescendant(lang) or -- Semakan penuh hasDescendant.
(lang:getFullCode() == self._code and not self:hasAncestor(lang)) -- Anak khusus etimologi yang bukan leluhur.
)
) then
if fmt == "object" then
insert(descendants, lang)
elseif fmt == "code" then
insert(descendants, code)
elseif fmt == "name" then
insert(descendants, lang:getCanonicalName())
end
end
end
end
return descendants
end
function Language:getDescendants()
local descendants = self._descendantObjects
if descendants == nil then
descendants = fetch_descendants(self, "object")
self._descendantObjects = descendants
end
return descendants
end
function Language:getDescendantCodes()
local descendants = self._descendantCodes
if descendants == nil then
descendants = fetch_descendants(self, "code")
self._descendantCodes = descendants
end
return descendants
end
function Language:getDescendantNames()
local descendants = self._descendantNames
if descendants == nil then
descendants = fetch_descendants(self, "name")
self._descendantNames = descendants
end
return descendants
end
do
local function check_lang(self, lang)
if type(lang) == "string" then
lang = get_by_code(lang, nil, true)
end
if lang:hasAncestor(self) then
return true
end
end
function Language:hasDescendant(...)
return check_inputs(self, check_lang, false, ...)
end
end
local function fetch_children(self, fmt)
local m_etym_data = require(etymology_languages_data_module)
local self_code, children = self._code, {}
for code, lang in pairs(m_etym_data) do
local _lang = lang
repeat
local parent = _lang.parent
if parent == self_code then
if fmt == "object" then
insert(children, get_by_code(code, nil, true))
elseif fmt == "code" then
insert(children, code)
elseif fmt == "name" then
insert(children, lang[1])
end
break
end
_lang = m_etym_data[parent]
until not _lang
end
return children
end
function Language:getChildren()
local children = self._childObjects
if children == nil then
children = fetch_children(self, "object")
self._childObjects = children
end
return children
end
function Language:getChildrenCodes()
local children = self._childCodes
if children == nil then
children = fetch_children(self, "code")
self._childCodes = children
end
return children
end
function Language:getChildrenNames()
local children = self._childNames
if children == nil then
children = fetch_children(self, "name")
self._childNames = children
end
return children
end
function Language:hasChild(...)
local lang = ...
if not lang then
return false
elseif type(lang) == "string" then
lang = get_by_code(lang, nil, true)
end
if lang:hasParent(self) then
return true
end
return self:hasChild(select(2, ...))
end
--[==[Mengembalikan nama kategori utama bagi bahasa tersebut. Contoh: {{code|lua|"French language"}} bagi bahasa Perancis, yang kategorinya berada di [[:Kategori:Bahasa Perancis]]. Melainkan argumen pilihan <code>nocap</code> diberikan, nama bahasa pada permulaan nilai yang dikembalikan akan diawali dengan huruf besar. Huruf besar ini betul untuk nama kategori, tetapi bukan jika nama bahasa menggunakan huruf kecil dan nilai yang dikembalikan oleh fungsi ini digunakan di tengah-tengah ayat.]==]
function Language:getCategoryName(nocap)
local name = self._categoryName
if name == nil then
name = self:getCanonicalName()
-- Jika substrat, gugurkan sebarang kata sandang di hadapan.
if self:getFamilyCode() == "qfa-sub" then
name = name:gsub("^sebuah ", ""):gsub("^suatu ", "")
end
-- Hanya tambah " language" jika ia bahasa penuh.
if self:hasType("full") then
-- Melainkan nama kanonik sudah berakhir dengan "language", "lect" atau terbitannya, tambah " language".
if not (match(name, "^[Bb]ahasa") or match(name, "^[Ll]ek")) then
name = "Bahasa " .. name
end
end
self._categoryName = name
end
if nocap then
return name
end
return mw.getContentLanguage():ucfirst(name)
end
--[==[Mencipta pautan ke kategori; teks pautan ialah nama kanonik.]==]
function Language:makeCategoryLink()
return make_link(self, ":Kategori:" .. self:getCategoryName(), self:getDisplayForm())
end
function Language:getStandardCharacters(sc)
local standard_chars = self._data.standard_chars
if type(standard_chars) ~= "table" then
return standard_chars
elseif sc and type(sc) ~= "string" then
check_object("script", nil, sc)
sc = sc:getCode()
end
if (not sc) or sc == "None" then
local scripts = {}
for _, script in pairs(standard_chars) do
insert(scripts, script)
end
return concat(scripts)
end
if standard_chars[sc] then
return standard_chars[sc] .. (standard_chars[1] or "")
end
end
--[==[
Menanggalkan tanda diakritik daripada teks paparan `text` (mengikut kaedah khusus bahasa), yang berada dalam skrip `sc`. Jika `sc` diabaikan atau bernilai {nil}, skrip dikesan secara automatik. Ini juga menanggalkan aksara tanda baca tertentu dari penghujung dan (dalam kes tanda soal dan seru terbalik bahasa Sepanyol) dari permulaan; menanggalkan sebarang ruang putih pada penghujung teks atau di antara teks dan tanda baca jalur akhir; serta menerapkan beberapa penormalan Unicode khusus bahasa untuk menggantikan aksara yang tidak digalakkan dengan alternatif yang ditetapkan. Mengembalikan teks yang telah ditanggalkan tanda diakritiknya.
]==]
function Language:stripDiacritics(text, sc)
if (not text) or text == "" then
return text
end
sc = checkScript(text, self, sc)
text = normalize(text, sc)
-- AMARAN: namakan semula makeEntryName kepada stripDiacritics dan buang nilai pulangan kedua dan ketiga
-- di semua tempat
text, _, _ = iterateSectionSubstitutions(self, text, sc, nil, nil,
self._data.strip_diacritics or self._data.entry_name, "strip_diacritics", "stripDiacritics")
text = umatch(text, "^[¿¡]?(.-[^%s%p].-)%s*[؟?!;՛՜ ՞ ՟?!︖︕।॥။၊་།]?$") or text
return text
end
--[==[
Menukar nama halaman ''logik'' (nama halaman sebagaimana ia dipaparkan kepada pengguna, selepas tanda diakritik dan tanda baca ditanggalkan) kepada nama halaman ''fizikal'' (nama halaman sebagaimana ia disimpan dalam pangkalan data MediaWiki). Sebab-sebab perbezaan antara kedua-duanya ialah (a) tajuk yang tidak disokong seperti `[ ]` (dengan kurungan siku di dalamnya), `#` (tanda pagar) dan `¯\_(ツ)_/¯` (dengan garis bawah), serta tajuk yang terlalu panjang dari pelbagai jenis; (b) halaman "gergasi" yang dipecahkan kepada beberapa bahagian (cth. `a`, yang dipecahkan kepada nama halaman fizikal `a/languages A to L` dan `a/languages M to Z`). Bagi hampir semua tujuan, anda harus bekerja dengan nama halaman logik dan bukan nama halaman fizikal. Namun terdapat kes penggunaan tertentu yang memerlukan nama halaman fizikal, seperti menyemak kewujudan halaman atau mendapatkan kandungan halaman.
`pagename` ialah nama halaman logik yang akan ditukar. `is_reconstructed_or_appendix` menunjukkan sama ada halaman berada dalam ruang nama `Reconstruction` atau `Appendix`. Jika ia diabaikan atau bernilai {nil}, nama halaman disemak untuk tanda asterisk awal, dan jika ditemui, halaman dianggap sebagai halaman `Reconstruction`. Menetapkan nilai `false` atau `true` pada `is_reconstructed_or_appendix` melumpuhkan semakan ini dan membenarkan nama halaman ruang nama utama yang bermula dengan tanda asterisk.
]==]
function Language:logicalToPhysical(pagename, is_reconstructed_or_appendix)
-- AMARAN: Ini mungkin tidak sepatutnya berlaku tetapi ia berlaku apabila makeEntryName() menerima nil.
if pagename == nil then
track("nil-passed-to-logicalToPhysical")
return nil
end
local initial_asterisk
if is_reconstructed_or_appendix == nil then
local pagename_minus_initial_asterisk
initial_asterisk, pagename_minus_initial_asterisk = pagename:match("^(%*)(.*)$")
if pagename_minus_initial_asterisk then
is_reconstructed_or_appendix = true
pagename = pagename_minus_initial_asterisk
elseif self:hasType("appendix-constructed") then
is_reconstructed_or_appendix = true
end
end
if not is_reconstructed_or_appendix then
-- Semak sama ada nama halaman tersenarai sebagai tajuk yang tidak disokong.
local unsupportedTitles = load_data(links_data_module).unsupported_titles
if unsupportedTitles[pagename] then
return "Unsupported titles/" .. unsupportedTitles[pagename]
end
end
-- Tetapkan `unsupported` sebagai true jika syarat tertentu dipenuhi.
local unsupported
-- Semak sama ada terdapat aksara yang tidak disokong. \239\191\189 ialah aksara gantian U+FFFD, yang tidak boleh ditaip
-- terus di sini kerana penapis penyalahgunaan. Notasi titik-garis condong gaya Unix juga tidak disokong, kerana ia digunakan untuk
-- laluan relatif dalam pautan, begitu juga dengan 3 atau lebih tanda tilde berturutan. Nota: match lebih pantas dengan aksara
-- magik/set aksara; find lebih pantas dengan teks biasa.
if (
match(pagename, "[#<>%[%]_{|}]") or
find(pagename, "\239\191\189") or
match(pagename, "%f[^%z/]%.%.?%f[%z/]") or
find(pagename, "~~~")
) then
unsupported = true
-- Jika ia kelihatan seperti pautan antara wiki.
elseif find(pagename, ":") then
local prefix = gsub(pagename, "^:*(.-):.*", ulower)
if (
load_data("Modul:data/namespaces")[prefix] or
load_data("Modul:data/interwikis")[prefix]
) then
unsupported = true
end
end
-- Lepaskan aksara yang tidak disokong supaya ia boleh digunakan dalam tajuk. ` digunakan sebagai pembatas untuk ini, jadi penggunaan mentah
-- tanda itu dalam tajuk yang tidak disokong turut dilepaskan di sini untuk mengelakkan gangguan; ini hanya dilakukan dengan tajuk yang
-- tidak disokong, jadi kemasukan tanda itu sendiri tidak bermakna tajuk tersebut dilayan sebagai tidak disokong (itulah sebabnya ia dikecualikan
-- daripada ujian awal).
if unsupported then
-- AMARAN: Penukaran ini perlu berbeza untuk halaman rekonstruksi dengan aksara yang tidak disokong. Tiada
-- yang wujud buat masa ini, tetapi jika ada, kita perlu membetulkannya cth. meletakkannya dalam sesuatu seperti
-- Reconstruction:Proto-Indo-European/Unsupported titles/`lowbar``num`.
local unsupported_characters = load_data(links_data_module).unsupported_characters
pagename = pagename:gsub("[#<>%[%]_`{|}\239]\191?\189?", unsupported_characters)
:gsub("%f[^%z/]%.%.?%f[%z/]", function(m)
return (gsub(m, "%.", "`period`"))
end)
:gsub("~~~+", function(m)
return (gsub(m, "~", "`tilde`"))
end)
pagename = "Unsupported titles/" .. pagename
elseif not is_reconstructed_or_appendix then
-- Semak sama ada ini halaman gergasi. Jika ya, subhalaman mana yang perlu kita pautkan?
local m_links_data = load_data(links_data_module)
local mammoth_page_type = m_links_data.mammoth_pages[pagename]
if mammoth_page_type then
local canonical_name = self:getFullName()
if canonical_name ~= "Rentas bahasa" and canonical_name ~= "Bahasa Melayu" then
local this_subpage
local L2_sort_key = get_L2_sort_key(canonical_name)
for _, subpage_spec in ipairs(m_links_data.mammoth_page_subpage_types[mammoth_page_type]) do
-- unpack() gagal sepenuhnya pada data yang dimuatkan menggunakan mw.loadData() walaupun ofset diberikan
local subpage, pattern = subpage_spec[1], subpage_spec[2]
if pattern == true or L2_sort_key:match(pattern) then
this_subpage = subpage
break
end
end
if not this_subpage then
error(("Ralat dalaman: Data tidak sah dalam mammoth_page_subpage_pages dalam [[Module:links/data]] untuk halaman gergasi %s, jenis %s; entri terakhir tiada 'true' di dalamnya"):format(
pagename, mammoth_page_type))
end
pagename = pagename .. "/" .. this_subpage
end
end
end
return (initial_asterisk or "") .. pagename
end
--[==[
Menanggalkan tanda diakritik daripada nama halaman paparan dan menukar nama halaman logik yang terhasil kepada nama halaman fizikal.
Ini membolehkan anda, sebagai contoh, mendapatkan kandungan halaman atau menyemak kewujudannya. AMARAN: Fungsi ini telah lapuk
dan akan dimansuhkan. Ia merupakan gabungan mudah bagi `self:stripDiacritics` dan `self:logicalToPhysical`; kebanyakan pemanggil
hanya memerlukan kaedah yang pertama, dan jika anda memerlukan kedua-duanya, panggil kedua-duanya secara berasingan.
`text` dan `sc` adalah seperti dalam `self:stripDiacritics`, dan `is_reconstructed_or_appendix` adalah seperti dalam `self:logicalToPhysical`.
]==]
function Language:makeEntryName(text, sc, is_reconstructed_or_appendix)
return self:logicalToPhysical(self:stripDiacritics(text, sc), is_reconstructed_or_appendix)
end
--[==[Menjana bentuk alternatif menggunakan kaedah yang dinyatakan, dan mengembalikannya sebagai jadual. Jika tiada kaedah dinyatakan, mengembalikan jadual yang hanya mengandungi istilah input.]==]
function Language:generateForms(text, sc)
local generate_forms = self._data.generate_forms
if generate_forms == nil then
return {text}
end
sc = checkScript(text, self, sc)
return require("Modul:" .. self._data.generate_forms).generateForms(text, self, sc)
end
--[==[Mencipta kunci isih bagi teks jalur yang diberikan, mengikut peraturan yang sesuai untuk bahasa tersebut. Ini menanggalkan
tanda diakritik daripada teks jalur jika ia dianggap tidak signifikan untuk pengisihan, dan mungkin melakukan beberapa pengubahsuaian
lain. Sebarang tanda sempang awal juga dialih keluar, dan apa sahaja di dalam kurungan turut dialih keluar.
Tetapan <code>sort_key</code> bagi setiap bahasa dalam modul data mentakrifkan penggantian yang dibuat oleh fungsi ini, atau ia memberikan nama modul yang menerima teks jalur dan mengembalikan kunci isih.]==]
function Language:makeSortKey(text, sc)
if (not text) or text == "" then
return text
end
if match(text, "<[^<>]+>") then
track("track HTML tag")
end
-- Mengalih keluar aksara arah, tebal, condong, tanda sempang lembut, penanda jalur dan tag HTML.
-- AMARAN: Sebahagiannya berulang dengan remove_formatting() dalam [[Module:links]].
text = ugsub(text, "[\194\173\226\128\170-\226\128\174\226\129\166-\226\129\169]", "")
text = text:gsub("('*)'''(.-'*)'''", "%1%2"):gsub("('*)''(.-'*)''", "%1%2")
text = gsub(unstrip(text), "<[^<>]+>", "")
text = decode_uri(text, "PATH")
text = checkNoEntities(self, text)
-- Mengalih keluar tanda sempang awal dan * melainkan istilah tersebut hanya terdiri daripada aksara penjarakan + tanda baca.
text = ugsub(text, "^([-]*)[-־ـ᠊*]+([-]*)(.*[^%s%p].*)", "%1%2%3")
sc = checkScript(text, self, sc)
text = normalize(text, sc)
text = removeCarets(text, sc)
-- Bagi bahasa yang mempunyai huruf i bertitik dan tanpa titik, pastikan "İ" diisih sebagai "i", dan "I" diisih sebagai "ı".
if self:hasDottedDotlessI() then
text = gsub(text, "I\204\135", "i") -- "İ" terurai
:gsub("I", "ı")
text = sc:toFixedNFD(text)
end
-- Tukar kepada huruf kecil, hasilkan kunci isih, kemudian tukar kepada huruf besar. Di mana bahasa mempunyai i bertitik dan tanpa titik, ia
-- biasanya tidak perlu menukar "i" kepada "İ" dan "ı" kepada "I" terlebih dahulu, kerana "I" akan sentiasa ditafsirkan sebagai
-- "I" konvensional (bukan "İ" tanpa titik) oleh mana-mana algoritma pengisihan, yang telah diambil kira oleh
-- penggantian kunci isih itu sendiri. Walau bagaimanapun, jika tiada penggantian kunci isih dinyatakan, maka penukaran adalah
-- perlu bagi mengelakkan kedua-dua "i" dan "ı" diisih sebagai "I".
--
-- Pengecualian dibuat untuk skrip yang (kadangkala) mengisih dengan mengikis kandungan halaman, kerana ini bermakna ia sensitif
-- terhadap perubahan penggunaan huruf besar/kecil (kerana ia mengubah halaman sasaran).
if not sc:sortByScraping() then
text = ulower(text)
end
local actual_substitution_data
-- Jangan pangkas ruang putih di sini kerana ia bermakna pada permulaan kunci isih atau asas isih.
text, _, actual_substitution_data = iterateSectionSubstitutions(self, text, sc, nil, nil, self._data.sort_key,
"sort_key", "makeSortKey", "notrim")
if not sc:sortByScraping() then
if self:hasDottedDotlessI() and not actual_substitution_data then
text = text:gsub("ı", "I"):gsub("i", "İ")
text = sc:toFixedNFC(text)
end
text = uupper(text)
end
-- Alih keluar kurungan, asalkan ia didahului atau diikuti oleh sesuatu.
text = gsub(text, "(.)[()]+", "%1"):gsub("[()]+(.)", "%1")
text = escape_risky_characters(text)
return text
end
--[==[Mencipta bentuk yang digunakan sebagai asas untuk teks paparan dan transliterasi. AMARAN: Namakan semula kepada correctInputText().]==]
local function processDisplayText(text, self, sc, keepCarets, keepPrefixes)
local subbedChars = {}
text, subbedChars = doTempSubstitutions(text, subbedChars, keepCarets)
text = decode_uri(text, "PATH")
text = checkNoEntities(self, text)
sc = checkScript(text, self, sc)
text = normalize(text, sc)
text, subbedChars = iterateSectionSubstitutions(self, text, sc, subbedChars, keepCarets, self._data.display_text,
"display_text", "makeDisplayText")
text = removeCarets(text, sc)
-- Alih keluar sebarang awalan pautan antara wiki (melainkan ia telah dilepaskan atau ciri ini dilumpuhkan).
if find(text, ":") and not keepPrefixes then
local rep
repeat
text, rep = gsub(text, "\\\\(\\*:)", "\3%1")
until rep == 0
text = gsub(text, "\\:", "\4")
while true do
local prefix = gsub(text, "^(.-):.+", function(m1)
return (gsub(m1, "\244[\128-\191]*", ""))
end)
-- Semak sama ada awalan ialah antara wiki, namun abaikan Wiktionary: dengan huruf besar, yang merupakan ruang nama.
if not prefix or prefix == text or prefix == "Wikikamus"
or not (load_data("Modul:data/interwikis")[ulower(prefix)] or prefix == "") then
break
end
text = gsub(text, "^(.-):(.*)", function(m1, m2)
local ret = {}
for subbedChar in gmatch(m1, "\244[\128-\191]*") do
insert(ret, subbedChar)
end
return concat(ret) .. m2
end)
end
text = gsub(text, "\3", "\\"):gsub("\4", ":")
end
return text, subbedChars
end
--[==[Menghasilkan teks paparan (iaitu apa yang dipaparkan pada halaman).]==]
function Language:makeDisplayText(text, sc, keepPrefixes)
if not text or text == "" then
return text
end
local subbedChars
text, subbedChars = processDisplayText(text, self, sc, nil, keepPrefixes)
text = escape_risky_characters(text)
return undoTempSubstitutions(text, subbedChars)
end
--[==[Mentransliterasikan teks daripada skrip yang diberikan kepada skrip Latin (lihat
[[Wiktionary:Transliteration and romanization]]). Bahasa mesti mempunyai sifat <code>translit</code> untuk ciri ini
berfungsi; jika ia tiada, {{code|lua|nil}} dikembalikan.
Parameter <code>sc</code> dikendalikan oleh modul transliterasi, dan cara ia dikendalikan adalah khusus kepada modul
tersebut. Sesetengah modul transliterasi mungkin menerima {{code|lua|nil}} sebagai skrip, yang lain memerlukannya menjadi salah satu
skrip yang mungkin boleh ditransliterasikan oleh modul, dan akan membuang ralat jika ia bukan salah satu daripadanya. Atas sebab ini,
parameter <code>sc</code> sepatutnya sentiasa disediakan semasa menulis kod bukan khusus bahasa.
Parameter <code>module_override</code> digunakan untuk mengatasi modul lalai yang digunakan bagi menyediakan
transliterasi. Ini berguna dalam kes di mana anda perlu menunjukkan penggunaan modul tertentu, tetapi modul lalai belum wujud,
atau anda ingin menunjukkan versi alternatif bagi modul transliterasi sebelum menjadikannya rasmi. Ia tidak sepatutnya
digunakan dalam modul atau templat sebenar, hanya untuk ujian. Semua penggunaan parameter ini dijejaki
oleh [[Wiktionary:Tracking/languages/module_override]].
'''Pepijat yang diketahui''':
* Fungsi ini mengandaikan {tr(s1) .. tr(s2) == tr(s1 .. s2)}. Apabila penegasan ini gagal, penanda teks wiki seperti <nowiki>'''</nowiki> boleh menyebabkan transliterasi yang salah.
* Entiti HTML seperti <code>&apos;</code>, yang sering digunakan untuk melepaskan penanda teks wiki, tidak berfungsi.
]==]
function Language:transliterate(text, sc, module_override)
-- Jika tiada teks, atau bahasa tidak mempunyai data transliterasi dan tiada override diberikan, kembalikan nil.
if not text or text == "" or text == "-" then
return text
end
-- Jika skrip tidak boleh ditransliterasikan (dan tiada override diberikan), kembalikan nil.
sc = checkScript(text, self, sc)
if not (sc:isTransliterated() or module_override) then
-- penjejakan sementara untuk melihat sama ada/bila ini dicetuskan
track("non-transliterable")
track("non-transliterable/" .. self._code)
track("non-transliterable/" .. sc:getCode())
track("non-transliterable/" .. sc:getCode() .. "/" .. self._code)
return nil
end
-- Alih keluar sebarang penanda jalur.
text = unstrip(text)
-- Jangan proses pemformatan kepada aksara PUA bagi bahasa-bahasa tertentu.
local processed = load_data(languages_data_module).substitution[self._code] ~= "none"
-- Dapatkan teks paparan dengan bendera keepCarets ditetapkan.
local subbedChars
if processed then
text, subbedChars = processDisplayText(text, self, sc, true)
end
-- Lakukan transliterasi (menggunakan module_override jika berkenaan).
text, subbedChars = iterateSectionSubstitutions(self, text, sc, subbedChars, true, module_override or
self._data.translit, "translit", "tr")
if not text then
return nil
end
-- Transliterasi tidak lengkap mengembalikan nil.
local charset = sc.characters
if charset and umatch(text, "[" .. charset .. "]") then
-- Alih keluar sebarang aksara dalam skrip Latin, termasuk aksara Latin yang turut terkandung dalam skrip lain (kerana ini
-- menghasilkan positif palsu), serta sebarang penggantian PUA. Apa-apa yang tinggal sepatutnya hanya kod skrip "None"
-- (cth. angka).
local check_text = ugsub(text, "[" .. get_script("Latn").characters .. "-]+", "")
-- Tetapkan bendera none_is_last_resort_only, supaya sebarang aksara bukan-None akan menyebabkan skrip selain "None"
-- dikembalikan.
if find_best_script_without_lang(check_text, true):getCode() ~= "None" then
return nil
end
end
if processed then
text = escape_risky_characters(text)
text = undoTempSubstitutions(text, subbedChars)
end
-- Jika skrip tidak menggunakan huruf besar, maka besarkan sebarang huruf transliterasi yang
-- didahului secara langsung oleh tanda sisip (dan alih keluar tanda sisip tersebut).
if text and not sc:hasCapitalization() and text:find("^", 1, true) then
text = processCarets(text, "%^([\128-\191\244]*%*?)([^\128-\191\244][\128-\191]*)", function(m1, m2)
return m1 .. uupper(m2)
end)
end
-- Jejaki override modul.
if module_override ~= nil then
track("module_override")
end
return text
end
do
local function handle_language_spec(self, spec, sc)
local ret = self["_" .. spec]
if ret == nil then
ret = self._data[spec]
if type(ret) == "string" then
ret = list_to_set(split(ret, ",", true, true))
end
self["_" .. spec] = ret
end
if type(ret) == "table" then
ret = ret[sc:getCode()]
end
return not not ret
end
function Language:overrideManualTranslit(sc)
return handle_language_spec(self, "override_translit", sc)
end
function Language:link_tr(sc)
return handle_language_spec(self, "link_tr", sc)
end
end
--[==[Mengembalikan {{code|lua|true}} jika bahasa mempunyai modul transliterasi, atau {{code|lua|false}} jika tiada.]==]
function Language:hasTranslit()
return not not self._data.translit
end
--[==[Mengembalikan {{code|lua|true}} jika bahasa menggunakan huruf I/ı dan İ/i, atau {{code|lua|false}} jika tidak.]==]
function Language:hasDottedDotlessI()
return not not self._data.dotted_dotless_i
end
function Language:toJSON(opts)
local strip_diacritics, strip_diacritics_patterns, strip_diacritics_remove_diacritics = self._data.strip_diacritics
if strip_diacritics then
if strip_diacritics.from then
strip_diacritics_patterns = {}
for i, from in ipairs(strip_diacritics.from) do
insert(strip_diacritics_patterns, {from = from, to = strip_diacritics.to[i] or ""})
end
end
strip_diacritics_remove_diacritics = strip_diacritics.remove_diacritics
end
-- mainCode hanya bernilai bukan nil jika dontCanonicalizeAliases dihantar ke make_object().
-- props sepatutnya mengandungi fungsi tanpa argumen untuk mengira nilai, atau nilai itu sendiri.
local props = {
ancestors = function() return self:getAncestorCodes() end,
canonicalName = function() return self:getCanonicalName() end,
categoryName = function() return self:getCategoryName("nocap") end,
code = self._code,
mainCode = self._mainCode,
parent = function() return self:getParentCode() end,
full = function() return self:getFullCode() end,
stripDiacriticsPatterns = strip_diacritics_patterns,
stripDiacriticsRemoveDiacritics = strip_diacritics_remove_diacritics,
family = function() return self:getFamilyCode() end,
aliases = function() return self:getAliases() end,
varieties = function() return self:getVarieties() end,
otherNames = function() return self:getOtherNames() end,
scripts = function() return self:getScriptCodes() end,
type = function() return keys_to_list(self:getTypes()) end,
wikimediaLanguages = function() return self:getWikimediaLanguageCodes() end,
wikidataItem = function() return self:getWikidataItem() end,
wikipediaArticle = function() return self:getWikipediaArticle(true) end,
}
local ret = {}
for prop, val in pairs(props) do
if not opts.skip_fields or not opts.skip_fields[prop] then
if type(val) == "function" then
ret[prop] = val()
else
ret[prop] = val
end
end
end
-- Gunakan `deep_copy` apabila mengembalikan jadual, supaya tiada sekatan penyuntingan yang dikenakan oleh `mw.loadData`.
return opts and opts.lua_table and deep_copy(ret) or to_json(ret, opts)
end
function export.getDataModuleName(code)
local letter = match(code, "^(%l)%l%l?$")
return "Modul:" .. (
letter == nil and "languages/data/exceptional" or
#code == 2 and "languages/data/2" or
"languages/data/3/" .. letter
)
end
get_data_module_name = export.getDataModuleName
function export.getExtraDataModuleName(code)
return get_data_module_name(code) .. "/extra"
end
get_extra_data_module_name = export.getExtraDataModuleName
do
local function make_stack(data)
local key_types = {
[2] = "unique",
aliases = "unique",
otherNames = "unique",
type = "append",
varieties = "unique",
wikipedia_article = "unique",
wikimedia_codes = "unique"
}
local function __index(self, k)
local stack, key_type = getmetatable(self), key_types[k]
-- Data yang tidak diwarisi daripada induk.
if key_type == "unique" then
local v = stack[stack[make_stack]][k]
if v == nil then
local layer = stack[0]
if layer then -- Boleh bernilai false jika tiada data tambahan.
v = layer[k]
end
end
return v
-- Data yang ditambah oleh setiap generasi.
elseif key_type == "append" then
local parts, offset, n = {}, 0, stack[make_stack]
for i = 1, n do
local part = stack[i][k]
if part == nil then
offset = offset + 1
else
parts[i - offset] = part
end
end
return offset ~= n and concat(parts, ",") or nil
end
local n = stack[make_stack]
while true do
local layer = stack[n]
if not layer then -- Boleh bernilai false jika tiada data tambahan.
return nil
end
local v = layer[k]
if v ~= nil then
return v
end
n = n - 1
end
end
local function __newindex()
error("jadual adalah baca sahaja")
end
local function __pairs(self)
-- Mengulangi susunan tindanan ke bawah, mencache kunci bagi mengelakkan pulangan pendua.
local stack, seen = getmetatable(self), {}
local n = stack[make_stack]
local iter, state, k, v = pairs(stack[n])
return function()
repeat
repeat
k = iter(state, k)
if k == nil then
n = n - 1
local layer = stack[n]
if not layer then -- Boleh bernilai false jika tiada data tambahan.
return nil
end
iter, state, k = pairs(layer)
end
until not (k == nil or seen[k])
-- Dapatkan nilai melalui carian, kerana nilai yang dikembalikan oleh
-- lelaran adalah nilai mentah daripada lapisan semasa,
-- yang mungkin bukan nilai yang akan dikembalikan oleh __index untuk
-- kunci tersebut. Lakukan juga memoize kunci dalam `seen` (walaupun carian
-- mengembalikan nil) supaya ia tidak dicari semula.
-- TODO: simpan nilai dalam `self`, mengelakkan keperluan membina
-- jadual `seen`. Lelaran perlu mengulangi ke atas
-- `self` dengan `next` terlebih dahulu untuk menemuinya pada gelung akan datang.
v, seen[k] = self[k], true
until v ~= nil
return k, v
end
end
local __ipairs = require(table_module).indexIpairs
function make_stack(data)
local stack = {
data,
[make_stack] = 1, -- menyimpan panjang dan bertindak sebagai penanda untuk mengesahkan sesuatu metajadual ialah tindanan.
__index = __index,
__newindex = __newindex,
__pairs = __pairs,
__ipairs = __ipairs,
}
stack.__metatable = stack
return setmetatable({}, stack), stack
end
return make_stack(data)
end
local function get_stack(data)
local stack = getmetatable(data)
return stack and type(stack) == "table" and stack[make_stack] and stack or nil
end
--[==[
<span style="color: var(--wikt-palette-red,#BA0000)">Fungsi ini bukan untuk digunakan dalam entri atau halaman kandungan lain.</span>
Mengembalikan gumpalan data mengenai bahasa tersebut. Format gumpalan ini tidak didokumenkan, dan barangkali tidak stabil; ia bertujuan untuk perkara seperti ujian unit modul itu sendiri, yang berkait rapat dengan modul dan akan dipastikan sentiasa terkini mengikut perubahan format. Jika `extra` ditetapkan, sebarang data tambahan dalam modul `/extra` berkaitan akan disertakan. (Ambil perhatian bahawa ia akan tetap disertakan jika ia telah pun dimuatkan ke dalam objek bahasa.) Jika `raw` ditetapkan, maka data yang dikembalikan tidak akan mengandungi sebarang data yang diwarisi daripada objek induk.
-- JANGAN gunakan kaedah-kaedah ini!
-- Semua penggunaan mesti dipra-luluskan pada halaman perbincangan!
]==]
function Language:getData(extra, raw)
if extra then
self:loadInExtraData()
end
local data = self._data
-- Jika raw tidak ditetapkan, kembalikan data sahaja.
if not raw then
return data
end
local stack = get_stack(data)
-- Jika tiada tindanan atau panjangnya adalah 1, kembalikan data. Data tambahan (jika ada) akan disertakan, kerana ia disimpan pada kunci 0 dan tidak menjejaskan panjang yang dilaporkan.
if stack == nil then
return data
end
local n = stack[make_stack]
if n == 1 then
return data
end
local extra = stack[0]
-- Jika tiada sebarang data tambahan, kembalikan lapisan teratas tindanan.
if extra == nil then
return stack[n]
end
-- Jika ada, kembalikan tindanan baharu yang mempunyai lapisan teratas pada kunci 1 dan data tambahan pada kunci 0.
data, stack = make_stack(stack[n])
stack[0] = extra
return data
end
function Language:loadInExtraData()
-- Hanya bahasa penuh mempunyai data tambahan.
if not self:hasType("language", "full") then
return
end
local data = self._data
-- Jika tiada tindanan, cipta satu.
local stack = get_stack(self._data)
if stack == nil then
data, stack = make_stack(data)
-- Jika telah dimuatkan, kembali.
elseif stack[0] ~= nil then
return
end
self._data = data
-- Muatkan data tambahan daripada modul berkaitan dan tambahkannya pada tindanan pada kunci 0, supaya metamethod __index dan __pairs akan mengambilnya, memandangkan ia mengulangi ke bawah tindanan sehingga kehabisan lapisan.
local code = self._code
local modulename = get_extra_data_module_name(code)
-- Tiada data dicache sebagai false.
stack[0] = modulename and load_data(modulename)[code] or false
end
--[==[Mengembalikan nama modul yang mengandungi data bahasa tersebut. Pada masa ini, ia sentiasa [[Module:scripts/data]].]==]
function Language:getDataModuleName()
local name = self._dataModuleName
if name == nil then
name = self:hasType("etymology-only") and etymology_languages_data_module or
get_data_module_name(self._mainCode or self._code)
self._dataModuleName = name
end
return name
end
--[==[Mengembalikan nama modul yang mengandungi data bahasa tersebut. Pada masa ini, ia sentiasa [[Module:scripts/data]].]==]
function Language:getExtraDataModuleName()
local name = self._extraDataModuleName
if name == nil then
name = not self:hasType("etymology-only") and get_extra_data_module_name(self._mainCode or self._code) or false
self._extraDataModuleName = name
end
return name or nil
end
function export.makeObject(code, data, dontCanonicalizeAliases)
local data_type = type(data)
if data_type ~= "table" then
error(("hujah #2 tidak sah untuk 'makeObject' (jadual dijangkakan, menerima %s)"):format(data_type))
end
-- Tukar sebarang alias.
local input_code = code
code = normalize_code(code)
input_code = dontCanonicalizeAliases and input_code or code
local parent
if data.parent then
parent = get_by_code(data.parent, nil, true, true)
else
parent = Language
end
parent.__index = parent
local lang = {_code = input_code}
-- Ini hanya boleh berlaku jika dontCanonicalizeAliases dihantar kepada make_object().
if code ~= input_code then
lang._mainCode = code
end
local parent_data = parent._data
if parent_data == nil then
-- Kod penuh adalah sama seperti kod bahasa.
lang._fullCode = parent._code or code
else
-- Salin kod penuh.
lang._fullCode = parent._fullCode
local stack = get_stack(parent_data)
if stack == nil then
parent_data, stack = make_stack(parent_data)
end
-- Sisipkan data input sebagai lapisan teratas baharu bagi tindanan.
local n = stack[make_stack] + 1
data, stack[n], stack[make_stack] = parent_data, data, n
end
lang._data = data
return setmetatable(lang, parent)
end
make_object = export.makeObject
end
--[==[Mencari bahasa yang kodnya sepadan dengan yang dibekalkan. Jika ia wujud, ia mengembalikan objek <code class="nf">Language</code> yang mewakili bahasa tersebut. Sebaliknya, ia mengembalikan {{code|lua|nil}}, melainkan jika <code class="n">paramForError</code> diberikan, yang mana ralat akan dijana. Jika <code class="n">paramForError</code> bernilai {{code|lua|true}}, mesej ralat generik yang menyatakan kod tidak sah akan dijana; selain itu <code class="n">paramForError</code> sepatutnya rentetan atau nombor yang menyatakan parameter punca kod tersebut, dan parameter ini akan dinyatakan dalam mesej ralat bersama kod yang salah. Jika <code class="n">allowEtymLang</code> dinyatakan, kod bahasa khusus etimologi dibenarkan dan dicari bersama kod bahasa biasa. Jika <code class="n">allowFamily</code> dinyatakan, kod keluarga bahasa dibenarkan dan dicari bersama kod bahasa biasa.]==]
function export.getByCode(code, paramForError, allowEtymLang, allowFamily)
-- Jejaki penggunaan paramForError, bertujuan untuk membolehkannya dialih keluar akhirnya, kerana pengendalian ralat sepatutnya dilakukan oleh [[Module:parameters]], bukan di sini.
if paramForError ~= nil then
track("paramForError")
end
if type(code) ~= "string" then
local typ
if not code then
typ = "nil"
elseif check_object("language", true, code) then
typ = "objek bahasa"
elseif check_object("family", true, code) then
typ = "objek keluarga"
else
typ = type(code)
end
error("Fungsi getByCode menjangkakan rentetan sebagai hujah pertamanya, tetapi menerima " .. typ .. ".")
end
local m_data = load_data(languages_data_module)
if m_data.aliases[code] or m_data.track[code] then
track(code)
end
local norm_code = normalize_code(code)
-- Dapatkan data, menyemak bahasa khusus etimologi jika allowEtymLang ditetapkan.
local data = load_data(get_data_module_name(norm_code))[norm_code] or
allowEtymLang and load_data(etymology_languages_data_module)[norm_code]
-- Jika tiada data ditemui dan allowFamily ditetapkan, semak data keluarga. Jika data keluarga utama ditemui, bina objek menggunakan [[Module:families]] sebagai ganti, kerana objek keluarga mempunyai kaedah yang berbeza. Walau bagaimanapun, jika ia keluarga khusus etimologi, gunakan make_object dalam modul ini (yang mengendalikan pewarisan objek), dan kaedah khusus keluarga akan diwarisi daripada objek induk.
if data == nil and allowFamily then
data = load_data("Modul:families/data")[norm_code]
if data ~= nil then
if data.parent == nil then
return make_family_object(norm_code, data)
elseif not allowEtymLang then
data = nil
end
end
end
local retval = code and data and make_object(code, data)
if not retval and paramForError then
require("Modul:languages/errorGetBy").code(code, paramForError, allowEtymLang, allowFamily)
end
return retval
end
get_by_code = export.getByCode
--[==[Mencari bahasa yang nama kanoniknya (nama yang digunakan untuk mewakili bahasa tersebut di Wiktionary) atau nama lainnya sepadan dengan yang dibekalkan. Jika wujud, ia mengembalikan objek <code class="nf">Language</code> yang mewakili bahasa tersebut. Sebaliknya, ia mengembalikan {{code|lua|nil}}, melainkan <code class="n">paramForError</code> diberikan, yang mana ralat akan dijana. Jika <code class="n">allowEtymLang</code> dinyatakan, kod bahasa khusus etimologi dibenarkan dan dicari bersama kod bahasa biasa. Jika <code class="n">allowFamily</code> dinyatakan, kod keluarga bahasa dibenarkan dan dicari bersama kod bahasa biasa.
Nama kanonik bahasa mestilah sentiasa unik (adalah menjadi ralat bagi dua bahasa di Wiktionary berkongsi nama kanonik yang sama), jadi fungsi ini dijamin memberikan selebih-lebihnya satu hasil.
Fungsi ini dikuasakan oleh [[Module:languages/canonical names]], yang mengandungi pemetaan prapapar nama kanonik bahasa penuh kepada kod. Ia dijana dengan meneliti [[:Kategori:Modul data bahasa]] bagi bahasa penuh. Apabila <code class="n">allowEtymLang</code> dinyatakan untuk fungsi di atas, [[Module:etymology languages/canonical names]] juga boleh digunakan, dan apabila <code class="n">allowFamily</code> dinyatakan untuk fungsi di atas, [[Module:families/canonical names]] juga boleh digunakan.]==]
function export.getByCanonicalName(name, errorIfInvalid, allowEtymLang, allowFamily)
local byName = load_data("Modul:languages/canonical names")
local code = byName and byName[name]
if not code and allowEtymLang then
byName = load_data("Modul:etymology languages/canonical names")
code = byName and byName[name] or
byName[gsub(name, "^[Ss]ubstratum ", "")] or
byName[gsub(name, "^suatu ", "")] or
byName[gsub(name, "^suatu ", ""):gsub("^[Ss]ubstratum ", "")] or
-- Untuk keluarga etimologi seperti "ira-pro".
-- AMARAN: Ini kurang ideal, kerana ia membenarkan " languages" dilampirkan pada mana-mana bahasa khusus etimologi juga.
byName[match(name, "^[Bb]ahasa%-bahasa (.*)$")]
end
if not code and allowFamily then
byName = load_data("Modul:families/canonical names")
code = byName[name] or byName[match(name, "^[Bb]ahasa%-bahasa (.*)$")]
end
local retval = code and get_by_code(code, errorIfInvalid, allowEtymLang, allowFamily)
if not retval and errorIfInvalid then
require("Modul:languages/errorGetBy").canonicalName(name, allowEtymLang, allowFamily)
end
return retval
end
--[==[Digunakan oleh [[Module:languages/data/2]] (dan lain-lain) serta [[Module:etymology languages/data]], [[Module:families/data]], [[Module:scripts/data]] dan [[Module:writing systems/data]] untuk memuktamadkan data ke dalam format yang sebenarnya dikembalikan.]==]
function export.finalizeData(data, main_type, variety)
local fields = {"type"}
if main_type == "language" then
insert(fields, 4) -- kod skrip
insert(fields, "ancestors")
insert(fields, "link_tr")
insert(fields, "override_translit")
insert(fields, "wikimedia_codes")
elseif main_type == "script" then
insert(fields, 3) -- kod sistem tulisan
end -- Keluarga dan sistem tulisan tidak mempunyai medan tambahan untuk diproses.
local fields_len = #fields
for _, entity in next, data do
if variety then
-- Pindahkan induk daripada 3 ke "parent" dan keluarga daripada "family" ke 3. Ini berbeza atas dasar kemudahan, memandangkan sangat sedikit variasi yang menyatakan keluarga, manakala kesemuanya mempunyai induk.
entity.parent, entity[3], entity.family = entity[3], entity.family
-- Berikan jenis "regular" jika dan hanya jika bukan variasi dan tiada jenis lain yang ditetapkan.
elseif not (entity.type or entity.parent) then
entity.type = "regular"
end
for i = 1, fields_len do
local key = fields[i]
local field = entity[key]
if field and type(field) == "string" then
entity[key] = gsub(field, "%s*,%s*", ",")
end
end
end
return data
end
--[==[Untuk keserasian ke belakang sahaja; modul sepatutnya memerlukan fail ralat itu sendiri.]==]
function export.err(lang_code, param, code_desc, template_tag, not_real_lang)
return require("Modul:languages/error")(lang_code, param, code_desc, template_tag, not_real_lang)
end
return export
ky8q2j48o9sl1k2k4ahuz9jhkah6vzm
aal
0
30667
375323
324720
2026-09-17T08:42:34Z
Ultron90
4762
375323
wikitext
text/x-wiki
==Bahasa {{bahasa|kqr}}==
===Kata nama===
{{inti|kqr|kata nama}}
# [[hal]]
#: {{ux|kqr|Dotilo do '''aal''' ino.
|Itu '''hal''' mereka.}}
fohduij6ypkyswsysdsly737sc2babn
375327
375323
2026-09-17T08:46:34Z
Ultron90
4762
375327
wikitext
text/x-wiki
{{wt:kqr/{{PAGENAME}}}}
pa0ao48e7ymhrfir924u76zx8p0pty3
Pengguna:Mirlim/atma bahasa
2
136565
375317
373453
2026-09-17T07:06:01Z
Mirlim
8057
/* Atma Bahasa */
375317
wikitext
text/x-wiki
===Atma Bahasa===
: '''Khamis, pukul 3 petang di Perak FM'''<br/>Segmen 1: Uniknya Dialek Perak<br/>Segmen 2: Tatabahasa<br/>Segmen 3: Biasakan yang Betul, Betulkan yang Biasa<br/>Segmen 4: Perbendaharaan kata<br/>Segmen 5: Peribahasa<br/>Segmen 6: Imbas Loghat Perak (minggu lepas) & Kuiz (05-545 8559)
----
<div class="toccolours mw-collapsible mw-collapsed" style="width:400px; overflow:auto;"><div style="font-weight:bold;">
Intro (nanti baiki)
</div><div class="mw-collapsible-content">
; UDP
: bejijio - meleleh
: bejerobon - bertindan/berlonggok
: berpiang-piang - pening lalat
: nyambé - sambil?
: robek - kupas
: tereban - balig batu
: nyadin - buat tak peduli
; Peribahasa
: meniup api dalam air?
: seperti air dengan asap - tak dapat dpshkn
: api padam puntung hanyut, kami tak di situ lagi - slesai?
: jangan bijak terpijak, biarlah bodoh bersuluh -
: laksana bunga dedap, sungguh merah berbau tidak -
: belum lepas asap di dapur, sudah mahu menjadi langit -
</div></div>
==Ogos 2026==
===06-08-26===
; UDP
: [[sepasei]] - satu hal
: [[sepicin]] - sekejap
: [[serogoh]] - marah dengan menengking
: [[serokop]] - menutup
: [[setumbar]] - suatu masa, suatu ketika
; Perbendaharaan kata
: [[lejas]] - telus
: [[sebam]] - lusuh, luntur warnanya, pucat
: [[ruai]] - lobi hotel
: [[rumpang]] - sela waktu
: [[leja]]? - marah
; Peribahasa
: [[bagai lalang ditiup angin]] - tidak tetap pendirian
: [[bagai galah di tengah arus]] - selalu keluh-kesah
: [[bagai berumah di tepi tebing]] - selalu dalam ketakutan
: [[bagai bulan dengan matahari]] - sama-sama indah sama-sama cantik, [[bagai pinang dibelah dua]]
: [[bagai lebah menghimpun madu]] - orang yang sangat rajin
; Imbas Loghat Perak
: [[gincah]] - menggunakan air berlebih-lebihan
: [[gincang]] - pantas dan cekap melakukan pekerjaan, lincah
: [[goyo]] - keadaan berdiri atau berjalan secara terhuyung-hayang
===13-08-26===
; UDP
: (nanti bukak rakaman)
; Kesalahan Lazim
: perkarangan > pekarangan
: persaraan > persaraan
: penglibatan > pelibatan
: perlaksanaan > pelaksanaan
: kepimpinan > kepemimpinan
: pesiaran (jalan) vs persiaran
: penghawa dingin > pendingin hawa
; BYBBYB
: bilik persalinan (salin baju) > bilik acu (cuba baju)
: temu janji > janji temu (janji dulu baru temu, hukum DM)
: sampin > samping
: ves > rompi?
; Perbendaharaan kata
: [[suria kanta]]: kanta pembesar
: [[tetunggul]]
:: 1. panji-panji, bendera
:: 2. warna-warna di kaki langit, aurora borealis
: [[gencana]]: bencana, godaan, gangguan yang bawa bahaya
: [[beterangan]]: kediaman, tempat tinggal, tempat bermalam, tempat berteduh, tempat perlindungan
; Puisi tradisional
: Gurindam
; Imbas Loghat Perak
: sepasei: sepakat sepadan
: sepicin: seminit, sekejap
: serogoh:
:: 1. menceroboh tanpa izin
:: 2. marah
: serokop: tekup dari atas
: setumbar:
:: 1. seketika
:: 2. air yang penuh
===27-08-2026===
; UDP
: menyongèh - banyak cakap, merungut
: berambu - berselerak, tak teratur
: cempere (Kuala), cemperè (P. Tengah), cempèra (baku) - nakal, suka buat kacau
: membongai - terpinga-pinga, tercengang-cengang
: kécah - pecah
: cerèpèk - cakap tak henti
; Kesalahan Lazim
: ianya > ia
:: ia dan -nya dua-dua kata ganti
: mereka-mereka > mereka
:: Dialek Perak: mereka - dème; teman, awok, aye - saya
: terpaling > ter- atau paling
:: Gen Z guna [[terpaling]] untuk gurauan, selain itu [[sumpah]]
; BYBBYB
: submit > serahkan
: meeting > mesyuarat
: MC > cuti sakit
: update > kemaskini
: follow up > susulan
: dateline > tarikh akhir
: briefing > taklimat
; Perbendaharaan Kata
* bahas lirik Di Ambang Wati - Wings
: gita - lagu, nyanyian, syair atau puisi dilagukan, pujian, sanjungan
: kama - cinta, asmara, rindu, keinginan, hasrat
: citra - keperibadian, imej, gambaran
: wati - wanita, angkasa, langit
; Peribahasa
: jangan bermain di air keruh - jangan tiru buatan yang buruk
: jangan fikir air pasang sahaja - jangan fikir nasib baik sahaja
: jangan dengar siul ular - jangan terpedaya dengan musuh
: jangan bangkit harimau yang tidur
: jangan ditentang matahari condong
: jangan ditegakkan benang yang basah
: jangan difikir yang dicubit segantang ???
===10-09-26===
; UDP
* dia duk sebut nama-nama tempat di Perak dalam Dialek Perak
: cangkat - tempat tinggi
; Segmen Tatabahasa
* kata baynak makna
: [[asal]] - mula, sebaik sahaja, pangkal
: [[mereka]] - KG3, merancang, mencipta
: [[kesan]] - tanda, sesuatu yg timbul, pengaruh yg timbul dari menyaksikan atau mendengar sesatu
; BYBBYB
* jenama yang sinonim sehingga terbawa-bawa
: [[Colgate]] > [[ubat gigi]]
: [[Maggi]] > [[mi]] [[segera]]
: [[Kodak]] > [[filem]] [[kamera]]
: [[Pampers]] > [[lampin]] [[pakai buang]]
: [[Tupperware]] > [[bekas]] [[makanan]] (Perak ''siã'')
; Perbendaharaan Kata
* bahas lirik Cindai - Siti Nurhaliza
: dil mas cdrny intan bbtl lgn - kehidupan yang mewah vs sederhana
: biduk lyrny krts prhu sbrg lwt brpi - prlmbgn mnusia yg srb lemah, yg prlu mnmpuh ujian yg bsr
; Peribahasa
* mengenai orang tua
*: (<code>mata sudah mula kabur, uban sudah mula berterabur</code>)
: tua2 tupai tak tidur ats tnh - org tua stiasa gembira hidupnya
: tua2 terung masam - org tua brprngai muda
: tua2 tlur ayam - tua sedikit shj, jurang usia yg kcil
: pinang tua merah ekor - prmpuan brumur brkelakuan gadis muda
: tua2 kelapa - smakin tua smakin baik prgai/ byk ilmu
: tua2 keladi - smakin tua smakin miang
: gayung tua - kata/keputusan dr org tua biasanya lebih tepat/brnas
1mhm76nb1t12hzsfrccrar1pej42x33
375318
375317
2026-09-17T07:06:17Z
Mirlim
8057
/* 10-09-26 */
375318
wikitext
text/x-wiki
===Atma Bahasa===
: '''Khamis, pukul 3 petang di Perak FM'''<br/>Segmen 1: Uniknya Dialek Perak<br/>Segmen 2: Tatabahasa<br/>Segmen 3: Biasakan yang Betul, Betulkan yang Biasa<br/>Segmen 4: Perbendaharaan kata<br/>Segmen 5: Peribahasa<br/>Segmen 6: Imbas Loghat Perak (minggu lepas) & Kuiz (05-545 8559)
----
<div class="toccolours mw-collapsible mw-collapsed" style="width:400px; overflow:auto;"><div style="font-weight:bold;">
Intro (nanti baiki)
</div><div class="mw-collapsible-content">
; UDP
: bejijio - meleleh
: bejerobon - bertindan/berlonggok
: berpiang-piang - pening lalat
: nyambé - sambil?
: robek - kupas
: tereban - balig batu
: nyadin - buat tak peduli
; Peribahasa
: meniup api dalam air?
: seperti air dengan asap - tak dapat dpshkn
: api padam puntung hanyut, kami tak di situ lagi - slesai?
: jangan bijak terpijak, biarlah bodoh bersuluh -
: laksana bunga dedap, sungguh merah berbau tidak -
: belum lepas asap di dapur, sudah mahu menjadi langit -
</div></div>
==Ogos 2026==
===06-08-26===
; UDP
: [[sepasei]] - satu hal
: [[sepicin]] - sekejap
: [[serogoh]] - marah dengan menengking
: [[serokop]] - menutup
: [[setumbar]] - suatu masa, suatu ketika
; Perbendaharaan kata
: [[lejas]] - telus
: [[sebam]] - lusuh, luntur warnanya, pucat
: [[ruai]] - lobi hotel
: [[rumpang]] - sela waktu
: [[leja]]? - marah
; Peribahasa
: [[bagai lalang ditiup angin]] - tidak tetap pendirian
: [[bagai galah di tengah arus]] - selalu keluh-kesah
: [[bagai berumah di tepi tebing]] - selalu dalam ketakutan
: [[bagai bulan dengan matahari]] - sama-sama indah sama-sama cantik, [[bagai pinang dibelah dua]]
: [[bagai lebah menghimpun madu]] - orang yang sangat rajin
; Imbas Loghat Perak
: [[gincah]] - menggunakan air berlebih-lebihan
: [[gincang]] - pantas dan cekap melakukan pekerjaan, lincah
: [[goyo]] - keadaan berdiri atau berjalan secara terhuyung-hayang
===13-08-26===
; UDP
: (nanti bukak rakaman)
; Kesalahan Lazim
: perkarangan > pekarangan
: persaraan > persaraan
: penglibatan > pelibatan
: perlaksanaan > pelaksanaan
: kepimpinan > kepemimpinan
: pesiaran (jalan) vs persiaran
: penghawa dingin > pendingin hawa
; BYBBYB
: bilik persalinan (salin baju) > bilik acu (cuba baju)
: temu janji > janji temu (janji dulu baru temu, hukum DM)
: sampin > samping
: ves > rompi?
; Perbendaharaan kata
: [[suria kanta]]: kanta pembesar
: [[tetunggul]]
:: 1. panji-panji, bendera
:: 2. warna-warna di kaki langit, aurora borealis
: [[gencana]]: bencana, godaan, gangguan yang bawa bahaya
: [[beterangan]]: kediaman, tempat tinggal, tempat bermalam, tempat berteduh, tempat perlindungan
; Puisi tradisional
: Gurindam
; Imbas Loghat Perak
: sepasei: sepakat sepadan
: sepicin: seminit, sekejap
: serogoh:
:: 1. menceroboh tanpa izin
:: 2. marah
: serokop: tekup dari atas
: setumbar:
:: 1. seketika
:: 2. air yang penuh
===27-08-2026===
; UDP
: menyongèh - banyak cakap, merungut
: berambu - berselerak, tak teratur
: cempere (Kuala), cemperè (P. Tengah), cempèra (baku) - nakal, suka buat kacau
: membongai - terpinga-pinga, tercengang-cengang
: kécah - pecah
: cerèpèk - cakap tak henti
; Kesalahan Lazim
: ianya > ia
:: ia dan -nya dua-dua kata ganti
: mereka-mereka > mereka
:: Dialek Perak: mereka - dème; teman, awok, aye - saya
: terpaling > ter- atau paling
:: Gen Z guna [[terpaling]] untuk gurauan, selain itu [[sumpah]]
; BYBBYB
: submit > serahkan
: meeting > mesyuarat
: MC > cuti sakit
: update > kemaskini
: follow up > susulan
: dateline > tarikh akhir
: briefing > taklimat
; Perbendaharaan Kata
* bahas lirik Di Ambang Wati - Wings
: gita - lagu, nyanyian, syair atau puisi dilagukan, pujian, sanjungan
: kama - cinta, asmara, rindu, keinginan, hasrat
: citra - keperibadian, imej, gambaran
: wati - wanita, angkasa, langit
; Peribahasa
: jangan bermain di air keruh - jangan tiru buatan yang buruk
: jangan fikir air pasang sahaja - jangan fikir nasib baik sahaja
: jangan dengar siul ular - jangan terpedaya dengan musuh
: jangan bangkit harimau yang tidur
: jangan ditentang matahari condong
: jangan ditegakkan benang yang basah
: jangan difikir yang dicubit segantang ???
===10-09-26===
; UDP
* dia duk sebut nama-nama tempat di Perak dalam Dialek Perak
: cangkat - tempat tinggi
; Segmen Tatabahasa
* kata baynak makna
: [[asal]] - mula, sebaik sahaja, pangkal
: [[mereka]] - KG3, merancang, mencipta
: [[kesan]] - tanda, sesuatu yg timbul, pengaruh yg timbul dari menyaksikan atau mendengar sesatu
; BYBBYB
* jenama yang sinonim sehingga terbawa-bawa
: [[Colgate]] > [[ubat gigi]]
: [[Maggi]] > [[mi]] [[segera]]
: [[Kodak]] > [[filem]] [[kamera]]
: [[Pampers]] > [[lampin]] [[pakai buang]]
: [[Tupperware]] > [[bekas]] [[makanan]] (Perak ''siã'')
; Perbendaharaan Kata
* bahas lirik Cindai - Siti Nurhaliza
: dil mas cdrny intan bbtl lgn - kehidupan yang mewah vs sederhana
: biduk lyrny krts prhu sbrg lwt brpi - prlmbgn mnusia yg srb lemah, yg prlu mnmpuh ujian yg bsr
; Peribahasa
* mengenai orang tua
*: (<code>mata sudah mula kabur, uban sudah mula berterabur</code>)
: tua2 tupai tak tidur ats tnh - org tua stiasa gembira hidupnya
: tua2 terung masam - org tua brprngai muda
: tua2 tlur ayam - tua sedikit shj, jurang usia yg kcil
: pinang tua merah ekor - prmpuan brumur brkelakuan gadis muda
: tua2 kelapa - smakin tua smakin baik prgai/ byk ilmu
: tua2 keladi - smakin tua smakin miang
: gayung tua - kata/keputusan dr org tua biasanya lebih tepat/brnas
==17-9-26==
; UDP
: [[]] -
: [[]] -
: [[]] -
o2ayudxzyof38wsepxa9nzra7f8sr7u
375319
375318
2026-09-17T07:12:27Z
Mirlim
8057
/* 17-9-26 */
375319
wikitext
text/x-wiki
===Atma Bahasa===
: '''Khamis, pukul 3 petang di Perak FM'''<br/>Segmen 1: Uniknya Dialek Perak<br/>Segmen 2: Tatabahasa<br/>Segmen 3: Biasakan yang Betul, Betulkan yang Biasa<br/>Segmen 4: Perbendaharaan kata<br/>Segmen 5: Peribahasa<br/>Segmen 6: Imbas Loghat Perak (minggu lepas) & Kuiz (05-545 8559)
----
<div class="toccolours mw-collapsible mw-collapsed" style="width:400px; overflow:auto;"><div style="font-weight:bold;">
Intro (nanti baiki)
</div><div class="mw-collapsible-content">
; UDP
: bejijio - meleleh
: bejerobon - bertindan/berlonggok
: berpiang-piang - pening lalat
: nyambé - sambil?
: robek - kupas
: tereban - balig batu
: nyadin - buat tak peduli
; Peribahasa
: meniup api dalam air?
: seperti air dengan asap - tak dapat dpshkn
: api padam puntung hanyut, kami tak di situ lagi - slesai?
: jangan bijak terpijak, biarlah bodoh bersuluh -
: laksana bunga dedap, sungguh merah berbau tidak -
: belum lepas asap di dapur, sudah mahu menjadi langit -
</div></div>
==Ogos 2026==
===06-08-26===
; UDP
: [[sepasei]] - satu hal
: [[sepicin]] - sekejap
: [[serogoh]] - marah dengan menengking
: [[serokop]] - menutup
: [[setumbar]] - suatu masa, suatu ketika
; Perbendaharaan kata
: [[lejas]] - telus
: [[sebam]] - lusuh, luntur warnanya, pucat
: [[ruai]] - lobi hotel
: [[rumpang]] - sela waktu
: [[leja]]? - marah
; Peribahasa
: [[bagai lalang ditiup angin]] - tidak tetap pendirian
: [[bagai galah di tengah arus]] - selalu keluh-kesah
: [[bagai berumah di tepi tebing]] - selalu dalam ketakutan
: [[bagai bulan dengan matahari]] - sama-sama indah sama-sama cantik, [[bagai pinang dibelah dua]]
: [[bagai lebah menghimpun madu]] - orang yang sangat rajin
; Imbas Loghat Perak
: [[gincah]] - menggunakan air berlebih-lebihan
: [[gincang]] - pantas dan cekap melakukan pekerjaan, lincah
: [[goyo]] - keadaan berdiri atau berjalan secara terhuyung-hayang
===13-08-26===
; UDP
: (nanti bukak rakaman)
; Kesalahan Lazim
: perkarangan > pekarangan
: persaraan > persaraan
: penglibatan > pelibatan
: perlaksanaan > pelaksanaan
: kepimpinan > kepemimpinan
: pesiaran (jalan) vs persiaran
: penghawa dingin > pendingin hawa
; BYBBYB
: bilik persalinan (salin baju) > bilik acu (cuba baju)
: temu janji > janji temu (janji dulu baru temu, hukum DM)
: sampin > samping
: ves > rompi?
; Perbendaharaan kata
: [[suria kanta]]: kanta pembesar
: [[tetunggul]]
:: 1. panji-panji, bendera
:: 2. warna-warna di kaki langit, aurora borealis
: [[gencana]]: bencana, godaan, gangguan yang bawa bahaya
: [[beterangan]]: kediaman, tempat tinggal, tempat bermalam, tempat berteduh, tempat perlindungan
; Puisi tradisional
: Gurindam
; Imbas Loghat Perak
: sepasei: sepakat sepadan
: sepicin: seminit, sekejap
: serogoh:
:: 1. menceroboh tanpa izin
:: 2. marah
: serokop: tekup dari atas
: setumbar:
:: 1. seketika
:: 2. air yang penuh
===27-08-2026===
; UDP
: menyongèh - banyak cakap, merungut
: berambu - berselerak, tak teratur
: cempere (Kuala), cemperè (P. Tengah), cempèra (baku) - nakal, suka buat kacau
: membongai - terpinga-pinga, tercengang-cengang
: kécah - pecah
: cerèpèk - cakap tak henti
; Kesalahan Lazim
: ianya > ia
:: ia dan -nya dua-dua kata ganti
: mereka-mereka > mereka
:: Dialek Perak: mereka - dème; teman, awok, aye - saya
: terpaling > ter- atau paling
:: Gen Z guna [[terpaling]] untuk gurauan, selain itu [[sumpah]]
; BYBBYB
: submit > serahkan
: meeting > mesyuarat
: MC > cuti sakit
: update > kemaskini
: follow up > susulan
: dateline > tarikh akhir
: briefing > taklimat
; Perbendaharaan Kata
* bahas lirik Di Ambang Wati - Wings
: gita - lagu, nyanyian, syair atau puisi dilagukan, pujian, sanjungan
: kama - cinta, asmara, rindu, keinginan, hasrat
: citra - keperibadian, imej, gambaran
: wati - wanita, angkasa, langit
; Peribahasa
: jangan bermain di air keruh - jangan tiru buatan yang buruk
: jangan fikir air pasang sahaja - jangan fikir nasib baik sahaja
: jangan dengar siul ular - jangan terpedaya dengan musuh
: jangan bangkit harimau yang tidur
: jangan ditentang matahari condong
: jangan ditegakkan benang yang basah
: jangan difikir yang dicubit segantang ???
===10-09-26===
; UDP
* dia duk sebut nama-nama tempat di Perak dalam Dialek Perak
: cangkat - tempat tinggi
; Segmen Tatabahasa
* kata baynak makna
: [[asal]] - mula, sebaik sahaja, pangkal
: [[mereka]] - KG3, merancang, mencipta
: [[kesan]] - tanda, sesuatu yg timbul, pengaruh yg timbul dari menyaksikan atau mendengar sesatu
; BYBBYB
* jenama yang sinonim sehingga terbawa-bawa
: [[Colgate]] > [[ubat gigi]]
: [[Maggi]] > [[mi]] [[segera]]
: [[Kodak]] > [[filem]] [[kamera]]
: [[Pampers]] > [[lampin]] [[pakai buang]]
: [[Tupperware]] > [[bekas]] [[makanan]] (Perak ''siã'')
; Perbendaharaan Kata
* bahas lirik Cindai - Siti Nurhaliza
: dil mas cdrny intan bbtl lgn - kehidupan yang mewah vs sederhana
: biduk lyrny krts prhu sbrg lwt brpi - prlmbgn mnusia yg srb lemah, yg prlu mnmpuh ujian yg bsr
; Peribahasa
* mengenai orang tua
*: (<code>mata sudah mula kabur, uban sudah mula berterabur</code>)
: tua2 tupai tak tidur ats tnh - org tua stiasa gembira hidupnya
: tua2 terung masam - org tua brprngai muda
: tua2 tlur ayam - tua sedikit shj, jurang usia yg kcil
: pinang tua merah ekor - prmpuan brumur brkelakuan gadis muda
: tua2 kelapa - smakin tua smakin baik prgai/ byk ilmu
: tua2 keladi - smakin tua smakin miang
: gayung tua - kata/keputusan dr org tua biasanya lebih tepat/brnas
==17-9-26==
; UDP
: [[monok]] - tubuh badan gemuk, bulat, padat, berisi, gempal
: [[morat]] ([[ngorat]]?) - punca suatu kejadian atau perkara, = [[pasei]]
: [[nabung]] - 1. prbuatan menaburkan ssuatu, 2. harapan yang kecewa
: [[nake ni]] (naka) - macam ini
: [[ngelejat]] - keadaan menggelatar, menggigil, menggelupur (sakit, terkena air panas)
8hwx51lgjlwakwe8wevmkqvvp7i1hkx
375320
375319
2026-09-17T07:23:31Z
Mirlim
8057
/* 17-9-26 */
375320
wikitext
text/x-wiki
===Atma Bahasa===
: '''Khamis, pukul 3 petang di Perak FM'''<br/>Segmen 1: Uniknya Dialek Perak<br/>Segmen 2: Tatabahasa<br/>Segmen 3: Biasakan yang Betul, Betulkan yang Biasa<br/>Segmen 4: Perbendaharaan kata<br/>Segmen 5: Peribahasa<br/>Segmen 6: Imbas Loghat Perak (minggu lepas) & Kuiz (05-545 8559)
----
<div class="toccolours mw-collapsible mw-collapsed" style="width:400px; overflow:auto;"><div style="font-weight:bold;">
Intro (nanti baiki)
</div><div class="mw-collapsible-content">
; UDP
: bejijio - meleleh
: bejerobon - bertindan/berlonggok
: berpiang-piang - pening lalat
: nyambé - sambil?
: robek - kupas
: tereban - balig batu
: nyadin - buat tak peduli
; Peribahasa
: meniup api dalam air?
: seperti air dengan asap - tak dapat dpshkn
: api padam puntung hanyut, kami tak di situ lagi - slesai?
: jangan bijak terpijak, biarlah bodoh bersuluh -
: laksana bunga dedap, sungguh merah berbau tidak -
: belum lepas asap di dapur, sudah mahu menjadi langit -
</div></div>
==Ogos 2026==
===06-08-26===
; UDP
: [[sepasei]] - satu hal
: [[sepicin]] - sekejap
: [[serogoh]] - marah dengan menengking
: [[serokop]] - menutup
: [[setumbar]] - suatu masa, suatu ketika
; Perbendaharaan kata
: [[lejas]] - telus
: [[sebam]] - lusuh, luntur warnanya, pucat
: [[ruai]] - lobi hotel
: [[rumpang]] - sela waktu
: [[leja]]? - marah
; Peribahasa
: [[bagai lalang ditiup angin]] - tidak tetap pendirian
: [[bagai galah di tengah arus]] - selalu keluh-kesah
: [[bagai berumah di tepi tebing]] - selalu dalam ketakutan
: [[bagai bulan dengan matahari]] - sama-sama indah sama-sama cantik, [[bagai pinang dibelah dua]]
: [[bagai lebah menghimpun madu]] - orang yang sangat rajin
; Imbas Loghat Perak
: [[gincah]] - menggunakan air berlebih-lebihan
: [[gincang]] - pantas dan cekap melakukan pekerjaan, lincah
: [[goyo]] - keadaan berdiri atau berjalan secara terhuyung-hayang
===13-08-26===
; UDP
: (nanti bukak rakaman)
; Kesalahan Lazim
: perkarangan > pekarangan
: persaraan > persaraan
: penglibatan > pelibatan
: perlaksanaan > pelaksanaan
: kepimpinan > kepemimpinan
: pesiaran (jalan) vs persiaran
: penghawa dingin > pendingin hawa
; BYBBYB
: bilik persalinan (salin baju) > bilik acu (cuba baju)
: temu janji > janji temu (janji dulu baru temu, hukum DM)
: sampin > samping
: ves > rompi?
; Perbendaharaan kata
: [[suria kanta]]: kanta pembesar
: [[tetunggul]]
:: 1. panji-panji, bendera
:: 2. warna-warna di kaki langit, aurora borealis
: [[gencana]]: bencana, godaan, gangguan yang bawa bahaya
: [[beterangan]]: kediaman, tempat tinggal, tempat bermalam, tempat berteduh, tempat perlindungan
; Puisi tradisional
: Gurindam
; Imbas Loghat Perak
: sepasei: sepakat sepadan
: sepicin: seminit, sekejap
: serogoh:
:: 1. menceroboh tanpa izin
:: 2. marah
: serokop: tekup dari atas
: setumbar:
:: 1. seketika
:: 2. air yang penuh
===27-08-2026===
; UDP
: menyongèh - banyak cakap, merungut
: berambu - berselerak, tak teratur
: cempere (Kuala), cemperè (P. Tengah), cempèra (baku) - nakal, suka buat kacau
: membongai - terpinga-pinga, tercengang-cengang
: kécah - pecah
: cerèpèk - cakap tak henti
; Kesalahan Lazim
: ianya > ia
:: ia dan -nya dua-dua kata ganti
: mereka-mereka > mereka
:: Dialek Perak: mereka - dème; teman, awok, aye - saya
: terpaling > ter- atau paling
:: Gen Z guna [[terpaling]] untuk gurauan, selain itu [[sumpah]]
; BYBBYB
: submit > serahkan
: meeting > mesyuarat
: MC > cuti sakit
: update > kemaskini
: follow up > susulan
: dateline > tarikh akhir
: briefing > taklimat
; Perbendaharaan Kata
* bahas lirik Di Ambang Wati - Wings
: gita - lagu, nyanyian, syair atau puisi dilagukan, pujian, sanjungan
: kama - cinta, asmara, rindu, keinginan, hasrat
: citra - keperibadian, imej, gambaran
: wati - wanita, angkasa, langit
; Peribahasa
: jangan bermain di air keruh - jangan tiru buatan yang buruk
: jangan fikir air pasang sahaja - jangan fikir nasib baik sahaja
: jangan dengar siul ular - jangan terpedaya dengan musuh
: jangan bangkit harimau yang tidur
: jangan ditentang matahari condong
: jangan ditegakkan benang yang basah
: jangan difikir yang dicubit segantang ???
===10-09-26===
; UDP
* dia duk sebut nama-nama tempat di Perak dalam Dialek Perak
: cangkat - tempat tinggi
; Segmen Tatabahasa
* kata baynak makna
: [[asal]] - mula, sebaik sahaja, pangkal
: [[mereka]] - KG3, merancang, mencipta
: [[kesan]] - tanda, sesuatu yg timbul, pengaruh yg timbul dari menyaksikan atau mendengar sesatu
; BYBBYB
* jenama yang sinonim sehingga terbawa-bawa
: [[Colgate]] > [[ubat gigi]]
: [[Maggi]] > [[mi]] [[segera]]
: [[Kodak]] > [[filem]] [[kamera]]
: [[Pampers]] > [[lampin]] [[pakai buang]]
: [[Tupperware]] > [[bekas]] [[makanan]] (Perak ''siã'')
; Perbendaharaan Kata
* bahas lirik Cindai - Siti Nurhaliza
: dil mas cdrny intan bbtl lgn - kehidupan yang mewah vs sederhana
: biduk lyrny krts prhu sbrg lwt brpi - prlmbgn mnusia yg srb lemah, yg prlu mnmpuh ujian yg bsr
; Peribahasa
* mengenai orang tua
*: (<code>mata sudah mula kabur, uban sudah mula berterabur</code>)
: tua2 tupai tak tidur ats tnh - org tua stiasa gembira hidupnya
: tua2 terung masam - org tua brprngai muda
: tua2 tlur ayam - tua sedikit shj, jurang usia yg kcil
: pinang tua merah ekor - prmpuan brumur brkelakuan gadis muda
: tua2 kelapa - smakin tua smakin baik prgai/ byk ilmu
: tua2 keladi - smakin tua smakin miang
: gayung tua - kata/keputusan dr org tua biasanya lebih tepat/brnas
==17-9-26==
; UDP
: [[monok]] - tubuh badan gemuk, bulat, padat, berisi, gempal
: [[morat]] ([[ngorat]]?) - punca suatu kejadian atau perkara, = [[pasei]]
: [[nabung]] - 1. prbuatan menaburkan ssuatu, 2. harapan yang kecewa
: [[nake ni]] (naka) - macam ini
: [[ngelejat]] - keadaan menggelatar, menggigil, menggelupur (sakit, terkena air panas)
; Tatabahasa
: Kata Bantu Aspek
:: Masa - cth [[sedang]], [[tengah]], [[akan]], [[belum]]
: Kata Bantu Ragam
:: Perasaan/keinginan - cth [[hendak]], [[perlu]], [[ingin]], [[enggan]]
: aspek + ragam boleh gabung - cth "Saya '''sedang''' '''hendak''' melintas jalan"
; BYBBYB
5yc0b2lsphodsilx9b3gzqawpwzvr8f
375321
375320
2026-09-17T07:55:33Z
Mirlim
8057
/* 17-9-26 */
375321
wikitext
text/x-wiki
===Atma Bahasa===
: '''Khamis, pukul 3 petang di Perak FM'''<br/>Segmen 1: Uniknya Dialek Perak<br/>Segmen 2: Tatabahasa<br/>Segmen 3: Biasakan yang Betul, Betulkan yang Biasa<br/>Segmen 4: Perbendaharaan kata<br/>Segmen 5: Peribahasa<br/>Segmen 6: Imbas Loghat Perak (minggu lepas) & Kuiz (05-545 8559)
----
<div class="toccolours mw-collapsible mw-collapsed" style="width:400px; overflow:auto;"><div style="font-weight:bold;">
Intro (nanti baiki)
</div><div class="mw-collapsible-content">
; UDP
: bejijio - meleleh
: bejerobon - bertindan/berlonggok
: berpiang-piang - pening lalat
: nyambé - sambil?
: robek - kupas
: tereban - balig batu
: nyadin - buat tak peduli
; Peribahasa
: meniup api dalam air?
: seperti air dengan asap - tak dapat dpshkn
: api padam puntung hanyut, kami tak di situ lagi - slesai?
: jangan bijak terpijak, biarlah bodoh bersuluh -
: laksana bunga dedap, sungguh merah berbau tidak -
: belum lepas asap di dapur, sudah mahu menjadi langit -
</div></div>
==Ogos 2026==
===06-08-26===
; UDP
: [[sepasei]] - satu hal
: [[sepicin]] - sekejap
: [[serogoh]] - marah dengan menengking
: [[serokop]] - menutup
: [[setumbar]] - suatu masa, suatu ketika
; Perbendaharaan kata
: [[lejas]] - telus
: [[sebam]] - lusuh, luntur warnanya, pucat
: [[ruai]] - lobi hotel
: [[rumpang]] - sela waktu
: [[leja]]? - marah
; Peribahasa
: [[bagai lalang ditiup angin]] - tidak tetap pendirian
: [[bagai galah di tengah arus]] - selalu keluh-kesah
: [[bagai berumah di tepi tebing]] - selalu dalam ketakutan
: [[bagai bulan dengan matahari]] - sama-sama indah sama-sama cantik, [[bagai pinang dibelah dua]]
: [[bagai lebah menghimpun madu]] - orang yang sangat rajin
; Imbas Loghat Perak
: [[gincah]] - menggunakan air berlebih-lebihan
: [[gincang]] - pantas dan cekap melakukan pekerjaan, lincah
: [[goyo]] - keadaan berdiri atau berjalan secara terhuyung-hayang
===13-08-26===
; UDP
: (nanti bukak rakaman)
; Kesalahan Lazim
: perkarangan > pekarangan
: persaraan > persaraan
: penglibatan > pelibatan
: perlaksanaan > pelaksanaan
: kepimpinan > kepemimpinan
: pesiaran (jalan) vs persiaran
: penghawa dingin > pendingin hawa
; BYBBYB
: bilik persalinan (salin baju) > bilik acu (cuba baju)
: temu janji > janji temu (janji dulu baru temu, hukum DM)
: sampin > samping
: ves > rompi?
; Perbendaharaan kata
: [[suria kanta]]: kanta pembesar
: [[tetunggul]]
:: 1. panji-panji, bendera
:: 2. warna-warna di kaki langit, aurora borealis
: [[gencana]]: bencana, godaan, gangguan yang bawa bahaya
: [[beterangan]]: kediaman, tempat tinggal, tempat bermalam, tempat berteduh, tempat perlindungan
; Puisi tradisional
: Gurindam
; Imbas Loghat Perak
: sepasei: sepakat sepadan
: sepicin: seminit, sekejap
: serogoh:
:: 1. menceroboh tanpa izin
:: 2. marah
: serokop: tekup dari atas
: setumbar:
:: 1. seketika
:: 2. air yang penuh
===27-08-2026===
; UDP
: menyongèh - banyak cakap, merungut
: berambu - berselerak, tak teratur
: cempere (Kuala), cemperè (P. Tengah), cempèra (baku) - nakal, suka buat kacau
: membongai - terpinga-pinga, tercengang-cengang
: kécah - pecah
: cerèpèk - cakap tak henti
; Kesalahan Lazim
: ianya > ia
:: ia dan -nya dua-dua kata ganti
: mereka-mereka > mereka
:: Dialek Perak: mereka - dème; teman, awok, aye - saya
: terpaling > ter- atau paling
:: Gen Z guna [[terpaling]] untuk gurauan, selain itu [[sumpah]]
; BYBBYB
: submit > serahkan
: meeting > mesyuarat
: MC > cuti sakit
: update > kemaskini
: follow up > susulan
: dateline > tarikh akhir
: briefing > taklimat
; Perbendaharaan Kata
* bahas lirik Di Ambang Wati - Wings
: gita - lagu, nyanyian, syair atau puisi dilagukan, pujian, sanjungan
: kama - cinta, asmara, rindu, keinginan, hasrat
: citra - keperibadian, imej, gambaran
: wati - wanita, angkasa, langit
; Peribahasa
: jangan bermain di air keruh - jangan tiru buatan yang buruk
: jangan fikir air pasang sahaja - jangan fikir nasib baik sahaja
: jangan dengar siul ular - jangan terpedaya dengan musuh
: jangan bangkit harimau yang tidur
: jangan ditentang matahari condong
: jangan ditegakkan benang yang basah
: jangan difikir yang dicubit segantang ???
===10-09-26===
; UDP
* dia duk sebut nama-nama tempat di Perak dalam Dialek Perak
: cangkat - tempat tinggi
; Segmen Tatabahasa
* kata baynak makna
: [[asal]] - mula, sebaik sahaja, pangkal
: [[mereka]] - KG3, merancang, mencipta
: [[kesan]] - tanda, sesuatu yg timbul, pengaruh yg timbul dari menyaksikan atau mendengar sesatu
; BYBBYB
* jenama yang sinonim sehingga terbawa-bawa
: [[Colgate]] > [[ubat gigi]]
: [[Maggi]] > [[mi]] [[segera]]
: [[Kodak]] > [[filem]] [[kamera]]
: [[Pampers]] > [[lampin]] [[pakai buang]]
: [[Tupperware]] > [[bekas]] [[makanan]] (Perak ''siã'')
; Perbendaharaan Kata
* bahas lirik Cindai - Siti Nurhaliza
: dil mas cdrny intan bbtl lgn - kehidupan yang mewah vs sederhana
: biduk lyrny krts prhu sbrg lwt brpi - prlmbgn mnusia yg srb lemah, yg prlu mnmpuh ujian yg bsr
; Peribahasa
* mengenai orang tua
*: (<code>mata sudah mula kabur, uban sudah mula berterabur</code>)
: tua2 tupai tak tidur ats tnh - org tua stiasa gembira hidupnya
: tua2 terung masam - org tua brprngai muda
: tua2 tlur ayam - tua sedikit shj, jurang usia yg kcil
: pinang tua merah ekor - prmpuan brumur brkelakuan gadis muda
: tua2 kelapa - smakin tua smakin baik prgai/ byk ilmu
: tua2 keladi - smakin tua smakin miang
: gayung tua - kata/keputusan dr org tua biasanya lebih tepat/brnas
==17-9-26==
; UDP
: [[monok]] - tubuh badan gemuk, bulat, padat, berisi, gempal
: [[morat]] ([[ngorat]]?) - punca suatu kejadian atau perkara, = [[pasei]]
: [[nabung]] - 1. prbuatan menaburkan ssuatu, 2. harapan yang kecewa
: [[nake ni]] (naka) - macam ini
: [[ngelejat]] - keadaan menggelatar, menggigil, menggelupur (sakit, terkena air panas)
; Tatabahasa
: Kata Bantu Aspek
:: Masa - cth [[sedang]], [[tengah]], [[akan]], [[belum]]
: Kata Bantu Ragam
:: Perasaan/keinginan - cth [[hendak]], [[perlu]], [[ingin]], [[enggan]]
: aspek + ragam boleh gabung - cth "Saya '''sedang''' '''hendak''' melintas jalan"
; BYBBYB
: [[merasa]] vs [[berasa]] (perasaan)
: [[oleh]] [[kerana]] > [[oleh]] [[sebab]]
: [[demi]] [[untuk]] > [[demi]] sahaja / [[untuk]] sahaja
: [[saling]] [[bantu-membantu]] > [[saling]] [[membantu]] / [[bantu-membantu]]
: [[antara]] [[langkah-langkah]] > [[antara]] [[langkah]]
: [[komisyen]] > [[komisen]]
; Perbendaharaan kata
: [[kamisani]] - kbjksnaan, akal budi, kcrdsn yg tggi
: [[rekayasa]] - penerapan unsur sains, kreativiti & perancangan rapi, menyusun semula utk mnghasilkn yg baru
: [[anjakan paradigma]] - perubahan besar/mendasar dalam brfikir, brtindak dalm ssusatu perkara
: [[mahakarya]] - karya agung, hasil seni terulung yang tiada tandingan
: [[saujana]] - sejauh mata memandang, ssuatu yg luas
; Peribahasa
: [[bagai air mencari jenis]] - usaha gigih untuk mjjki org yg berilmu
: umpama kersani di dalam buluh - ssorg yg baik, bakat terpendam, ilmu tinggi tapi tetap rendah diri
: umpama saujana mata memandang rona ... penyuluh jalan - gmbrn keindahan adab & kesantunan ssorg ... memberi kebaikan kpd orang sekeliling
: bak air dicincang tidak akan putus - kukuhnya pasak warisan ... tidak akan ditelan zaman cth adat, cara hidup, jalur talian ahli keluarga
; ILP
: [[tagan]] - 1. [[gundu]] 2. [[modal]], [[wang]] [[taruhan]]
: [[dékó]] - org bertuah
brhnhszhjf26vvl9dgeie74xxs7b3hv
كسل
0
145764
375307
2026-09-16T11:59:25Z
AKMAL HAKIM BIN MOHAMAD ZAMIN
11458
Mencipta laman baru dengan kandungan '==Bahasa {{bahasa|ms}}== ===Kata adjektif=== {{inti|ms|kata adjektif}} # ejaan tulisan bagi [[kesal]]'
375307
wikitext
text/x-wiki
==Bahasa {{bahasa|ms}}==
===Kata adjektif===
{{inti|ms|kata adjektif}}
# ejaan tulisan bagi [[kesal]]
h9ppd0ya55z5jaw3rz1h2v2o181fopj
كوتا
0
145765
375308
2026-09-16T12:02:02Z
AKMAL HAKIM BIN MOHAMAD ZAMIN
11458
Mencipta laman baru dengan kandungan '==Bahasa {{bahasa|ms}}== ===Kata Nama=== {{inti|ms|kata nama}} # ejaan tulisan bagi [[kota]]'
375308
wikitext
text/x-wiki
==Bahasa {{bahasa|ms}}==
===Kata Nama===
{{inti|ms|kata nama}}
# ejaan tulisan bagi [[kota]]
i06m8gzpojlxe1uvyuuoobf44y9spvs
جالا
0
145766
375309
2026-09-16T12:03:46Z
AKMAL HAKIM BIN MOHAMAD ZAMIN
11458
Mencipta laman baru dengan kandungan '==Bahasa {{bahasa|ms}}== ===Kata nama=== {{inti|ms|kata nama}} # ejaan tulisan bagi [[jala]]'
375309
wikitext
text/x-wiki
==Bahasa {{bahasa|ms}}==
===Kata nama===
{{inti|ms|kata nama}}
# ejaan tulisan bagi [[jala]]
cwqo3b34zl9h4nxwqz0ga06v8lbkjds
روسا
0
145767
375310
2026-09-16T12:07:44Z
AKMAL HAKIM BIN MOHAMAD ZAMIN
11458
Mencipta laman baru dengan kandungan '==Bahasa {{bahasa|ms}}== ===Kata nama=== {{inti|ms|kata nama}} # ejaan tulisan bagi [[rusa]]'
375310
wikitext
text/x-wiki
==Bahasa {{bahasa|ms}}==
===Kata nama===
{{inti|ms|kata nama}}
# ejaan tulisan bagi [[rusa]]
kzsksxfswqaepnhsvck1svnpt462i34
توڬو
0
145768
375311
2026-09-16T12:08:41Z
AKMAL HAKIM BIN MOHAMAD ZAMIN
11458
Mencipta laman baru dengan kandungan '==Bahasa {{bahasa|ms}}== ===Kata nama=== {{inti|ms|kata nama}} # ejaan tulisan bagi [[tugu]]'
375311
wikitext
text/x-wiki
==Bahasa {{bahasa|ms}}==
===Kata nama===
{{inti|ms|kata nama}}
# ejaan tulisan bagi [[tugu]]
jqhq686y1pb4kvc2ntdtg0bot4mryow
فيري
0
145769
375312
2026-09-16T12:10:10Z
AKMAL HAKIM BIN MOHAMAD ZAMIN
11458
Mencipta laman baru dengan kandungan '==Bahasa {{bahasa|ms}}== ===Kata nama=== {{inti|ms|kata nama}} # ejaan tulisan bagi [[feri]]'
375312
wikitext
text/x-wiki
==Bahasa {{bahasa|ms}}==
===Kata nama===
{{inti|ms|kata nama}}
# ejaan tulisan bagi [[feri]]
rao6z09t13cs8xh1llstel1mnbkmgiv
Wikikamus:bdr/beluang
4
145770
375313
2026-09-16T14:43:17Z
Sipatung
10839
Tambah ayat
375313
wikitext
text/x-wiki
==Bahasa {{bahasa|bdr}}==
===Kata nama===
{{inti|bdr|kata nama}}
# {{label|1=bdr|2=dialek|3=Sabah}} pintu {{cp|bdr|'''Beluang''' rumah teraat.|'''[[Pintu]]''' rumah rosak.}}
a81it32crank51tb9vavre14cn2r7wo
Modul:decorations
828
145771
375315
2026-09-17T05:19:32Z
Hakimi97
2668
Mencipta laman baru dengan kandungan 'local export = {} local labels_module = "Module:labels" local qualifier_module = "Module:qualifier" local references_module = "Module:references" local function track(page) require("Module:debug/track")("decorations/" .. page) return true end --[==[ This function is used by any module that wants to add support for adding decorations (i.e. left and right regular and accent qualifiers, labels and references, and potentially other types of decoration...'
375315
Scribunto
text/plain
local export = {}
local labels_module = "Module:labels"
local qualifier_module = "Module:qualifier"
local references_module = "Module:references"
local function track(page)
require("Module:debug/track")("decorations/" .. page)
return true
end
--[==[
This function is used by any module that wants to add support for adding decorations (i.e. left and right regular and
accent qualifiers, labels and references, and potentially other types of decorations in the future) to an item, where
an "item" is any string of text that might want to be decorated. It is currently used for:
# pronunciations and other pronunciation-related items, such as rhymes, hyphenations and homophones, as implemented in
[[Module:IPA]], [[Module:rhymes]], [[Module:hyphenation]], [[Module:homophones]] and various language-specific modules
such as [[Module:es-pronunc]];
# arbitrary links, as implemented in [[Module:links]];
# headwords, as implemented in [[Module:headword]];
# gender/number specs, as implemented in [[Module:gender and number]];
# *nyms of all sorts (e.g. synonyms, antonyms, hypernyms, hyponyms, coordinate terms, etc.) as implemented in
[[Module:nyms]];
# affixes of all sorts, as implemented in [[Module:affix]];
# affix usage examples, as implemented in [[Module:affixusex]];
# column templates as such as {{tl|col}} and {{tl|col3}}, as implemented in [[Module:columns]];
# names (surnames, given names, patronymics, etc.) as implemented in [[Module:names]];
# object-usage qualifiers such as {{tl|+obj}}, as implemented in [[Module:object usage]];
# various inflection templates such as {{tl|ar-conj}} in [[Module:ar-verb]];
# demonyms, as implemented in [[Module:demonym]];
and several other places.
Modules that implement templates that occur frequently on a page, such as [[Module:headword]] and [[Module:links]],
should consider checking that any decorations exist before loading the module. This is less necessary for other,
less-used templates, as this module is not very heavy and does appropriate checks itself to make sure that any
decorations are present before taking action.
`data` is a structure containing the following fields:
* `q`: List of left regular qualifiers, each a string.
* `qq`: List of right regular qualifiers, each a string.
* `qualifiers`: List of qualifiers, each a string, for compatibility. If `qualifiers_right` is given, these are
right qualifiers, otherwise left qualifiers. If both `qualifiers` and `q`/`qq` (depending on the value of
`qualifiers_right`) are non-{nil}, `qualifiers` is ignored.
* `qualifiers_right`: If specified, qualifiers in `qualifiers` are placed to the right, otherwise the left. See above.
* `a`: List of left accent qualifiers, each a string.
* `aa`: List of right accent qualifiers, each a string.
* `l`: List of left labels, each a string.
* `ll`: List of right labels, each a string.
* `refs`: {nil} or a list of references or reference specs to add directly after the text; the value of a list item
is either a string containing the reference text (typically a call to a citation template such as {{tl|cite-book}}, or
a template wrapping such a call), or an object with fields `text` (the reference text), `name` (the name of the
reference, as in {{cd|<nowiki><ref name="foo">...</ref></nowiki>}} or {{cd|<nowiki><ref name="foo" /></nowiki>}})
and/or `group` (the group of the reference, as in {{cd|<nowiki><ref name="foo" group="bar">...</ref></nowiki>}} or
{{cd|<nowiki><ref name="foo" group="bar"/></nowiki>}}); this uses a parser function to format the reference
appropriately and insert a footnote number that hyperlinks to the actual reference, located in the
{{cd|<nowiki><references /></nowiki>}} section.
* `lang`: Language object for accent qualifiers.
* `text`: The text to wrap with qualifiers.
*` raw`: Don't do any CSS wrapping of the formatted text.
The order of qualifiers and labels, on both the left and right, is (1) labels, (2) accent qualifiers, (3) regular
qualifiers. This goes in order of relative importance.
]==]
function export.format_decorations(data)
if not data.text then
error("Missing `data.text`; did you try to pass `text` or `qualifiers_right` as separate params?")
end
if not data.lang then
track("nolang")
end
local text = data.text
-- Format the qualifiers and labels that go either before or after the main text. They are ordered as follows, on
-- both the left and the right: (1) labels, (2) accent qualifiers, (3) regular qualifiers. This puts the different
-- types of qualifiers/labels in order of relative importance. Return nil if no qualifiers or labels, otherwise
-- a string containing all formatted qualifiers and labels surrounded by parens.
local function format_qualifier_like(labels, accent_qualifiers, qualifiers)
local has_qualifiers = qualifiers and qualifiers[1]
local has_accent_qualifiers = accent_qualifiers and accent_qualifiers[1]
local has_labels = labels and labels[1]
if not has_qualifiers and not has_accent_qualifiers and not has_labels then
return nil
end
local qualifier_like_parts = {}
local function ins(part)
table.insert(qualifier_like_parts, part)
end
local function format_label_like(labels, mode)
return require(labels_module).show_labels {
lang = data.lang,
labels = labels,
nocat = true,
mode = mode,
open = false,
close = false,
no_ib_content = true,
no_track_already_seen = true,
ok_to_destructively_modify = true, -- doesn't apply to `labels`
raw = data.raw,
}
end
local m_qualifier = require(qualifier_module)
if has_labels then
ins(format_label_like(labels))
end
if has_accent_qualifiers then
ins(format_label_like(accent_qualifiers, "accent"))
end
if has_qualifiers then
ins(m_qualifier.format_qualifiers {
qualifiers = qualifiers,
open = false,
close = false,
no_ib_content = true,
raw = data.raw,
})
end
local qualifier_inside
local function wrap_qualifier_css(txt, suffix)
if data.raw then
return txt
else
return m_qualifier.wrap_qualifier_css(txt, suffix)
end
end
if qualifier_like_parts[2] then
qualifier_inside = table.concat(qualifier_like_parts, wrap_qualifier_css(",", "comma") .. " ")
else
qualifier_inside = qualifier_like_parts[1]
end
qualifier_like_parts = {}
ins(wrap_qualifier_css("(", "brac"))
ins(wrap_qualifier_css(qualifier_inside, "content"))
ins(wrap_qualifier_css(")", "brac"))
return table.concat(qualifier_like_parts)
end
if data.refs then
text = text .. require(references_module).format_references(data.refs)
end
if data.qualifiers then
track("old-qualifiers")
end
local leftq = format_qualifier_like(data.l, data.a, data.q or not data.qualifiers_right and data.qualifiers)
local rightq = format_qualifier_like(data.ll, data.aa, data.qq or data.qualifiers_right and data.qualifiers)
if leftq then
text = leftq .. " " .. text
end
if rightq then
text = text .. " " .. rightq
end
return text
end
function export.format_qualifiers(data)
track("format_qualifiers")
return export.format_decorations(data)
end
return export
3v0hmoyx4yudfeugdokp2cgin02mqbu
Wikikamus:bdr/uba'
4
145772
375322
2026-09-17T08:24:04Z
Sipatung
10839
Tambah ayat
375322
wikitext
text/x-wiki
==Bahasa {{bahasa|bdr}}==
===Kata kerja===
{{inti|bdr|kata kerja}}
# {{label|1=bdr|2=dialek|3=Sabah}} tumbang {{cp|bdr|Poon kayu dembila ruma''' uba''''.|Pokok kayu sebelah rumah '''[[tumbang]]'''.}}
r9lnuuzk9hldgckawnv4bimydrjd863
Wikikamus:Bahasa Kimaragang
4
145773
375324
2026-09-17T08:44:45Z
Ultron90
4762
Mencipta laman baru dengan kandungan '{{Gerbang bahasa |bahasa=Kimaragang |kod=kqr |keterangan= }} __NOTOC__'
375324
wikitext
text/x-wiki
{{Gerbang bahasa
|bahasa=Kimaragang
|kod=kqr
|keterangan=
}}
__NOTOC__
cvojimke3z12p05oim103bicb7uf493
Wikikamus:kqr
4
145774
375325
2026-09-17T08:45:17Z
Ultron90
4762
Melencong ke [[Wikikamus:Bahasa Kimaragang]]
375325
wikitext
text/x-wiki
#Redirect [[Wt:Bahasa Kimaragang]]
ohuthku9pojy6yf2b5705k691pmg79b
Wikikamus:kqr/aal
4
145775
375326
2026-09-17T08:46:04Z
Ultron90
4762
Mencipta laman baru dengan kandungan '==Bahasa {{bahasa|kqr}}== ===Kata nama=== {{inti|kqr|kata nama}} # [[hal]] #: {{ux|kqr|Dotilo do '''aal''' ino. |Itu '''hal''' mereka.}}'
375326
wikitext
text/x-wiki
==Bahasa {{bahasa|kqr}}==
===Kata nama===
{{inti|kqr|kata nama}}
# [[hal]]
#: {{ux|kqr|Dotilo do '''aal''' ino.
|Itu '''hal''' mereka.}}
fohduij6ypkyswsysdsly737sc2babn
Wikikamus:bdr/pesading
4
145776
375328
2026-09-17T08:48:31Z
Sipatung
10839
Membuat terjemahan baru
375328
wikitext
text/x-wiki
==Bahasa {{bahasa|bdr}}==
===Kata kerja===
{{inti|bdr|kata kerja}}
# {{label|1=bdr|2=dialek|3=Sabah}} bersandar {{cp|bdr|Jomo too a '''pesading''' ta beluang rumah.|Orang tua itu '''[[bersandar]]''' pada pintu rumah.}}
izvaa2nntpmw8kp9nn10lluklcteovo