天天看點

php mbsubstr 亂碼,PHP使用mb_substr()解決中文字元串截取亂碼問題

PHP 自帶幾種字元串截取函數,其中常用到的就是 substr 和 mb_substr。前者在進行中文時,GBK 為 2 個長度機關,UTF 為 3 個長度機關,後者指定編碼後,一個中文即為 1 個長度機關。

mb_substr用法

string mb_substr( string$str, int$start[, int$length[, string$encoding]] );

mb_substr 執行一個多位元組安全的substr()操作基礎上的字元數。從str的開始位置計算。第一個字元的位置為0。第二個字元的位置是1,依此類推:

str 被截取的母字元串。

start開始位置。

length 傳回的字元串的最大長度,如果省略,則截取到str末尾。

encoding 參數為字元編碼。如果省略,則使用内部字元編碼。

那麼我們可以使用一下的代碼,來完成這個問題。

$mess=mb_substr($message,0,19,'gb2312');

gb2312就是中文的編碼格式。

mb_substr進行中英文混合字元串

substr 有時會截 1/3 個中文或半個中文,會顯示亂碼,相對來說 mb_substr 更适合我們使用。不過有時候 mb_substr 就顯得不那麼好用了。例如我要顯示一個小圖檔的簡要資訊,5 個中文正好,超過 5 個就截取前4再加上 “…”,這樣進行中文是沒問題了,可是處理英文或數字,這樣截取就太短了。使用下面這段函數則可以解決這個問題:

class Onens {

public static function g_substr($str, $len = 12, $dot = true) {

$i = 0;

$l = 0;

$c = 0;

$a = array();

while ($l < $len) {

$t = substr($str, $i, 1);

if (ord($t) >= 224) {

$c = 3;

$t = substr($str, $i, $c);

$l += 2;

} elseif (ord($t) >= 192) {

$c = 2;

$t = substr($str, $i, $c);

$l += 2;

} else {

$c = 1;

$l++;

}

// $t = substr($str, $i, $c);

$i += $c;

if ($l > $len) break;

$a[] = $t;

}

$re = implode('', $a);

if (substr($str, $i, 1) !== false) {

array_pop($a);

($c == 1) and array_pop($a);

$re = implode('', $a);

$dot and $re .= '...';

}

return $re;

}

}