Hiển thị các bài đăng có nhãn Tin tức Google. Hiển thị tất cả bài đăng
Hiển thị các bài đăng có nhãn Tin tức Google. Hiển thị tất cả bài đăng

Thứ Hai, 2 tháng 7, 2012

Google Penguin và mối bận tâm về SEO

Một thời gian sau khi Google Penguin ra đời, Google vui mừng vì thuật toán chống spam mới này đang hoàn thiện như dự định. Nhưng có một vài điều tổn hại do thuật toán này gây ra còn đang được cân nhắc cách khắc phục và vẫn còn những mối bận tâm về Negative SEO như một mối đe doạ. Matt Cutt, Trưởng nhóm Webspam của Google có đưa ra một số ý kiến trong một cuộc phỏng vấn như sau:

Penguin: "là một sự thành công"

Mục đích của bất kỳ lần cập nhật thuật toán là cải thiện kết quả tìm kiếm. Vậy, Penguin đã cải thiện như thế nào cho Google?

"Theo quan điểm của chúng tôi thì đây là một thành công" - Matt Cutt nói
Còn những kết quả bất thường thì sao?

Chắc chắn rằng ngay sau khi Peguin ra đời, người ta nhanh chóng dẫn ra các ví dụ về các kết quả dư thừa. Ví dụ như trang Viagra chính thức không được liệt kê trong khi những trang khác bị hack lại được liệt kê vào. Một trang website trống được liệt kê nhằm mục đích "kiếm tiền qua mạng" và có nhiều trang trống khác có thứ hạng cao. Các trang sao chép nội dung – Scamr sites thì được báo cáo là vượt thứ hạng so với những trang bị sao chép.
Vậy thì Penguin thành công như thế nào khi những loại trường hợp này xảy ra?

Matt Cutt nói rằng nhiều vấn đề đã có trước khi Penguin ra đời và những vấn đề này không phải do thuật toán chống spam mới này gây ra.

Thực tế, vấn đề của Viagra hiện giờ được xác định là vấn đề có trước khi Penguin ra đời. Do vậy, Penguin không gây ra vấn đề này.
Còn những khẳng định sai ở một số ít tình huống?

Những khẳng định sai trong trường hợp người ta thấy rằng trang của họ đã bị thuật toán Penguin đánh sai khi họ không làm spam?

Matt Cutt cho biết "Chúng tôi đã xem xét một vài tình huống cần điều tra thêm nhưng sự thay đổi này chưa có tác động như thuật toán Panda hay Florida"

Google cập nhật thuật toán Panda với mục đích loại bỏ những nội dung rác, nội dung copy, loại bỏ những website có thương hiệu kém vào năm ngoái. Thuật toán Florida là một cập nhật quan trọng của Google năm 2003 nhằm cải thiện chất lượng tìm kiếm.

Tôi đồng ý rằng cả hai thuật toán trên dường như có tác động tới nhiều trang hơn thuật toán Penguin. Tôi đưa ra quan điểm như vậy dựa trên việc theo dõi các phản ứng với tất cả các cập nhật này. Chắc chắn rằng không phải tất cả mọi người sẽ đồng ý với tôi. Điều này cũng như lời nhắc nhở thường xuyên rằng bất cứ trang nào bị rớt khỏi thứ hàng thì trang khác dành được thứ hạng. Các bạn ít khi nghe điều này từ những ai dành được thứ hạng.

Điểm mấu chốt ở đây là Google dường như tin rằng thuật toán Penguin thực sự tóm được những kẻ spam đúng theo ý định của Google.

Tại sao Spam vẫn "lọt lưới"

Chắc chắn khi tôi nhìn vào các báo cáo, tôi thường thấy spam là cốt lõi của nguyên nhân khiến ai đó bị rớt hạng. Nhưng nếu thuật toán Penguin có hiệu lực thì tại sao một vài trang rõ ràng spam vẫn lọt qua?

"Không có thuật toán nào là hoàn hảo cả. Khi chúng tôi muốn sự hoàn hảo, phương pháp thử nghiệm của chúng tôi là 'Làm những gì để có kết quả tốt hơn trước'" - Matt Cutt cho biết vậy.

Matt Cutt cũng giải thích rằng thuật toán Penguin được thiết kế hoàn toàn chính xác. Nó hoạt động chống lại các trang dính níu đến spam.Tuy một vài spam vẫn có thể lọt qua nhưng mặt tích cực của nó thì bạn lại có một số những khẳng định sai.
Bạn có thể khôi phục bằng cách nào?

Một trong số những khó khăn nhất với lần cập nhật này là nói cho mọi người biết cách khôi phục. Bất cứ trang nào nào bị Penguin đánh vào đều được tin là đang spam Google.

Trước kia, nếu bạn spam Google, người ta nói rằng bạn phải lưu khiếu nại bằng hình thức Reconsideration request. Tuy vậy, Google đã nói rõ rằng hình thức khiếu nại reconsideration request không giúp ích gì cho nhữn trang bị thuật toán Penguin đánh vào. Google cũng cho biết yêu cầu này sẽ tự khôi phục nếu họ xóa sạch spam.

Tuy nhiên, một trong những lý do chính tôi nhận thấy khi xem các trang bị thuật toán Penguin đánh vào có thể là do các trang này đang thực hiện các kết nối xấu. Mọi người đã sử dụng WordPress themes miễn phí (WordPress là một phần mềm mã nguồn mở miễn phí mà bất kỳ ai cũng có thể sử dụng để xây dựng một website hay blog) hoặc sử dụng các đường kết nối tương hỗ chất lượng kém, mua link hoặc tham gia vào các mạng kết nối như những mạng gần đây Google đang chống lại.

Vậy mọi người có thể tự thoát khỏi các mạng kết nối này như thế nào, nếu họ không có sự kiểm soát với các link này bây giờ?

"Có thể xóa sạch những link này" Matt Cutt nói như vậy đồng thời đưa ra đề nghị rằng mọi người nên xem xét lại hai video ông đã thực hiện về chủ đề này:

Xem clip: http://www.youtube.com/watch?v=ES01L4xjSXE
"Rút cục lại thì bạn hãy cố gắng giải quyết những gì bạn có thể làm được"

Hãy truy cập Penguin để cập nhật lại

Nếu bạn xóa sạch các thứ rồi thì bạn biết Penguin được cập nhật bằng cách nào? Một cách lý tưởng thì bạn sẽ xem lưu lượng từ phục hồi của Google để biết thời gian tới Penguin được cập nhật.

Điều này dẫn tới một điểm quan trọng khác. Đó là thuật toán Penguin cũng như Panda là một bộ lọc, đôi khi được làm mới. Thuật toán Penguin không hoạt động liên tục nhưng hơn thế nó được dùng để tag kiểu như spam ngoài phạm vi bộ lọc spam định kỳ của Google.

Có phải thuật toán Penguin là một sự trừng phạt rộng rãi các trang hoặc trang cụ thể nào đó giống như thuật toán Panda? Nhưng căn cứ vào việc Panda có ảnh hưởng rộng tới các trang thì tôi cho rằng giả định thuật toán Penguin cũng làm được như vậy là công bằng thôi.

Theo như Matt Cutt thì điều này có nghĩa là nếu một vài trang của trang web của bạn bị tưởng là giống Penguin, thì tất cả có thể cũng bị tưởng như vậy. Cũng như vậy, khôi phục nghĩa là xóa sạch spam. Nếu bạn đã xóa rồi và vẫn chưa khôi phục được thì cuối cùng bạn cần bắt đầu một trang mới.

Một bận tâm mới về SEO mang tính tiêu cực

Trước khi có thuật toán Penguin, buổi trò chuyện về "negative SEO" – SEO mang tính tiêu cục đều chưa đi đến đầu đến đũa. Kể từ sau đó, dường như nó càng tệ hơn. Tôi đã xem những website mà nghe có vẻ như ai đó đang bị nguy hiểm nghiêm trọng vì đối thủ cạnh tranh có thể hãm hại họ.

Cốt lõi những nỗi sợ hãi này dường như một loạt giả định hoàn hảo. Gần đây Google hướng tới một số mưu đồ kết nối. Điều này khiến một vài người mất lưu lượng. Google cũng đã gửi những cảnh báo về các trang có đường link “giả mạo” hoặc “bất thường”. Việc này đã tạo ra nhiều lo lắng hơn cho một số ai đó. Sau đó, Penguin Update xuất hiện và đánh các link này, khiến càng nhiều người mất lưu lượng vì họ bị thuật toán Penguin Update đánh vào hoặc là không còn hưởng lợi từ spam link đã bị quét.
Những thứ này tạo độ chín muồi để mọi người khẳng định rằng việc chỉ ra các link xấu ở một trang web có thể tổn hại nó. Nhưng như tôi đã viết trước đó thì mối bận tâm về SEO mang tính tiêu cực không còn mới. Các SEO mang tính tiêu cực đã có từ nhiều năm nay rồi. Dù vậy, chúng ta chưa nhận thấy nó là mối bận tâm lớn.

Google đã nói rằng không dễ dàng gì cho những kẻ khác gây hại một trang web và thực tế thì có vẻ chỉ là trường hợp hy hữu thôi. Nói cụ thể thì việc chỉ ra các link xấu ở một trang tốt có các dấu hiệu tốt giống như là đang cố gắng lây truyền bệnh dịch cho một cơ thể mà nó có kháng thể rồi. Những điều tốt đẹp có sức nặng hơn những điều xấu.

Matt Cutts nhấn mạnh lại rằng SEO mang tính tiêu cực này rất hiếm có. Ông cho biết “Chúng tôi đã nỗ lực làm việc rất nhiều để đảm bảo chắc chắn rằng một ai đó cũng không thể gây tổn thương tới người khác”

Đồng thời, Matt Cutts lưu ý những gì Google nói trước kia. Hầu hết 700.000 thông điệp Google gửi tới công chúng đầu năm nay không phải là về các mạng lưới link xấu. Một cách tình cờ thì các thông điệp này không được viết cùng một ngày. Hơn thế, nhiều trang có cả những hình thức phạt Algorithmic penalty (Hình thức phạt giống của thuật toán Panda) và Manual penalty (Phạt xem xét thủ công) có kèm theo chúng nhưng chưa bao giờ tiết lộ. Gần đây, Google đã quyết định mở ra những trang này.

Sau chiến dịch SEO mang tính tiêu cực là cảnh báo link

Chắc chắn, khi một thông điệp mới đưa ra, nó có thể dẫn tới trường hợp như của Dan Thies. Trang của anh ta bị một số nhằm vào để cố gắng phô trương các công việc SEO mang tính tiêu cực. Anh ta nhận được một cảnh báo link bất thường sau khi điều này xảy ra. Anh ta cũng bị rớt một vài thứ hạng. Đây phải chăng là bằng chứng các công việc của SEO mang tính tiêu cực?

Thies nói với tôi rằng thứ hạng anh ta mất có khả năng do những thay đổi mà bản thân anh ta tự tạo ra khi anh ta gỡ bỏ link qua tất cả các trang trên trang web của anh ta để quay trở về trang chủ của anh ấy. Sau khi phục hồi lại, anh ta nói với tôi là anh ấy đã dành lại được các thứ hạng của mình.

Anh ấy nói toàn bộ lưu lượng không tệ đi. Dường như nó không giống như những mối lo ngại rằng SEO mang tính tiêu cực là một đe dọa “tàng hình” vì nếu nó đã làm việc đủ để tag trang web của anh ta như một phần việc của Penguin Update thì đáng lẽ anh ấy bị rớt hạng khủng khiếp.

Còn cảnh báo link thì sao? Thies đã tin rằng cảnh báo link xuất hiện do nỗ lực của SEO mang tính tiêu cực. Quả là một điều đáng sợ. Anh ta cũng nói rằng anh ấy lưu 3 hình thức khiếu nại reconsideration request mà mỗi lần đều có thư phản hồi nói rằng không tìm thấy hoạt động spam nào. Có phải anh ấy bị đánh bởi một cảnh báo nhưng không có cái nào liên quan tới lệnh trừng phạt?

Tôi đã hỏi Matt Cutts về tình huống này nhưng ông từ chối bình luận về trường hợp cụ thể của Thies. Ông nói rằng thông thường thì một cảnh báo link là một thông báo trước về việc rớt thứ hạng. Nếu trang web cố định vấn đề rồi và thực hiện thao tác khiếu nại reconsideration request đủ nhanh thì có thể ngăn được khả năng rớt thứ hạng.

Giải tỏa một số những lo lắng

Tôi mong muốn chúng ta sẽ tiếp tục thảo luận về SEO mang tính tiêu cực này và tin chắc rằng nó cũng là mối bận tâm lớn cho bất cứ ai. Tôi đã tham gia một buổi thảo luận về Quyến sách SEO cũng rất đáng để đọc.

Khi việc mua link rẻ hơn bao giờ, chúng ta sẽ dễ thấy tại sao phải bận tâm, lo lắng. Những câu chuyện giả dụ như điều gì đã xảy ra với Thies hoặc người nhận được cảnh báo sau khi 24.000 link hiển thị được chỉ ra ở trang web của anh ta gây ra phiền toái.

Lại sau đó, người này đi cảnh báo sau khi rõ ràng là anh ta đã làm rớt thứ hạng bởi thuật toán Penguin. Các link SEO mang tính tiêu cực cũng thực sự gây ra sự rớt hạng này hay còn một cái gì đó nữa chăng? Nói theo cách phổ biến thì thật khó nói vì các trang thực sự thì lại không được cung cấp.

Phức tạp vấn đề hơn nữa, một vài người mà làm mất lưu lượng vì thuật toán Penguin có thể lại không phải là nạn nhân của lệnh trừng phạt. Hơn thế nữa, Google có thể đã ngừng cho phép một số link vượt qua độ tin cậy (pass credit) nếu những link này bị nghi là một phần của nỗ lực đẩy thứ hạng trang vi phạm điều luật SEO. Nếu các trang bị lệ thuộc nhiều vào các link giả mạo thì các trang này sẽ thấy rớt hạng chỉ vì độ tin cậy của link bị xuống cấp chứ không phải vì chúng phải chịu trừng phạt.

Tôi đã thấy rất nhiều người hiện giờ công khai mong ước cách “disvow – không chỉ ra các link ở website của họ. Google không có ý kiến gì về việc bổ sung thêm tính năng như vậy lúc này khi tôi hỏi về điều này. Chắc chắn tôi không chờ đợi nó bây giờ. Bạn cũng vậy thôi nếu bạn biết rằng bạn đã từng bị thuật toán Penguin đánh vào. Tôi sẽ làm những gì tôi có thể để xóa sạch các thứ đi.

Một đề nghị thú vị ngoài cuộc thảo luận về Quyển sách SEO là Google không nên trừng phạt các trang web vì chỉ ra các link xấu ở trong trang đó. Hãy bỏ qua các link này, đừng để các link này vượt qua độ tin cậy (pass credit). Đây là một đề nghị tuyệt vời nhằm xoa dịu mối lo lắng về SEO mang tính tiêu cực như tôi thường nói.

Source:sưu tầm từ các site dịch từ SearchEngineLand

Thứ Sáu, 18 tháng 5, 2012

Google huấn luyện bot thực hiện quét các đoạn mã JavaScript



Để cho ra kết quả tìm kiếm, Google hàng ngày hàng giờ phải rà quét từng ngóc ngách và cập nhật dữ liệu của các trang web trên thế giới. Họ thực hiện điều này bằng các chương trình có khả năng duyệt trang một cách tự động gọi là Web Crawler, Web spider hay bot. Tuy nhiên, trong quá khứ, đội quân bot này chịu chết khi gặp các nội dung tương tác được tải thông qua JavaScript, đặc biệt là trên các trang sử dụng Asynchronous JavaScript và XML (viết tắt là AJAX) cho phép người sử dụng truy xuất thông tin bổ sung mà không cần phải tải lại trang. Nhưng nay, theo lời của lập trình viên Alex Pankratov, tác giả chương trình Hamachi nổi tiếng, các bot của Google đã được huấn luyện để có thể xử lý như con người các nội dung này. Cách thức các bot này thực hiện là quét các đoạn mã JavaScript gặp phải để tìm các địa chỉ URL, đồng thời truy xuất các hàm JavaScript tương tự như cách chúng chạy mỗi khi người dùng nhấp vào đối tượng để kích hoạt. Bằng cách đó, Google có thể tìm kiếm được nhiều nội dung ẩn giấu trong các cơ sở dữ liệu cũng như các nguồn khác mà trước đó họ không thể tạo chỉ mục tìm kiếm. Điển hình là phần comment trên các trang mạng xã hội.

Trong quá khứ, Google đã từng đưa ra đề xuất để có thể tìm kiếm được các nội dung AJAX. Tuy nhiên, các đề xuất này đặt gánh nặng lên vai của các nhà phát triển web hơn là lên phía Google. Vì vậy, chúng không thu hút được sự ủng hộ từ phía các lập trình viên. Do đó, Google đã phải lên kế hoạch cải tiến các bot của mình. Và cuối cùng, vào cuối năm ngoái, Google đã tìm ra cách giải quyết vấn đề bằng cách huấn luyện bot của mình gửi các yêu cầu POST đến website trong một số trường hợp tùy thuộc vào nội dung JavaScript trên đó được viết như thế nào, thay vì chỉ sử dụng các yêu cầu GET để truy xuất nội dung như trước. Kết quả như chúng ta thấy, Google đã làm được thứ mà trước đó họ không thể.

Vậy phát kiến này sẽ ảnh hưởng thế nào đến chúng ta? Tác dụng cụ thể nhất có thể thấy đó là các comment và nội dung Facebook trước đây “mù” với Google thì thời gian tới các bạn sẽ có thể tìm kiếm chúng một cách dễ dàng hơn. Tương tự như vậy cho các hệ thống bình luận động (dynamic comment system) nói chung. Tất nhiên, kết quả tìm kiếm trên Google cũng sẽ chính xác, nhiều và phong phú hơn trước.

Nguồn: ArsTechnica

Google sẽ trở nên “thông minh” hơn gấp 1.000 lần so với trước đây

Để nắm vững hơn “ngôi vương” trên thị trường tìm kiếm, vốn đang bị cạnh tranh kịch liệt từ công cụ tìm kiếm Bing của Microsoft, Google vừa trình làng thêm tính năng mới cho công cụ tìm kiếm của mình, hứa hẹn sẽ giúp Google tìm kiếm “thông minh hơn gấp 1.000 lần”.
Google vừa trình làng thêm tính năng mới với tên gọi Knowledge Graph cho công cụ tìm kiếm của mình, xuất hiện đầu tiên với người dùng tại Mỹ trong vài ngày tới và dự kiến sẽ xuất hiện trên toàn cầu trong thời gian không lâu.

Cụ thể, tính năng mới này sẽ cung cấp những dữ liệu kèm theo trong một khung riêng biệt, bên cạnh các kết quả truy tìm kiếm như trước đây, cung cấp thêm thông tin chi tiết liên quan đến cụm từ tìm kiếm.

Chẳng hạn khi người dùng tìm kiếm tên của một danh nhân nào đó, Knowledge Graph sẽ hiển thị thêm thông tin liên quan đến nhân vật đó, như ngày sinh, ngày mất, trình độ học vấn, gia đình hay những công trình nghiên cứu, tác phẩm nổi bật…


Theo Jack Menzel, Giám đốc Quản lý sản phẩm Tìm kiếm của Google thì cơ sở dữ liệu mới của Google chứa thông tin của hơn 500 triệu đối tượng khác nhau, bao gồm con người, địa điểm và nhiều thứ khác. Qua đó có thể cung cấp thông tin chi tiết về nội dung tìm kiếm cho người dùng ngay trên trang kết quả tìm kiếm ngay cả khi người dùng không cần nhấn vào các kết quả tìm được.

Nói một cách khác, công nghệ mới của Google sẽ hiểu hơn cách mà người dùng nghĩ khi họ tiến hành tìm kiếm, rồi giúp người dùng phân biệt các kết quả tìm kiếm với nhau.

Chẳng hạn, khi tìm kiếm với từ khóa “Kings”, Google sẽ suy đoán rằng người dùng đang đề cập đến tên gọi của một đôi khúc côn cầu, một đội bóng rỗ hay một chương trình truyền hình… rồi tính năng Knowledge Graph sẽ liệt kê ra thành các nhóm riêng biệt trên từng hộp thoại riêng biệt, bên cạnh các kết quả tìm kiếm truyền thống.

Người dùng có thể chọn 1 trong những thông tin tìm kiếm do Knowledge Graph gợi ý để thu gọn kết quả tìm kiếm, giúp tìm được nội dung dễ dàng hơn.

Theo Menzel, trước khi tính năng Knowledge Graph được trang bị, Google đã “trang bị những kiến thức liên quan đến từ khóa tìm kiếm cho người dùng, mà chỉ đơn thuần đưa ra kết quả tìm kiếm dựa vào những từ khóa có xuất hiện trên nội dung của trang web. Nhưng giờ đây, với tính năng mới đã làm thay đổi hoàn toàn điều này.

“Chúng tôi muốn mang đến những thông tin chi tiết nhất để giúp bạn có được những thông tin cần thiết để giải quyết công việc của mình một cách nhanh chóng nhất. Chúng tôi muốn hướng dẫn bạn thông qua quá trình truy vấn, thay vì phải thông qua các kết quả tìm kiếm như trước đây”, Jack Menzel cho biết.

Tính năng mới của Google ưu tiên hàng đầu quyền lợi của người dùng

Một điều khiến không ít các nhà phát triển trang web cảm thấy lo ngại đó là với tính năng mới, liệu người dùng có còn truy cập vào các trang web liệt kê trên kết quả tìm kiếm hay không, hay với họ, những thông tin do Knowledge Graph cung cấp là quá đủ?


Thông tin tổng quát, các tác phẩm và những cá nhân liên quan đến nhân vật tìm kiếm sẽ được liệt kê, giúp người dùng có cái nhìn tổng quan nhất về từ khóa tìm kiếm

Menzel cũng đã trấn an các nhà phát triển website rằng điều này sẽ không xảy ra.

“Chúng tôi nhận thấy rằng bằng cách tạo ra một bản thông tin tóm tắt tốt hơn sẽ giúp người dùng nắm bắt được thông tin cần thiết một cách tổng thể và lôi kéo hộ đi sâu hơn để tìm kiếm. Điều này sẽ không làm họ rời xa những kết quả tìm kiếm truyền thống”, Menzel cho biết.

Tuy nhiên, Menzel cũng thừa nhận rằng trong một số trường hợp, thông tin được cung cấp bởi tính năng Knowledge Graph đã đủ làm hài lòng người dùng và họ không tiếp tục truy cập vào các trang web từ kết quả tìm kiếm. Dù vậy, Menzel cho rằng trong trường hợp này, hơn ai hết người dùng chính là những người được lợi nhất.

“Chúng tôi muôn hướng người dùng đến những thông tin liên quan nhất đến từ khóa mà họ tìm kiếm. Đôi khi chỉ là những thông tin tổng thể về từ khóa đó”, Menzel nói. “Và nhiệm vụ của Google là giúp họ giải quyết vấn đề một cách nhanh chóng và hiệu quả nhất có thể. Tuy nhiên, đôi khi nó lại làm ảnh hưởng đến quyền lợi của các nhà phát triển website, nhưng trên hết, người dùng vẫn là ưu tiên hàng đầu của chúng tôi”.

Cỗ máy tìm kiếm thông minh đầu tiên trên thế giới?

Thực tế, tính năng Knowledge Graph đã giúp cho công cụ tìm kiếm của Google trở nên thông minh và hiểu người dùng hơn, nhưng trên thực tế, đây không phải là công cụ tìm kiếm đầu tiên trên thế giới có khả năng “hiểu” người dùng.

Một trong những công cụ tìm kiếm nổi tiếng với khả năng “hiểu” và trả lời những câu hỏi của người dùng có thể kể đến Wolfram Alpha, công cụ tìm kiếm được ra mắt từ năm 2009.



Nhiều công ty khác cũng đã cố gắng để xây dựng những cỗ máy tìm kiếm đưa ra kết quả theo ngữ cảnh, trong đó có thể kể đến Powerset (đã được Microsoft mua lại từ năm 2008) và Cuil, nhưng tất cả đều đã thất bại.
Trước khi hoàn tất tính năng Knowledge Graph, bản thân Google cũng đã thử phát triển những tính năng và công nghệ mới để đáp ứng khả năng tìm kiếm theo ngữ cảnh.

Cụ thể, trong năm 2010, Google đã mua lại công ty công nghệ Metaweb, hãng đã sáng tạo ra nền tảng cơ sở dữ liệu Freebase, mà theo Menzel, là một trong những “ý tưởng quan trọng nhất” để tạo nên tính năng Knowledge Graph ngày hôm nay.

Bên cạnh đó, Google cũng đã phát triển dự án với tên gọi Squared, là dự án dùng để trích xuất dữ liệu có cấu trúc từ những trang web không có cấu trúc. Dự án này cũng đã góp phần để giúp Knowledge Graph trở nên hoàn thiện hơn.

Mặc dù thừa nhận Google vẫn còn tiếp tục phải làm nhiều hơn để hoàn thiện khả năng tìm kiếm của mình, tuy nhiên Menzel vẫn tự tin rằng với Knowledge Graph, khả năng tìm kiếm của Google đã trở nên “thông minh” hơn gấp 1.000 lần so với trước đây.

Google Penguin xử lý link ẩn trong nhiều blog WordPress


Vào ngày 24/12 tháng trước, Google đã cập nhật Google Penguin và đã có nhiều website bị tác động. Cập nhật đó đã làm cho rất nhiều webmaster trên thế giới cảm thấy bất ngờ và hoang mang. Những website bị tác động thường là những website có liên kết không bình thường (Unnatural Links). Tuy nhiên, trên www.workinghomeguide.com, Omri Shabat cũng đã có thêm một giải thích khác.

Nếu như bạn đang dùng WordPress, website của bạn được làm rất tốt và bạn luôn tránh những thủ thuật bị ngăn cấm bởi Google và bị tác động bởi Google Penguin mà đã tìm hiểu mãi vẫn không ra lý do thì bạn cũng nên tìm hiểu các plugins/themes mà mình sử dụng. Các plugins/themes này có thể vô tình làm bạn mắc phải các hình thức phạt của Google Penguin.

Omri đã tìm hiểu vấn đề này và không chỉ có một vài plugins, themes và các widgets có gắn các liên kết ẩn (Hidden Links) vào website của bạn. Nếu bạn đã từng xem Google Webmaster Guidelines thì chắc cũng từng biết đây là điều tối kỵ khi làm SEO trên Google.

Có rất nhiều người tạo ra plugins, themes và gắn liên kết ẩn vào website của bạn nhằm mục đích tăng lượng backlinks đến website của họ. Nhiều lần bản thân tôi cũng đã có dự tính code vài cái plugins WordPress để tăng backlinks bằng phương pháp này, tất nhiên là nếu tôi làm thì tôi sẽ không để ẩn mà là hiện default, các webmaster có thể tắt thông qua settings. Tuy nhiên, do quỹ thời gian hạn hẹp nên đến giờ vẫn chưa làm được plugins nào cả. Thôi quay trở lại vấn đề chính.

Các liên kết ẩn này là một trong những tiêu chí xử phạt mà Google Penguin sẽ kiểm tra cho mỗi lần cập nhật. Theo Omri Shabat thì sẽ có không ít các website mắc phải lỗi Google Penguin bởi chính các plugins, themes dạng này.

Dưới đây là một số plugins mà Omri Shabat đưa ra:

- YD Recent Posts Widget
- Easy Mashable Social Bar
- Custom Contact Forms
- vSlider
- Easy Popular Posts
- Highslide 4 WordPress reloaded
- Share Buttons by Lockerz / AddToAny
- All in One Webmaster
- Tweet-Retweet-Post 2.0
- Visitor Like/Dislike Post Rating
- Last Year Widget
- KnxDT Bookmarks
- AnupRaj Tell Friends
- Post videos and photo galleries
- Collapsing Categories
- RAX – Google Language Translator
- RAX – Twitter Share Tweet Button And Counter
- IGIT Follow Me After Post Button
- RO Social Bookmarks
- Kontera (very old report, seems they fixed that already)

Nếu website của bạn bị giảm thứ hạng và lượng truy cập vào khoảng thời điểm ngày 24/04/2012 vừa rồi và đang dùng WordPress thì cũng nên kiểm tra xem website của bạn có dùng các plugins trên không. Nếu có thì bạn nên tìm hiểu code và gỡ những dòng text links ẩn đó ra. Hoặc nếu như bạn không rành về lập trình để gỡ nó ra thì tốt nhất là bạn nên remove nó đi và dùng plugins nào khác tương tự thay thế.

Theo thông tin từ Omri Shabat thì các plugins này đã được remove khỏi hệ thống Plugins của WordPress. Tuy nhiên nếu như bạn đã từng cài trước khi chúng bị remove thì cũng cần quan tâm kiểm tra. Ngoài ra, Omri cũng khuyên bạn nên dùng TAC Plugins để kiểm tra themes mà bạn đang dùng. Mặc dù themes thì ít khi bị gắn các text links ẩn hơn so với plugins.

Mặc dù vậy, theo tôi thì ở trên chỉ là những plugins mà Omri Shabat đưa ra. Có thể vẫn còn rất nhiều plugins có tình trạng như thế, vì vậy tốt nhất bạn nên tự kiểm tra thêm để chắc chắn rằng website của bạn không chứa text links ẩn.

Ngoài ra, theo một vài nghiên cứu của riêng cá nhân tôi thì cho dù bạn không dùng WordPress nhưng cũng có một số trường hợp bạn vô tình bị mắc phải lỗi này của Google Penguin. Đó là trong một số trường hợp, website của bạn sử dụng các đoạn script slide hay scroll nội dung. Trước khi nội dung được show ra tự động bởi các script thì các nội dung chưa được show sẽ nằm ở dạng ẩn. Rất có khả năng Google Penguin sẽ hiểu nhầm là bạn đặt text links ẩn trong trường hợp này.

Đây là bài viết mình dịch và biên soạn lại từ bài Google Penguin Targeted Many WordPress Blogs With Hidden Links In Plugins/Themes của tác giả Omri Shabat trên workinghomeguide.com (Theo blog babywolfvn)

Google cải tiến hiển thị kết quả tìm kiếm trực tiếp?

Nhằm tiết kiệm thời gian cũng như tăng cường độ chính xác cho những thông tin người dùng tìm kiếm, Google đã bắt đầu thử nghiệm việc hiển thị kết quả trực tiếp ở góc phải giao diện.


Thông tin cho từ khóa “The England Football Team”

Google giải thích với mỗi câu hỏi khác nhau, công cụ này sẽ mang đến kết quả tìm kiếm thông tin khác nhau, thế nhưng ô tìm kiếm (box) Google thường hiển thị một lượng lớn kết quả tìm kiếm cho những câu hỏi dạng “tòa nhà cao nhất thế giới là gì?” cho đến thông tin diễn viên, nhân vật lịch sử và kết quả thể thao.

Trong số đó, Wikipedia là đường dẫn hiện diện nhiều nhất. Và không chỉ dừng lại ở đó, Google cũng như nhiều công cụ tìm kiếm khác thường hiển thị mọi loại dữ liệu liên quan đến câu hỏi của người dùng, mà hầu hết thường dư thừa và ít liên quan.

Do đó, Google bắt đầu thử nghiệm việc hiển thị đáp án mà công cụ này cho là chính xác nhất bên góc phải giao diện màn hình (bên cạnh danh sách đường dẫn thông thường) tại địa chỉ của Google Anh: Google.co.uk.

Bạn đọc có thể vào địa chỉ nói trên và tự tay thử nghiệm bằng những từ khóa như “England Football Team” (đội tuyển bóng đá quốc gia nam Anh), “The Beatles” hay “Burj Khalifa” (tên của tòa nhà cao nhất thế giới tại Dubai).

Google từ lâu đã luôn tìm cách để tối ưu hóa các vấn đề liên quan đến “dữ liệu cấu trúc” (structured data). Và một trong những nỗ lực này là Google Squared, công cụ tìm kiếm được thiết kế đặc biệt dành cho loại dữ liệu trên. Nhưng đây là vấn đề nan giải khi bản thân thế giới mạng là một nơi rất lộn xộn, có quá nhiều loại thông tin và dữ liệu để có thể hiển thị chỉ bằng văn bản, nhất là khi tổng hợp từ nhiều nguồn thông tin khác nhau.

Theo TTO

Thứ Năm, 10 tháng 5, 2012

Thuật toán mới của Google ảnh hưởng đến các website Việt Nam?

Đầu tháng, Google tuyên bố thay đổi mạnh mẽ ở thuật toán (Panda) nhằm trong sạch hóa danh sách kết quả tìm kiếm trả về, công bằng, có ích hơn với người sử dụng. Trong lần cập nhật này, các website sản xuất nội dung gốc được ưu tiên xuất hiện ở vị trí cao hơn trong danh sách tìm kiếm trả về. Ngược lại, các website nội dung thấp, đặc biệt là các website dạng “content farm”, tức là website sao chép nội dung từ các địa chỉ khác sẽ bị thẳng tay đẩy xuống dưới.

Matt Cutts, chuyên gia cấp cao của Google cho biết hãng đã mất gần một năm nghiên cứu trước khi đưa ra thuật toán mới, lần thay đổi này tác động đến khoảng 11,8% các truy vấn tìm kiếm. "Chúng tôi luôn cố gắng nâng cao vị trí của những website xứng đáng. Trang web nào chất lượng đáng được nhìn nhận ưu ái hơn so với những trang ‘ăn theo.’ Đó là những gì lần thay đổi thuật toán này nhắm đến."



Thực tế, theo nhiều nhận định thì thay đổi lần này của Google là tất yếu. Sau lần cập nhật thuật toán lớn Caffein năm 2009, các nội dung hời hợt, nội dung thấp dễ dàng xuất hiện trong top đầu kết quả tìm kiếm mà Google trả về, gây khó khăn cho người sử dụng. Tuy nhiên, sự thay đổi của Google vẫn đang gây ra nhiều tranh cãi, quan điểm xuất phát từ hai nhóm, những người hưởng lợi từ thuật toán của Google và những người bị thiệt. (lưu lượng truy cập từ Google chiếm một phần quan trọng trong tổng lưu lượng truy cập vào một website).

Bước đầu đã có các tác động đến các website Việt Nam

Sau một thời gian áp dụng, phía cộng đồng người làm SEO tại Việt Nam cũng bắt đầu nhận thấy sự ảnh hưởng của thuật toán mới. Ông Nguyễn Văn Tuấn, trưởng bộ phận Thương mại điện tử công ty VCCorp cho biết: “Thuật toán mới của Google có vẻ đang tác động ít nhiều đến hệ thống các website Việt Nam. Các nhóm từ khóa “hot” về nhà đất như bat dong san, mua ban nha dat, bất động sản... cho thấy sự dịch chuyển về thứ hạng các website trong danh sách tìm kiếm trả về.”

Anh Duy Nhân, quản trị Câu lạc bộ Webmaster Việt Nam cũng cho biết: “Cộng đồng SEO trong nước gần đây ghi nhận không ít trường hợp bị tụt thứ hạng website ở một hoặc nhiều từ khóa.” Trên diễn đàn thegioiseo, ddth... cũng có thể thấy nhiều trường hợp thành viên kêu ca bị rớt hạng từ khóa, mất lưu lượng truy cập (traffic) sau khi Google mạnh tay cải tổ công cụ tìm kiếm.

Ngược lại, một số ý kiến khác lại hoanh nghênh, cho rằng chính sách của Google đang tác động tích cực đến hiệu quả làm SEO của mình. Ví dụ trường hợp của GOMM, công ty này (có trụ sở tại TP Hồ Chí Minh) cho biết nhiều website đang được họ xây dựng và quản trị đã tăng đột biến lượng truy cập trong thời gian qua, có những site trung bình khoảng 10.000 visit/ ngày nay đã tới 19.000 visit/ ngày.

Ông Nguyễn Văn Tuấn cũng khẳng định: “Một vài website trong hệ thống Thương mại điện tử của VCCorp, như rongbay.com cũng nhận thấy visit có được từ Google thể hiện dấu hiệu tăng trưởng, theo kinh nghiệm của tôi thì nguyên nhân phần nhiều ở sự thay đổi thuật toán”.

Như vậy, có thể thấy sự lần cập nhật thuật toán mới của Google sau một thời gian ngắn đã gây ra các tác động đến hệ thống website trong nước. Tuy nhiên, điều khiến nhiều người quan tâm là số phận các website dạng "content farm" tại Việt Nam thì ở thời điểm này vẫn khó có thể đánh giác chính xác.

Ở Việt Nam, website dạng này không hiếm và một trong số đó còn đạt được thứ hạng rất cao ở nhiều từ khóa. Lý giải hợp lý theo ông Tuấn vì Google chưa áp dụng triệt để chính sách mới ở các thị trường nhỏ, cần thêm thời gian nữa để chúng ta chứng kiến sự “trừng phạt” với các content farm tại Việt Nam. Trên thế giới, thời gian qua, nhiều website lớn dạng này đã tụt hạng thê thảm, điển hình như Suite101.com (traffic từ từ Google giảm 94%).

Giới làm SEO “mũ trắng” hưởng ứng thuật toán mới

Chiến dịch cải tổ lần này của Google nhằm tuyên chiến với vấn nạn sao chép nội dung và xây dựng website nội dung thấp. Số lượng website “rác” dạng này trong vài năm qua sản sinh ra quá nhiều và không ít trong số chúng chen được lên vị trí cao trong danh sách kết quả tìm kiếm trả về. Ghi nhận trên nhiều diễn đàn, chính người dùng Việt Nam thời gian gần đây cũng đang tỏ ra khá khó chịu khi truy cập nhầm các website “rác” dạng này (xin không nêu tên cụ thể).

Nội dung luôn là một trong các yếu tố hàng đầu quyết định hiệu quả SEO (Content is King) nhưng khác với quan điểm trước đây (site càng nhiều nội dung càng tốt), Google giờ đã đẩy mạnh cả đánh giá về chất lượng. Bạn khó mà qua mặt được hệ thống xếp hạng nếu website có lượng nội dung dày đặc nhưng giá trị hời hợt và chủ yếu đi sao chép từ nhiều nơi.


Một bộ phận người xây dựng site dạng content farm, nội dung thấp, sử dụng các thủ thuật SEO để câu traffic từ Google không sớm hay muộn cũng sẽ chịu “hình phạt”. Ngược lại, nhưng người làm SEO "mũ trắng", tuân thủ đúng các quy tắc “chơi đẹp” từ Google và chú trọng đến việc sản xuất nội dung gần thì tiếp tục gặt hái thành công.

Một điểm chưa được làm rõ trong thông tin mà Google cung cấp là định nghĩa chính xác về website “nội dung thấp”. Ngoài ra, “Tần xuất index dữ liệu của Google đối với các site khác nhau là khác nhau, vậy đâu có thể chắc chắn được website nào sao chép nội dung, website nào tự sản xuất?” - nhiều người dùng thắc mắc. Tuy nhiên, theo ông Tuấn và nhiều chuyên gia khác thì: “Google không thiếu các công cụ và chỉ số để đánh giá đâu là website thấp, website copy nội dung. Google hiểu hơn ai hết điều này và chắc chắn phải có phương án công bằng trước khi áp dụng.” Bên cạnh đó, việc kêu gọi phản hồi trực tiếp từ người dùng cũng là một kênh tham khảo giá trị.

Chính vì vậy, những người hoạt động chân chính trong ngành SEO Việt Nam đa phần đều cho rằng sự thay đổi thuật toán của Google là cần thiết và đáng hoan nghênh.

“Ở vai trò một người xây dựng website theo khuynh hướng mang lại cái lợi cho người dùng, tôi và các bạn hoan nghênh những thay đổi của Google nhằm làm môi trường tìm kiếm được trong sạch hơn, bớt "rác" hơn đồng thời mang đến cho việc SEO những thách thức mới đòi hỏi người làm SEO phải sử dụng cái đầu nhiều hơn, cập nhật thông tin liên tục hơn.” - Anh Duy Nhân chia sẻ.

Công bằng hơn trong đánh giá thứ hạng website, kết quả trả về phản ảnh đúng nỗ lực xây dựng nội dung và chiến lược SEO thông minh. Hưởng lợi từ thuật toán mới của Google ngoài giới SEO “mũ trắng” còn là chính những người dùng cuối. Vì thế, hơn lúc nào hết, Google đang cho thấy nỗ lực củng cố vị trí số một về tìm kiếm của mình trong mắt người dùng internet.

Theo Genk

Bing đơn giản hóa để cạnh tranh với Google

Thay vì cạnh tranh bằng chèn nhiều tính năng hơn các trang kết quả tìm kiếm của Google như trước đây. Bộ máy tìm kiếm của Bing sẽ phát triển theo hướng ngược lại là đơn giản hóa giao diện và tạo sự liền mạch trong những nội dung search.

Kết quả của việc cải thiện đó là khá tốt. Microsoft đã cải tiến được giao diện một cách gọn gàng hơn. Phía trái và phải của các kết quả tìm kiếm được giản lược tối đa tạo sự thoáng đãng cho giao diện. Thông tin chính là các kết quả search được thể hiện rất gọn gàng và sạch sẽ tạo được khác biệt đối với một trang có thể nói là quá tải thông tin như của Google hiện nay.



Trang kết quả tìm kiếm mới của bing, phần tính năng bên trái đã được cắt bỏ khác biệt hơn so với Google

Đơn giản là từ ngữ khá mới mẻ trong tù điển các sản phẩm gần đây của Microsoft. Microsoft đã dần nhận ra rằng sự đơn giản là chìa khóa mang đến thành công trong thế giới công nghệ hiện nay. Những ví dụ điển hình có thể kể đến như giao diện iOS của Apple khi cắt giảm sự rườm rà để đơn giản hóa. Giao diện Metro của Microsoft là bước tiến lớn của hãng trong việc áp dụng triết lý đơn giản trong thiết kế, đó dường như cũng sẽ là những gì Microsoft muốn thể hiện trong tương lai.


Home page của Bing luôn tạo được vẻ tươi mới cho người dùng mỗi ngày

Trên thực tế động thái đơn giản hóa của Bing đã được Microsoft triển khai khi đổi tên dịch của tìm kiếm của mình từ Microsoft Live Search sang Bing. Logo mới có đã tạo được sự nhận diện lớn trong suy nghĩ của người tiêu dùng phổ thông. Bên cạnh đó việc thay đổi trang Home của Bing là một đặc điểm nhận diện lớn so với trang Home trắng truyền thống của Google, nó mang lại vẻ đẹp và mới lạ mỗi ngày cho người dùng Bing.

Theo Genk (Tham khảo Venturebeat)

Cách google kiếm 30 triệu USD mỗi năm từ Việt Nam

Mở rộng đối tác phân phối Google Apps, xúc tiến hoạt động thương mại điện tử, dự định mở văn phòng tại Việt Nam…, các hoạt động gần đây cho thấy Google đang để tâm hơn để thị trường Việt Nam.

Nhiều kế hoạch tại Việt Nam

Trong buổi họp mặt các đối tác khu vực Đông Nam Á diễn ra tháng 6/2011, một đại diện của Google đã bày tỏ kỳ vọng thị trường Việt Nam sẽ đem lại doanh số 30 triệu USD/năm cho Google. Thời gian gần đây, có nhiều động thái cho thấy Google đang từng bước thực hiện dự định này, nhất là trong mảng các dịch vụ nhắm đến khách hàng là các doanh nghiệp vừa và nhỏ Việt Nam.

Cuối tháng 4/2012 tại Hà Nội, bà Ann Lavin, Giám đốc bộ phận Chính sách, khu vực Đông Nam Á của Google cho biết thông tin về chương trình hỗ trợ doanh nghiệp vừa và nhỏ trong khu vực, đặc biệt là việc Thái Lan tiếp cận thương mại điện tử (TMĐT), đẩy mạnh giao dịch trực tuyến và bày tỏ ý muốn triển khai chương trình tương tự ở Việt Nam.

Trước đó, ông Mike Orgill, phụ trách về chính sách công và hợp tác chính phủ khu vực Đông Nam Á của Google đã làm việc với đại diện Hiệp hội TMĐT Việt Nam (VECOM), cho biết mong muốn hợp tác trong lĩnh vực TMĐT, thúc đẩy hoạt động kinh doanh trực tuyến của các hội viên Hiệp hội. Ông Nguyễn Thanh Hưng, Tổng thư ký VECOM cho biết sẽ tiếp tục làm việc với Google để lên kế hoạch hợp tác cụ thể.
Đối với mảng quảng cáo Adwords vốn khá phổ biến ở Việt Nam, Google hiện có tới 9 đối tác trong nước. Đồng thời Google cũng đang cung cấp dịch vụ Google Apps (bộ ứng dụng đám mây dành cho doanh nghiệp) thông qua đối tác bản địa Gimasys. Qua đối tác, Google cũng cung cấp ứng dụng Google Search Appliance (tìm kiếm trong nội bộ doanh nghiệp), các dịch vụ tư vấn, bản quyền phần mềm, triển khai và hỗ trợ sau bán hàng đối với các sản phẩm/dịch vụ liên quan cho toàn bộ doanh nghiệp và tổ chức tại Việt Nam.

Một đại lý ủy quyền của Google cho PC World Vietnam biết, Google có dự định mở văn phòng đại diện tại Việt Nam để hỗ trợ các hoạt động tại bản địa và đang bàn thảo với cơ quan chức năng về việc này.

Ảnh hưởng đến 'bát cơm' của phần mềm nội?

Theo nhận định của một số công ty phần mềm nội, Google có thế mạnh là một nhà cung cấp dịch vụ trên nền tảng điện toán đám mây, đã có kinh nghiệm, có thương hiệu nên có thể dễ dàng tạo được sự chú ý của người dùng.

Trên trang web chính thức, hãng này công bố, trung bình mỗi ngày hàng nghìn doanh nghiệp trên thế giới đăng ký sử dụng dịch vụ Google Apps. Con số do giám đốc vùng Đông Nam Á bộ phận Google Enterprise cung cấp là khoảng 5-7 nghìn. Hiện tại, trên toàn cầu, có hơn 4 triệu doanh nghiệp đang là khách hàng của hãng.

Google Apps là một bộ ứng dụng điện toán đám mây (cloud-based) gồm các công cụ: truyền tin (email mang tên miền của doanh nghiệp; nhắn tin nhanh gồm chat, voice chat và video chat), cộng tác (chia sẻ lịch làm việc; làm việc trên cùng một tài liệu; chia sẻ tài liệu; làm việc theo nhóm/dự án).

Theo giới thiệu, với các dịch vụ này, doanh nghiệp có thể tập trung nguồn nhân lực CNTT cho mảng kinh doanh chính. Các hoạt động trao đổi thông tin trong nội bộ doanh nghiệp được thông suốt giúp nâng cao hiệu suất làm việc, thúc đẩy cộng tác.

Trong khi đó, ứng dụng Google Search Appliance có thể được dùng trong doanh nghiệp để tối ưu hóa việc sắp xếp và tìm kiếm thông tin. Theo Google, các doanh nghiệp như ngân hàng, bảo hiểm, viễn thông, thương mại điện tử... có thể gia tăng hiệu suất làm việc cũng như gia tăng giá trị dịch vụ khi ứng dụng dịch vụ này.

Chưa rõ các doanh nghiệp trong nước sẽ khai thác các dịch vụ của Google đến đâu để tăng hiệu quả kinh doanh, nhưng với các công ty phần mềm nội, rất có thể thị phần sẽ bị co lại.

Không chỉ Google, thời gian gần đây, nhiều hãng phần mềm nước ngoài đều đang có ý định “tấn công” vào thị trường Việt Nam. Từ cuối năm 2011 đến nay, rất nhiều đoàn doanh nghiệp phần mềm của nước ngoài từ Pháp, Nhật Bản, Ấn Độ, Thái Lan và Hàn Quốc... đã có các hoạt động xúc tiến thương mại, tìm đối tác phân phối và triển khai tại Việt Nam.

Với trường hợp của Google, ông Trịnh Hồng Chương, Giám đốc điều hành, Công ty phần mềm iBoss cho rằng Google có quy mô và tên tuổi quá lớn. Điều này một mặt sẽ mang lại cơ hội sử dụng các phần mềm/ứng dụng có chất lượng cao và chuyên nghiệp cho các doanh nghiệp trong nước, mặt khác, sẽ là một khó khăn cho các công ty phần mềm như iBoss khi cạnh tranh về chất lượng cũng như quy mô sản phẩm.

Tuy nhiên, ông Chương cũng nhận định, sản phẩm của Google hay các hãng phần mềm khác - không thể đáp ứng tất cả các nhu cầu của doanh nghiệp. Nhất là các yêu cầu riêng mang tính đặc thù. Đây là phân khúc thị phần phát triển mới có tính chất bổ trợ (add on), nhu cầu này cũng không hề nhỏ. Ngoài ra, các dịch vụ khác như tư vấn, chuyển giao... cũng rất cần khi triển khai ứng dụng các phần mềm nói trên.

Đây có lẽ sẽ là hướng đi mới cho các công ty phần mềm nội trước sự xâm nhập của các sản phẩm ngoại.


Theo pcworld vietnam

Yếu tố tạo nên một Google vĩ đại và đứng đầu thế giới về công nghệ.


Tích cực đấu tranh vì một Internet miễn phí, dành 1 tỉ USD nghiên cứu năng lượng thay thế, mọi dịch vụ Google đều gần như miễn phí đó là 3 trong số 9 yếu tố tạo nên một Google vĩ đại và đứng đầu thế giới về công nghệ.

Google Search tuyệt vời
Điều khiến người dùng cảm thấy Google Search có ích và tinh tế chính là nó có thể “hiểu” và đưa ra lời đề nghị cho những cụm từ khóa sai chính tả. Ví dụ, gõ “bsuinesdfsinsidsr apple earninsg”, Google Search sẽ hỏi lại ý người dùng có phải là “business insider Apple earnings” hay không.
Ngoài những điều nhỏ nhặt thú vị này, bản thân công cụ tìm kiếm của Google cũng rất đáng kinh ngạc. Hầu như chúng ta đều có thể tìm kiếm được những gì mình muốn.

Google Maps còn tuyệt hơn
Nếu có thể “kết hôn” với Google Maps, chúng ta cũng sẽ làm. Chúng vô cùng hoàn hảo và chính xác.
Xe hơi tự lái
Xe hơi tự lái có thể không phải là nhiệm vụ trọng tâm của Google song điều tuyệt vời ở đây là Google đang cố gắng tạo ra công nghệ mới, hữu ích và đáng kinh ngạc, có thể cứu sống nhiều người và thực sự thay đổi thế giới.

“Google Glass”
Một dự án mới mẻ nhưng không kém phần được ngưỡng mộ là Google Glass. Chúng ta có thể giả định kính mắt Google sẽ thất bại, tốn thời gian, lãng phí nguồn lực nhưng không thể không thừa nhận ý tưởng này quá thú vị. Google luôn mơ lớn và nắm lấy mọi cơ hội.

Android
Dù Android còn lâu mới đạt tới sự hoàn hảo, ý tưởng phía sau nó – tạo ra hệ điều hành ưu tú và phân phối rộng rãi – là điều đáng hoan nghênh.

Mọi dịch vụ Google đều gần như miễn phí
Những người phản đối Google có thể bĩu môi “của rẻ là của ôi”. Song thực tế không thể phủ định là Google đã tìm ra con đường mang tới vài trong số những dịch vụ tốt nhất thế giới miễn phí và không thể rẻ hơn.

Google sản sinh ra vô số doanh nhân
Một số cựu nhân viên Google nổi tiếng có thể kể tới như: Evan Williams (công ty của anh tạo ra các trang web nổi tiếng như Blogger, Pyra Labs, Twitter), Biz Stone (đồng sáng lập kiêm Giám đốc sáng tạo Twitter), Kevin Systrom (đồng sáng lập Instagram), Dennis Crowley (đồng sáng lập mạng xã hội Dodgeball và Foursquare), Sheryl Sandberg (Giám đốc điều hành kinh doanh Facebook, cánh tay phải của Mark Zuckerberg), Tim Armstrong (Tổng giám đốc kiêm Chủ tịch AOL), Dick Costolo (Tổng giám đốc Twitter)...
Ngoài ra, còn nhiều cựu nhân viên Google trở thành những “nhà đầu tư thiên thần” như giúp đỡ ngày càng nhiều các doanh nghiệp mới thành lập và những câu chuyện doanh nhân thành công.

Google định ra tiêu chuẩn cho các doanh nghiệp mới thành lập
Mọi công ty lớn đều cung cấp đò ăn miễn phí và một số đặc quyền cho nhân viên. Tuy nhiên, không công ty nào từ các công ty công nghệ thiết kế web đến các nhà bán lẽ nổi tiếng vẫn không hơn được Google về khoản này.

Google dành 1 tỉ USD nghiên cứu năng lượng thay thế
Google đang tìm cách biến việc sử dụng năng lượng mặt trời và năng lượng gió trở nên khả thi. Dù không phải ngành kinh doanh cốt lõi của Google, ý tưởng này có ý nghĩa với bất cứ ai trên hành tinh.

Google tích cực đấu tranh vì một Internet miễn phí
Tại Mỹ, Google đã dành nhiều nỗ lực, vận động hành lang để Internet có thể cởi mở và miễn phí như bây giờ.
Du LamTheo SAI

Thứ Năm, 3 tháng 5, 2012

Google và Thuật toán chim cánh cụt

Vừa rồi, trên website SearchEngineLand.com có cập nhật bài viết với tiêu đề The Penguin Update: Google’s Webspam Algorithm Gets Official Name. Như vậy, thuật toán mới năm nay dành cho việc chống các webspam đã được Google đặt tên và lấy tên một con vật mới là chim cánh cụt Google Penguin. Có vẻ thuật toán này mang tính bao quát hơn về các tiêu chí webspam so với chú gấu trúc Google Panda là đánh vào các nội dung farm, theo tiêu chí ban đầu mà Google đưa ra.

Thuật toán này cập nhật những gì?

Theo bài viết gốc mà mình có dẫn link ở trên thì nếu như bạn không quen thuộc với các dạng cập nhật này, Danny Sullivan khuyên bạn nên đọc bài Why Google Panda Is More A Ranking Factor Than Algorithm Update (tại sao Google Panda có vẻ như là một tiêu chí hơn là một thuật toán) gửi hồi năm trước. Bài viết đó giải thích cho việc sử dụng những thuật toán khác nhau để sắp xếp thứ hạng các trang web.
Nói tóm lại, đây là những cập nhật mang tính định kỳ. Năm trước khi Google Panda ra đời và viêc không tìm hiểu kỹ những cập nhật này đã khiến cho nhiều bạn nhầm lẫn về hoạt động của nó.
Tôi đã từng giải thích rằng Google Panda chỉ hoạt động mang tính định kỳ và cập nhật vào một thời điểm nào đó, thường thì tôi quan sát là hay rơi vào ngày thứ 6 (không phải ngày thứ 6 nào cũng vậy). Tóm lại là nó không phải chạy liên tục như các tiêu chí khác khi Google tiến hành quá trình Index mà là chỉ thỉnh thoảng mới được cập nhật.
Việc hiểu rõ cách hoạt động của những cập nhật này sẽ giúp cho bạn dễ dàng phân biệt được hơn website của bạn bị rớt hạng là do Google Panda hay do những tiêu chí khác, và bây giờ là Google Penguin. Một phần cũng bởi vì khi tôi tham gia các diễn đàn thì cứ hễ website bị rớt hạng các webmaster thường hay đổ lỗi cho Google Panda mặc dù nó chưa được cập nhật.
Đối với những cập nhật này thì có lúc có nhiều thay đổi và biến động lớn, có lúc rất khó để nhận ra.

Ai đặt tên cho những cập nhật này?

Google cũng định kỳ tạo ra những thuật toán mới. Với những thuật toán mới này Google đều gán cho nó một cái tên cho dễ nhớ, ví dụ như cập nhật thuật toán Vince vào năm 2009. Cũng có những lúc Google không đặt tên và các webmaster cũng tự động đặt tên cho nó, điển hình là trên trang cộng đồng Webmaster đặt tên với thuật toán là Mayday update vào năm 2010.
Cũng giống như Google Panda, ngay khi thuật toán vừa ra đời cũng không có tên mà sau khi triển khai vận hành rồi thì mới đặt tên cho nó. Như cách đây vài ngày vẫn chưa có tên Google Penguin mà chỉ nói về tác động của thuật toán.
Đầu năm 2011, khi thuật toán Google Panda được cập nhật lần đầu tiên. Google không nói tên gọi của nó mà chỉ sử dụng tên gọi đó trong nội bộ Google. Danny Sullivan biết tên gọi này nhưng vì bảo mật thông tin và không nói ra. Ông đã tự đặt cho nó một cái tên là Farmer, một phần là bởi vì thuật toán này đánh vào các nội dung kém chất lượng được tạo ra cho mục đích đẩy thứ hạng từ khóa trên trang kết quả tìm kiếm.
Tuy nhiên, trong quá trình phát triển thuật toán, Google không muốn thuật toán này chỉ đánh vào các website kém chất lượng được tạo ra nhằm mục đích đẩy thứ hạng cho website chính nào đó. Mà là đánh vào tất cả các nội dung kém chất lượng khác nên lấy tên là Google Panda cho dễ phân biệt.

Lời chào đến chú chim cánh cụt Google Penguin

Từ Google Panda, Google đã tránh không đặt tên cho các thuật toán. Như hồi tháng 01 vừa rồi, Google cập nhật thuật toán xử phạt các website đặt quá nhiều quảng cáo và đặt tên là “page layout algorithm“. Khi mà Penguin được cập nhật đầu tuần này, nó được gọi là “webspam algorithm update”.
Bởi vì Google không đặt tên cho thuật toán này, nên các chuyên gia đã làm cuộc bình chọn cho việc đặt tên trên Google+ và Facebook, và cái tên cuối cùng được chọn là Titanic. Và vì thế nên có lẽ Google muốn tự đặt tên cho sản phẩm của mình nên đã ra xác nhận đặt tên cho thuật toán này là Google Penguin.

(Nguồn : babywolfvn.com )

Thứ Tư, 2 tháng 5, 2012

Google cập nhật Google Panda 3.5

Google vừa cho ra thuật toán mới để chống tình trạng SPAM trên trang kết quả tìm kiếm. Theo thông tin từ Matt Cutts nói với Danny Sullivan thì Google cập nhật Google Panda 3.5 vào khoảng ngày 19/04/2012, tức thứ 5 tuần trước theo giờ US, tương đương với khoảng ngày thứ 6 theo giờ Việt Nam. Đây cũng có khả năng là môt lý do khác cho sự biến động của Google mà mình có blog ngày 20/04/2012.
Trong lần cập nhật Google Panda này đã có rất nhiều website lớn bị ảnh hưởng thứ hạng tìm kiếm. Các bạn xem qua hai hình dưới đây để thấy sự biến động này.

Những website được tăng thứ hạng

Đa phần những website này là các thương hiệu lớn và những website tin tức.
Những website tăng lượng truy cập với Google Panda 3.5
Những website tăng lượng truy cập với Google Panda 3.5

Những website rớt hạng

Những website bị rớt hạng với Google Panda 3.5
Những website bị rớt hạng với Google Panda 3.5
Theo thông tin tóm tắt của Searchmetrics thì những website bị rớt hạng rơi vào những dạng sau:
  • Những website thông tin tổng hợp, không có định hướng rõ ràng về nội dung.
  • Những cổng thông tin tích hợp.
  • Những website có giao diện nặng nề.
Ở lần cập nhật Google Panda này, Danny Sullivan tỏ ra khá bất ngờ về danh sách các website bị rớt hạng trên. Điển hình là Digg, nhưng ông cho rằng có lẽ thời hoàng kim của Digg đã hết. Thế nhưng những website như Gothamist, Techdirt, NewsBusters, PaidContent.org nằm trong danh sách cũng là những điều khá bất ngờ.
Trong danh sách này còn có website Cult Of Mac năm trước ở lần cập nhật Google Panda đầu tiên cũng đã bị ảnh hưởng mạnh nhưng sau đó họ lên tiếng phàn nàn thì được phục hồi trở lại một cách thủ công, mặc dù Google phủ nhận điều này. Và Danny cũng cho rằng có khả năng ở lần này cũng sẽ có tình trạng tương tự như vậy. Tuy nhiên, Danny cũng cho rằng khả năng những website này bị rớt hạng cũng không hẳn là do Google Panda mà là lý do khác, điển hình như lỗi Google Classified for parked domain mà mình cũng đã có bài viết gửi lên hai ngày trước.
Như vậy, ở lần thông báo việc cập nhật Google Panda vừa rồi cũng cùng thời điểm với việc Matt Cutts đưa ra lời thông báo và xin lỗi về lỗi Classified for parked domain. Điều này đã làm cho các webmaster khá lúng túng và không rõ rằng lý do chính nằm ở đâu. Theo tôi hiểu thì thuật toán Classified for parked domain này cũng nằm trong việc cập nhật Google Panda và ở lần cập nhật này bị phát sinh ra lỗi. Chính vì điểm đó mà có sự biến động lớn so với những lần cập nhật Google Panda trước đây.

Giải đáp hàng loạt các website bất ngờ bị rớt hạng


Vào khoảng ngày 20/04/2012, hàng loạt các website đang đứng ở thứ hạng cao bất ngờ bị rớt hạng. Điều này đã làm rất nhiều các webmaster trên thế giới không khỏi cảm thấy bất ngờ. Lúc đầu, ngay cả các chuyên gia còn lầm tưởng có lẽ là do Google cập nhật Google Panda phiên bản mới hoặc Google tiến hành xử phạt các website làm SEO quá liều. Tuy nhiên, ngay sau đó, Matt Cutts, người đại diện của Google giao tiếp với các webmaster đã xác nhận trên Google+ đây không phải là cập nhật Google Panda và xử phạt các website làm SEO quá liều mà là do lỗi thuật toán Classifier for parked domain.



Vậy thuật toán Classifier for parked domain là gì? Nếu bạn thường xuyên theo dõi những cập nhật của Google thông qua trang blog Inside Search thì vào tháng 12/2011 Google đã có thông báo cập nhật thuật toán này.

New “parked domain” classifier: This is a new algorithm for automatically detecting parked domains. Parked domains are placeholder sites that are seldom useful and often filled with ads. They typically don’t have valuable content for our users, so in most cases we prefer not to show them.

Hiện nay, có rất nhiều nhà đầu cơ tên miền, họ mua tên miền chỉ với mục đích mua đi và bán lại, họ không xây dựng website thật sự. Trong thời gian giữ tên miền họ tận dụng các công cụ quảng cáo cho các tên miền không sử dụng. Ngoài ra, cũng có một số người mua tên miền đẹp về giữ để khi có điều kiện thì triển khai website. Trong thời gian chưa định hướng và phát triển website được, họ cũng dùng cách đặt quảng cáo trên tên miền để thu tiền quảng cáo. Hay trong trường hợp khi nghiên cứu và phát hiện ra được từ khóa tiềm năng có nhiều lượt tìm kiếm, họ mua tên miền tương ứng với truy vấn tìm kiếm để đặt quảng cáo thu tiền.

Và theo như thông báo trên, Google cho rằng các website này không mang lại lợi ích rõ ràng cho người dùng. Do đó, Google đã cho ra thuật toán để đánh tụt hạng hoặc không hiển thị các website này trên các trang kết quả tìm kiếm.

Tuy nhiên, vào khoảng đầu tuần trước thì có lẽ do thuật toán này được cập nhật thêm và phát sinh ra lỗi khiến cho nhiều website bị đánh đồng với các loại website được mua domain và chỉ có nội dung quảng cáo. Có rất nhiều webmaster đã gửi than phiền đến Google vì có nhiều website bị giảm lưu lượng truy cập lên đến 60% chỉ trong một ngày. Ngoài ra, còn khiến khá nhiều doanh nghiệp thất thu khi xảy ra lỗi này.


Theo babywolfvn.com

Thứ Năm, 26 tháng 4, 2012

Eric Enge phỏng vấn Matt Cutts (phần 2)


Eric Enge: Hãy cùng tìm hiểu về faceted navigation. Ví dụ như, ở Zappos, người ta có thể mua giày theo số, theo cỡ, theo màu, theo nhãn hiệu và những mẫu giống nhau sẽ được thống kê theo 20 cách khác nhau. Điều đó như một bài toán đánh đố. Anh có suy nghĩ gì về trường hợp này?

Matt Cutts: Nói chung “Faceted navigation” có thể khiến nhiều người hiểu nhầm. Những người sử dụng thường không xử lý vấn đề này tốt, và trở nên mất phương hướng không biết mình đang ở điểm nào. Có thể có rât nhiều cách để lướt qua nội dung một trang. Nhưng nếu bạn muốn mỗi nội dung trang tương ứng với một URL thì cũng không phải là điều khó. Có rất nhiều cách để chia nhỏ và kiểm tra dữ liệu. Nếu bạn có thể tự quyết định cách nào là quan trọng và hữu hiệu nhất để có thể truy cập vào được nội dung thì bạn sẽ có cấu trúc riêng đối với các tham số URL.
Có thể lấy ví dụ như : Category có thể là tham số đầu tiên sau đó tới giá cả. Ngay cả khi một người đang xem qua giá cả và sau đó nhấn vào mục Catgory là điều hoàn toàn có thể làm được, chính vì thế hệ thống thứ bậc các điều bạn nghĩ sẽ được sắp xếp trong các tham số URL dưới dạng từng vị trí.
Theo cách này, loại quan trọng nhất sẽ được đặt lên đầu tiên và loại quan trọng tiếp theo sẽ được đặt ở vị trí thứ hai. Điều này có thể giúp các công cụ tìm kiếm phát hiện ra nội dung dễ dàng hơn chút ít bởi vì chúng có thể nhận ra rằng chúng có thể nhận được những nội dung hữu ích hoặc tương tự nếu chúng bỏ đi tham số cuối cùng này. Nói chung, “faceted navigation” là một vấn đề vô cùng hóc búa bởi vì bạn tạo ra rất nhiều cách khác nhau để ai đó có thể tìm được trang đó. Bạn có thể có rất nhiều đường dẫn intermediate trước khi chúng tới được sản phẩm cuối cùng.
Có lẽ sẽ dễ hiểu hơn khi sử dụng khái niệm trang intermediate, đây là một thực tiễn. Nếu một ai đó phải click qua 7 lớp của “faceted navigation” để có thể chọn được sản phẩm, họ có thể mất kiên nhẫn. Đó cũng là một điều bất bình thường trong công cụ tìm kiếm nếu chúng ta phải click qua 7 hay 8 lớp của một “faceted navigation” trước khi chúng ta có thể tìm được sản phẩm. Ở một vài trường hợp, sẽ là rất nhiều click và rất nhiều Pagerank bị chia cho những trang này mà không có một sản phẩm cụ thể nào người ta có thể mua được. Mỗi lần click là một cơ hội để một lượng phần trăm nhỏ Pagerank bị phung phí.
“Faceted navigation có thể là tốt với một số người sử dụng nếu bạn có thể quyết định những thứ bậc riêng bạn có thể phân loại các trang và cố gắng chắc chắn rằng “faceted navigation” là khá thấp. Những điều này có thể là một ứng dụng tốt giúp các công cụ tìm kiếm tìm ra được sản phẩm thực sự tốt hơn.
Eric Enge: Nếu bạn có những trang có cùng sản phẩm hoặc về bản chất là cùng một loại sản phẩm với nhiều kiểu đặt hàng khác nhau, cách sử tốt nhất là dùng “canonical tag”?
Matt Cutts: Cũng có thể như vậy, hoặc bạn cũng có thể tưởng tượng việc sắp xếp lại vị trí của những tham số theo cách riêng của bạn. Nói chung, ý tưởng về “canonical tag” được thiết kế để cho phép bạn chỉ cho các công cụ tìm kiếm rằng 2 trang nội dung là như nhau. Bạn có thể không muốn phân biệt một bản đen và một bản trắng của một sản phẩm nếu bạn có 11 màu khác nhau cho sản phẩm này. Bạn có thể chỉ muốn có một trang sản phẩm mặc định mà sau đó trang này đủ thông minh để tự chuyển đổi sang các trang khác nhau.Thể hiện những biến đổi nhỏ trong một sản phẩm và có một rel=canonical để đi tới tất cả là một cách tốt để sử dụng “rel=canonical tag”
Eric Enge: Hãy nói về những tác động đối với Pagerank, crawl và index của một vài công cụ cơ bản. Hãy bắt đầu với công cụ 301 Redirect yêu thích của chúng ta.
Matt Cutts: Nói chung 301 Redirect có thể chuyển được Pagerank. Đó có thể là một công cụ hữu hiệu để di chuyển giữa các trang trong một site, hoặc thậm chí là giữa các site. Rất nhiều người sử dụng chúng và dường như là nó hoạt động khá tốt vì nó có tác dụng dẫn tới trang cần thiết rất nhanh. Tôi dùng nó khi thử đi từ mattcutts.com tới dullest.com và quá trình chuyển đổi đó diễn ra khá nhanh. Thử nghiệm riêng của tôi đã chứng tỏ nó hoạt động khá thành công. Thực tế, nếu bạn truy cập vào site dullest.com ngay bây giờ, tôi sẽ chẳng vào được trang nào. Tất cả các trang đã di chuyển từ dullest.com tới mattcutts.com. Ít nhất đối với tôi, 301 Redirect làm việc như tôi mong muốn. Những trang yêu thích sẽ được chuyển tới một trang mới nếu như bạn truy cập trang theo kiểu chuyển trang và đó có thể là một công cụ vô cùng mạnh.
Eric Enge: Có thể nói như bạn di chuyển từ một domain này tới một domain khác và bạn tự viết một câu để hướng dẫn công cụ tìm kiếm và những người sử dụng khác để đi từ một domain này tới một domain khác. Trong những trường hợp như thế này, có một vài mất mát trong Pagerank có thể sảy ra rất đơn giản bởi vì người sử dụng thực hiện một liên kết tới một site không liên kết nó tới một tên miền mới.
Matt Cutts: Đó là một câu hỏi hay và tôi không hoàn toàn chắc chắn về câu trả lời. Tôi có thể chắc chắn biết được sự mất Pagerank như thế nào. Tôi không hoàn toàn chắc chắn đội crawl và index sẽ xử lý thế nào với Pagerank chính vì thế tôi sẽ phải kiểm tra lại trường hợp này. (Chú ý rằng: trong một email, Matt thông báo rằng đây là trường hợp xảy ra trong thực tế. Pagerank bị mất khi thực hiện Redirect 301)
Eric Enge: Hãy nói về 302 Redirect
Matt Cutts: 302 chỉ là giải pháp tạm thời. Nếu như bạn chỉ để một thứ vào một nơi trong một khoảng thời gian ngắn thì 302 là một lựa chọn thích hợp. Chúng sẽ không theo Pagerank nhưng chúng cũng có thể vô cùng hữu ích. Nếu một site chỉ làm một việc gì đó trong một khoảng thời gian ngắn, 302 có thể là một lựa chọn hoàn hảo.
Eric Enge: Thế còn Server side redirects trả về “HTTP Status Code” hoặc là “200 Status Code”?
Matt Cutts: Nếu chúng ta chỉ thấy thông báo 200, chúng tôi thừa nhận rằng nội dung trả về ở địa chỉ URL mà chúng ta yêu cầu. Nếu nhà cung cấp dịch vụ đang làm một số kiểu URL rewrite kỳ lạ trên server side, chúng ta sẽ không thể biết được.Tất cả những gì chúng ta biết là chúng ra cố yêu cầu URL cũ, chúng tôi lấy được một vài nội dung và có thể index nội dung đó. Chúng tôi sẽ index nó dưới vị trí URL nguyên gốc.
Eric Enge: Vì vậy bản chất của nó là giống như 302 đúng không?
Matt Cutts: Không hẳn là như vậy.Về bản chất, bạn đang lãng phí trên web server để trả về một trang có nội dung khác so với trang mà bạn yêu cầu. Như chúng ta quan tâm, chúng tôi nhìn thấy một liên kết, chúng tôi theo liên kết đó và chúng tôi yêu cầu nội dung. Bạn trả lại chúng tôi nội dung và chúng tôi index nội dung đó tại URL đó.
Mọi người có thể làm nhiều việc khác nhau ở trên server side. Bạn có thể tưởng tượng rằng một CMS được thực hiện trong một web server sẽ không thực hiện 301 hay 302, nhưng nó sẽ gây ra vài điều phức tạp và có thể có rất nhiều lỗi sảy ra.
Eric Enge: Anh có thể nói một cách tổng quát về canonical tag?
Matt Cutts: Có rất nhiều điều phải nhớ ở đây. Nếu bạn có thể giảm số lượng nội dung trùng lặp bằng cách sử dụng kiến trúc của site , đó là một điều nên làm. Những trang mà bạn kết nối không cần thiết phải hoàn toàn là trang trùng lặp, nhưng chúng có thể là trùng lặp về khải niệm cùng với một sản phẩm khác hoặc một thứ nào đó có quan hệ gần gũi. Chúng ta có thể thực hiện Cross – domain, rel=canonical đã công bố tháng 12.
Có thể lấy ví dụ như, tôi có thể đặt rel=canonical cho tài khoản của trường cũ để tới trang mattcutts.com của tôi. Đó là một cách tốt để sử dụng rel=canonical nếu bạn không thể vào được web server để thêm vào redirects trong bất cứ trường hợp nào. Tuy nhiên, Hầu hết mọi người sử dụng chúng cho những nội dung trùng lặp để chắc chắn rằng bản canonical của trang đó được index hơn là một vài bản khác của một trang mà bạn không muốn index.
Eric Enge: Vì vậy nếu một ai đó liên kết tới một trang có canonical tag, về bản chất liệu nó có thể đối xử giống như 301 đối với bản canonical của trang không?
Matt Cutts: Vâng, gọi đó là 301 của 1 người đàn ông nghèo nàn cũng không phải là một điều quá tệ. Nếu như web server của bạn có thể thực hiện trực tiếp 301, bạn có thể thực hiện được điều đó, nhưng nếu bạn không có khả năng truy cập được vào web server hoặc là có quá nhiều khó khăn để thiết lập 301 thì bạn có thể thực hiện rel=canonical.
Đó là một điều hoàn toàn tốt cho một trang tự liên kết sử dụng rel=canonical, và với Google thì nó thật sự hữu ích để thực hiện rel=canonical với mọi trang trong site của bạn. Mọi người nghĩ rằng nó rất tiết kiệm nhưng thật ra không hẳn là như vậy. Chúng ra tự hỏi bản thân về một trường hợp mà mỗi trang trong một site đều dùng rel=canonical. Miễn là bạn quan tâm tới việc chúng sẽ dẫn tới được đúng trang và sẽ chẳng có vấn đề gì cả.
Eric Enge: Tôi nghĩ rằng tôi đã nghe thấy anh nói trong quá khứ rằng nó hơi mạnh để thực hiện một rel=canonical Chỉ dẫn. Về bản chất anh gọi nó là một lời gợi ý.
Matt Cutts: Vâng, đội crawl muốn coi những thứ đó như một lời gợi ý và phần lớn thời gian chúng tôi sử dụng chúng cho quảng cáo. Nếu bạn gọi nó là một chỉ dẫn, thì bạn sẽ rơi vào tình trạng phải tuân theo chúng, nhưng đội crawl và index muốn giành chúng như một quyền sau cùng để quyết định nếu như mà người chủ site đang tự hại mình và không nghe theo rel=canonical tag. Phần lớn thời gian, mọi người sẽ thấy tác dụng của rel=canonical tag. Nếu chúng ta có thể nói rằng họ không có ý làm như vậy, chúng ta sẽ có thể lờ nó đi.
(còn tiếp)

Eric Enge phỏng vấn Matt Cutts (Phần 1)

Matt Cutts là kỹ sư phần mềm của Google từ năm tháng 1/2000. Trước khi làm việc cho Google, anh đã hoàn thành đề tài nghiên cứu của mình về đồ họa máy tính tại trường Đại học North Carolina ở Chapel Hill. Ngoài ra anh cũng đã tốt nghiệp thạc sỹ tại trường UNC – Chapel Hill và cử nhân toán học và canh nghệ tại trường Đại học Kentucky.


Matt là tác giả của phần mềm Safe Search là bộ lọc hữu hiệu phục vụ cho Google. Ngoài kinh nghiệm làm việc ở Google, Matt còn nắm giữ những thanh tin tối mật khi làm việc cho Bộ Quốc Phòng Mỹ và anh cũng làm việc cho một công ty game. Anh chia se rằng Google là một trong những công việc thú vị nhất của anh cho tới nay.
Hiện nay Matt đang quản lý đội Webspam cho Google. Matt nói về những vấn đề liên quan tới Webspam trên blog của mình.
Nội dung cuộc phỏng vấn
Enric Enge: Chúng ta hãy cùng tìm hiểu khái niệm “crawl budget”. Theo tôi được biết thì Googlebot sẽ đi tới các website và tính toán số lượng trang nó sẽ phải Index trong một ngày và nó sẽ rời đi khi đã hoàn thành công việc.
Matt Cutts: Tôi sẽ cố gắng nói trình bày theo một cách khác cho dễ hiểu. Điều đầu tiên chúng ta nên nhớ rằng sẽ không có bất cứ một điều nào giống như “indexation cap”. Rất nhiều người nghĩ rằng một domain chỉ được Index một lượng trang nhất định. Nhưng googlebot không hoàn toàn làm việc như thế.
“…số lượng trang mà chúng tôi Crawl tương ứng với Pagerank của trang đó”
Cũng không có một giới hạn nào cho việc crawl. Cách tốt nhất để nắm được vấn đề này là chúng ta nên hiểu số lượng trang được Index tương ứng với Pagerank. Chính vì thế nếu bạn có nhiều liên kết tới trang chủ của bạn, chúng tôi sẽ crawl trang đó. Sau đó trang chủ của bạn có thể liên kết tới rất nhiều những trang khác và những trang đó sẽ có được Pagerank. Chúng tôi cũng sẽ crawl luôn những trang đó. Tuy nhiên, khi trang của bạn càng sâu thì đồng nghĩa với việc Pagerank của bạn sẽ có xu hướng giảm xuống.

Một cách lý giải khác là những trang có Pagerank thấp trong website của bạn sẽ phải cạnh tranh với rất nhiều những trang khác có cùng Pagerank hoặc có Pagerank cao hơn. Có rất nhiều trang trong website của bạn có Pagerank rất thấp hoặc bằng 0. Những trang có nhiều liên kết thường được nhận ra và crawl khá nhanh. Những trang có Pagerank thấp có xu hướng được crawl không thường xuyên.
Một điều cũng vô cùng thú vị khi nghiên cứu thuật ngữ “crawl budget” là mặc dù không có bất cứ một giới hạn nào trong crawl nhưng vẫn có khái niệm “host load”. Host load là số lượng kết nối đồng thời mà server có thể xử lý được. Tưởng tượng rằng website của bạn chỉ có thể xử lý 1 kết nối cùng 1 lúc. Điều này chỉ cho phép googlebot lấy 1 trang tại 1 thời điểm và dẫn tới việc “host load” sẽ rất thấp. Trong khi đó có một số trang như Facebook hoặc Twitter có thể có “host load” rất cao vì cùng một lúc các website này cho phép thực hiện nhiều kết nối.
Trang của bạn có thể ở trong một host ảo với rất nhiều website khác cùng một địa chỉ IP. Về mặt lý thuyết, website của bạn sẽ bị hạn chế về số lượng trang googlebot crawl. Nếu chúng ta chỉ có thể lấy ra 2 trang từ 1 website vào một thời điểm và chúng ta chỉ có thể crawl chúng vào một thời điểm cụ thể, sẽ đặt ra một câu hỏi liệu chúng ta có thể lấy được bao nhiêu trang từ host đó.
Eric Enge: Chính vì vậy ở đây anh sẽ có hai nhân tố. Một là Pagerank, từ đây chúng ta có thể tính được số lượng trang có thể crawl được trên website. Nhưng “host load” cũng có thể ảnh hưởng tới kết quả của kết quả này.
Matt Cutts: Đúng như vậy. Cho tới nay, có một lượng lớn các website đứng ở vị trí hàng đầu mà Pagerank và những nhân tố khác có thể quyết định việc chúng ta sẽ đi sâu vào nghiên cứu website này như thế nào.Tuy nhiên “host load” cũng có thể có những ảnh hưởng nhất định với một website. Điều này dẫn tới vấn đề những nội dung trùng lặp. Tưởng tượng rằng chúng ta kiểm tra 3 trang từ 1 website và phát hiện ra rằng hai trang kia lại là bản sao của trang thứ 3. Chúng ta sẽ loại hai trang kia và chỉ giữ lại một trang. Đó là lý do tại sao nội dung của các trang có vẻ ít. Chính vì thế chúng ta có thể sẽ kiểm tra nhiều tới mức có thể từ 1 trang.
Nếu mà “host load” của bạn bị giới hạn, bạn chỉ có một lượng hữu hạn các trang đượng Crawl do giới hạn của webserver, khi bạn có những trang trùng lặp chúng tôi sẽ loại bỏ những trang đó điều này đồng nghĩa với việc bạn bỏ lỡ cơ hội có những trang có nội dung đặc biệt, chất lượng tốt được Index.
Eric Enge: Chính vì chi phí cho những trang có nội dung giống nhau sẽ lãng phí “crawl budget”.
Matt Cutts: Đúng như vậy. Có một ý kiến cho rằng nếu nếu bạn có một lượng Pagerank cụ thể, chúng tôi sẽ kiểm tra nhiều website đó. Nhưng một số trang có thể bị loại và đó là một kiểu lãng phí. Điều này cũng có thể xảy ra ở host load khi chúng ta không thể truy cập rất nhiều trang.
Eric Enge: Một khái niệm nữa mà chúng ta cần đề cập tới đó là khái niệm “link juice”. Tôi sẽ sử dụng thuật ngữ Pagerank nhưng tổng quát hơn sẽ được hiểu là “link juice”. Thuật ngữ “link juice” ở đây có thể được hiểu là có những mối liên hệ với những khái niệm như sự tin cậy và uy tín của thuật ngữ Pagerank. Khi bạn liên kết từ một trang tới trang bản sao, bạn đang lãng phí Pagerank của mình. Điều đó có đúng không?
Matt Cutts: Cũng có thể hiểu theo cách đó. Điển hình, nội dung trùng lặp không phải là một nhân tố quan trọng quyết định việc bao nhiêu trang sẽ được crawl, nhưng đó cũng là một nhân tố. Lời khuyên của tôi ở đây là nó sẽ trở nên hữu hiệu hơn nếu bạn có thể sắp xếp được cấu trúc của website. Vì sau đó bạn sẽ không phải lo lắng nhiều về vấn đề những trang có nội dung trùng lặp và những vấn đề khác đi kèm với chúng. Bạn có thể sử dụng 301 Redirects cho những URLs trùng lặp sao để gộp chúng lại vào cùng một URL. Nếu bạn không thể dùng 301 Redirect, bạn có thể dùng rel=canonincal.
Một vài người không thể kết nối được với web server để thực hiện một 301 redirect. Nguyên nhân của việc này có thể là do họ đang truy cập vào mạng của trường học, free host hoặc là một host nào đó tương tự. Nhưng nếu họ có thể xử lý nó trong cấu trúc của site, thì sau này họ có thể giải quyết nó với 301 Redirect hoặc rel=canonical.
Eric Enge: Đúng vậy, đó chắc chắn là một tiêu chuẩn vàng. Có thể hiểu là bạn có 1 trang và có 10 liên kết tới trang đó. Nếu 3 trong số những trang đó là những trang trùng lặp và bị loại bỏ thì bạn đã bỏ mất 3 cơ hội để được chúng tôi crawl.
(đối với những nội dung trùng lặp):” Chúng ta cố gắng gộp những trang đó lại hơn là loại chúng hoàn toàn”
Matt Cutts: Không cần thiết phải như vậy. Đó là một trường hợp mà chúng ta có thể thử nghiệm. Chúng ta cố gắng gộp những trang đó lại hơn là loại chúng hoàn toàn. Nếu bạn liên kết tới 3 trang có nội dung giống nhau, công cụ tìm kiếm sẽ có thể nhận ra đó là 3 trang giống nhau và chuyển link juice tới những trang đã được gộp lại này.
Đó không phải là trường hợp mà Pagerank bị lãng phí hoàn toàn. Nó phụ thuộc vào công cụ tìm kiếm và cách triển khai. Giả sử rằng các công cụ tìm kiếm đều triển khai khác nhau, nếu bạn có thể làm được việc đó trên website của bạn nơi mà các liên kết đều đi tới 1 trang duy nhất. Đó làm một điều thích hợp hơn.
Eric Enge: Anh có thể nói them về Session IDs?
Matt Cutts: Đừng sử dụng nó. Ngày nay, hầu hết mọi người sẽ có một ý tưởng hay để tạo một website mà không sử dụng Session IDs. Về điểm này, hầu hết những người sáng tạo phần mềm đều nghĩ tới, không chỉ đứng ở góc độ công cụ tìm kiếm mà còn ở góc độ của người sử dụng. Người sử dụng thường có xu hướng click vào những link đẹp và họ cũng thường có xu hướng nhớ những liên kết trông đẹp mắt hơn. Tuy nhiên Nếu bạn không thể tránh khỏi điều đó, Google sẽ cung cấp cho bạn một công cụ để giải quyết vấn đề Session IDs. Người ta vẫn có thể làm như ở trong Yahoo!, nói một cách dễ hiểu là nếu một thông số URL không có giá trị hoặc không có thông số có thể sẽ bị bỏ qua, họ sẽ viết lại chúng với một URL đẹp hơn. Google cung cấp lựa chọn này cho người dùng và sẽ rất tốt nếu chúng ta sử dụng nó. Một vài công cụ tìm kiếm khác cũng làm như thế, nhưng sẽ tốt nhất nếu bạn không phải sử dụng Session IDs.
Eric Enge: Cuối cùng, điều đó có thể dẫn tới tình trạng các nội dung trùng lặp
Matt Cutts: Đúng, chính xác là như vậy và công cụ tìm kiếm gần như có thể xử lý vấn đề này khá tốt. Những trường hợp điển hình nhất cũng không phải là vấn đề hóc búa nhưng tôi đã từng gặp một trường hợp mà ở đó rất nhiều trang với những phiên bản khác nhau được index với những Session IDs khác nhau. Với những site riêng của bạn thì bạn nên xem xét kỹ vấn đề này và bạn sẽ không phải lo ngại về việc công cụ tìm kiếm xử lý vấn đề này như thế nào.
Eric Enge: Hãy thử xem xét những chương trình liên minh (Affiliate programs). Người khác gửi cho bạn những truy cập, họ đặt cho các URL đó một tham số. Bạn giữ những tham số đó trong suốt quá trình người khác vào thăm website, đó là một điều hoàn toàn bình thường. Liệu có phải công cụ tìm kiếm sử lý vấn đề này rất tốt hoặc là sẽ xảy ra nguy cơ có những nội dung trùng lập ở đây.
Matt Cutts: Nội dung trùng lập hoàn toàn có thể xảy ra. Nếu bạn tham gia các chương trình co-brand (Sử dụng chung một thương hiệu) mà sự khác nhau giữa các trang chỉ là biểu tượng và đó là cách mà những người sử dụng dùng chúng như những trang giống nhau. Công cụ tìm kiếm tỏ ra rất hữu hiệu trong việc cố gắng gộp những trang này vào với nhau, nhưng trong một vài trường hợp vẫn xảy ra tình trạng những nội dung trùng lặp.
Eric Enge: Với những trường hợp như thế này vẫn có những giải pháp SEO kinh điển. Theo phương cách này, điều bạn thật sự cần làm là để họ đặt một tham số vào trong URL, nhưng khi người sử dụng click vào liên kết này để tới site của bạn, bạn sẽ 301 redirect họ về trang đó mà không cần tham số và để tham số đó trong cookie.
Matt Cutts: Cũng có thể làm như vậy. Điều này cũng giống như việc thuê trang để quảng cáo. Bạn có thể nghĩ tới việc tạo một trang con cho thuê quảng cáo trong một thư mục URL riêng biệt mà bạn có thể block vào robots.txt như một ví dụ. Quảng cáo hay những liên kết con chủ yếu là nhắm tới những người sử dụng thực sự chứ không phải là các công cụ tìm kiếm. Đó chính là điểm rất dễ nhận ra và bạn không phải lo lắng về việc những mã liên kết này sẽ bị rò rỉ hoặc tạo ra những nội dung trùng lặp nếu những trang này không được crawl ở phần đầu.
Eric Enge: nếu Googlebot nhận ra một chương trình chương trình liên minh (Affiliate) liệu nó có đối xử với liên kết này như quảng cáo hay một Endorsement?
(với những link Affiliate) “..Chúng tôi sẽ không đếm chúng như Endorsement
Matt Cutts: Chúng tôi muốn xử lý những kiên kết này một cách thích hợp. Nhiều thời gian đồng nghĩa với việc những liên kết này về bản chất sẽ tiêu tốn rất nhiều tiền của. Chính vì vậy, chúng tôi sẽ không đếm chúng như một endorsement.

(Còn tiếp)


Google bắt đầu phạt website SEO quá liều

Google đang thay đổi thuật toán tìm kiếm để phạt các Web spam hay "tối ưu hóa công cụ tìm kiếm (SEO) quá liều" đồng thời ưu tiên các website có nội dung chất lượng cao và ít tinh chế SEO hơn.



 
Theo dịch vụ tin tức IDG News Service, hôm qua (24/4), Google công bố một sự thay đổi về thuật toán dùng để trừng phạt các website vi phạm các hướng dẫn chất lượng của hãng và đồng thời thưởng những website tạo ra nội dung hữu ích cho người dùng chứ không phải chỉ để phục vụ cho thuật toán. Thay đổi này sẽ áp dụng từ vài ngày tới.

Đặc biệt, những thay đổi này nhằm mục đích giảm lượng nội dung mà hiển thị cao trên kết quả tìm kiếm của người dùng trên Google nhưng lại không đặc biệt có giá trị hoặc hữu ích. Những nội dung kiểu này còn bị xem là Web spam.

Matt Cutts, phụ trách về Web spam của Google, lần đầu tiên nhắc đến kế hoạch này tại hội nghị SXSW Interactive hồi tháng Ba vừa qua.

Ông Cutts cho biết thuật toán sẽ đánh giá xem liệu các trang web có "nhồi quá nhiều từ khóa trên trang, hoặc liệu chúng có trao đổi quá nhiều liên kết hoặc bất cứ điều gì họ đang làm để đi xa quá những gì một người dùng bình thường mong đợi ở một kết quả tìm kiếm cụ thể".

Google thậm chí còn nâng cao vấn đề ông Cutts đã mô tả thành "SEO quá đà". Hôm qua, hãng nhấn mạnh trong thông cáo rằng sự thay đổi thuật toán sẽ chỉ nhắm vào các hành vi vi phạm hướng dẫn của mình như "nhồi nhét từ khóa", "gian kế link".

Trong thông cáo ra ngày 24/4, Google không cho biết chi tiết về việc thuật toán sẽ phân biệt nội dung có ích với Web spam như thế nào mà chỉ nói hãng sẽ ưu tiên cho những website có nội dung thực sự hữu ích với người dùng.

Thứ Hai, 23 tháng 4, 2012

Google Instant Preview là gì?


google instant preview Giới Thiệu Về Google Instant Preview
Google instant preview

Google Instant Preview là tính năng được Google phát triển giúp người sử dụng công cụ tìm kiếm Google có thể nhanh chóng thấy được giao diện các website trong kết quả search.
Có thể khẳng định một điều chắc chắn rằng, Google là cỗ máy tìm kiếm được nhiều người sử dụng để tìm kiếm thông tin nhất hiện nay.Cho nên nếu website của bạn có một Preview đẹp, nội dung phù hợp với mong muốn tìm kiếm, sẽ nhận được rất nhiều “click’ – truy cập của người tìm kiếm thông tin.
Với một SEOer việc tăng lượng truy cập tới website là điều rất cần thiết. Hãy tận dụng Google Instant Preview để thu hút được nhiều tới website hơn.
Sau đây là một số gợi ý về Google Instant Preview cho các SEOer:
* Tạo cấu trúc, bố cục trang rõ ràng, giảm thiểu nội dung không liên quan tới chủ đề chính trang web thể hiện.
* Cố gắng tránh các trang đệm, quảng cáo pop-up, hoặc các yếu tố khác ảnh hưởng đến nội dung của bạn.Bởi những yếu tố này mất tập trung có thể được chọn trong bản xem trước của trang của bạn, làm cho ảnh chụp màn hình kém hấp dẫn.
* Bản Preview của Google không làm thay đổi thuật toán tìm kiếm và không ảnh hưởng tới thứ tự xếp hạng website của bạn . Đó là kết quả tương tự, cũng được sắp xếp theo thứ tự. Preview đẹp sẽ thu hút lượng truy cập lớn hơn vào website
* Nếu trên website của bạn sử dụng các thẻ nosnippet để không cho các bot Goolge index một đoạn thông tin nào đó trên webiste thì trong phần Preview của trang, phần nội dung đó cũng sẽ không được thể hiện.
* Có một điều lưu ý với việc tìm kiếm video hoặc flash trên Google là trang Preview của đoạn video hoặc flash này có màu đen, các chuyên gia Google cho biết thêm rằng sẽ khắc phục nhược điểm này trong thời gian sớm nhất.

Thứ Sáu, 20 tháng 4, 2012

Google chuẩn bị nâng cấp để hiểu con người hơn?


Tờ The Wall Street Journal mới đây đã đăng tải thông tin cho biết Google đang chuẩn bị cho một đợt nâng cấp quan trọng công cụ tìm kiếm, hứa hẹn sẽ có thay đổi lớn về cách thức tìm kiếm và trả lời thông tin cho người dùng. Trong vòng vài tháng tới, Google sẽ bắt đầu sử dụng thuật toán tìm theo ngữ nghĩa để phân tích từ và cụm từ, qua đó hiểu rõ hơn ý muốn của người dùng để trả về những kết quả phù hợp.

Đợt nâng cấp này có thể xem là lớn nhất, và có thể ảnh hưởng đến hàng triệu trang web vốn phụ thuộc vào thuật toán xếp hạng trang web mà Google đang sử dụng. Theo Amit Singhal, một điều hành cấp cao phụ trách mảng công cụ tìm kiếm của Google, dịch vụ của hãng sẽ đối chiếu truy vấn của người dùng với kho dữ liệu bao gồm hàng trăm triệu thực thể - từ con người, địa điểm đến đồ vật - mà Google đã thu thập trong suốt 2 năm qua. Amit đưa ra ví dụ, trước đây nếu một người dùng muốn tìm hiểu về hồ Tahoe thì kết quả trả về sẽ là trang web của cơ quan quản lý du lịch hồ, trang Wikipedia và đường dẫn đến bản đồ tương ứng. Với thuật toán mới, người dùng sẽ nhận được những thông tin liên quan đến hồ như địa điểm, độ cao, nhiệt độ trung bình và nồng độ muối.

Khi có một câu hỏi phức tạp hơn, ví dụ "Liệt kê 10 hồ rộng nhất bang California", Google sẽ trực tiếp trả lời, thay vì dẫn đến trang web khác. Amit cũng cho biết thêm thuật toán mới sẽ không thay thế hoàn toàn hệ thống tìm kiếm dựa trên từ khóa hiện nay, nó đóng vai trò như một liều thuốc để bổ sung thêm sức mạnh cho dịch vụ của Google. Công ty có trụ sở tại thành phố Mountain View hiện chiếm khoảng 66% thị phần tìm kiếm toàn cầu, và hơn 75% doanh thu quảng cáo từ dịch vụ tìm kiếm.

Nguồn: The Wall Street Journal
Girls Generation - Korean